
vLLM 0.28.0: تحسينات عميقة لـ Kimi-K3 وDeepSeek V4 وانفصال مؤلم عن bitsandbytes
محرك الاستدلال الأشهر في العالم المفتوح أصدر نسخته الثامنة والعشرين: vLLM v0.28.0 بتاريخ 26 أغسطس 2026 — 584 commit من 270 مساهمًا (76 جديدًا عليهم). القائمة الطويلة، لكن ثلاث ركائز تبرز: دفعة أداء شاملة لـ Kimi-K3، ودعم كامل لـ DeepSeek V4، وتغييرات كاسرة ستؤثر مباشرة على من سيترقى ومتى.
الدفعة الكبرى: Kimi-K3
الجهود موزعة على كل الطبقات: دعم Decode Context Parallel (DCP)، وأنوية fused مدمجة لفك التشفير والملء المسبق في FlashKDA، ودعم تنشيط SiTU لـ MegaMoE، وتجميع عمليات all-gather بتسريع على مستوى الأنوية بين 1.5× و3×، وموازنة تخمينية تكيفية تحسّن TTFT على منصات DSpark بنحو 60%، وخيار تقسيم الخبير المشترك يوفر ~17 جيبيبايت من الذاكرة لكل GPU. وKimi-K3 صار يعمل أيضًا على AMD ROCm عبر Model Runner V2.
DeepSeek V4 يجتاز المسار كاملًا
Sparse MLA صار يعمل من البداية إلى النهاية — فك تشفير عادي، وMTP، وفك تخميني عبر DSpark — وهو أساس الأداء العملي لنماذج انتباه DeepSeek المتناثر. يرافقه دعم AMD Quark NVFP4، وخرائط مطالبات reasoning-effort، وتحسينات أنوية الفهرس المتناثر، وتضييق نواطق CUDA graphs في وضع eager، وتمكين ROCm على معماري gfx11 وgfx950.
ثلاث تحسينات تخدم الجميع
- فك التخميني (Speculative Decoding): DFlash2 الجديد بلف محلي ومُنتقي مرشحين، وجدولة تحقق بالثقة في DSpark، وتفعيل الجدولة غير المتزامنة تلقائيًا لنماذج المسودة.
- نقل KV المتدرج إلى القرص: طبقة ثانية للذاكرة على القرص مع مديري طبقات خارجيون عبر
module_path، ومقاييس tiering مدمجة. عمليًا: سياق أطول بنفس ذاكرة HBM. - نضوج Model Runner V2: تفكيك E/P/D، ونقل الأوزان للذاكرة الخارجية، ودعم KV cache متعدد الطبقات لـ MTP، وقابلية
thinking_token_budget.
التغييرات الكاسرة — اقرأ قبل الترقية
- bitsandbytes خرج من النواة إلى إضافة خارجية — التحميل الافتراضي عبر
pip install vllmلن يشمل دعم بتحديد الكم بعد الآن. - Transformers ارتقى إلى 5.15.0 — بيئات مقيدة النسخ ستحتاج تنسيقًا.
- حُذف
calculate_kv_scalesالمهمل، وحُذفoverride_attention_dtypeبالكامل. - الافتراضات الجيدة المرافقة:
max_num_batched_tokensتضاعف من 8192 إلى 16384، وتخزين الملاحظات السابقة مفعّل افتراضيًا لنماذج Mamba، وارتفاع سقف التقاط CUDA graphs على Blackwell إلى 1024.
إذا كانت بيئتك تعمل بـ quantization عبر bitsandbytes أو تعتمد سلوك الافتراضات القديمة، هذه ليست ترقية «ثبّت وانطلق» — ثبّت الإضافة المرافقة وراجع معايير الأداء بعد الترقية.
دعم نماذج جديد
قائمة قصيرة لكنها معبرة: Muse Glimmer من Meta، وLing 3.0 Flash مع MTP ومحلل مدمج ونسخة FP8 وخبراء MXFP4 هجينة، وDots3 NOTE متعدد الوسائط، وInterns2mobius. ولأجهزة AMD: تمكين Qwen3.8 على ROCm وأنوية MTP مدمجة لـ Qwen3.5 GDN.
ماذا يفعل مشغل النماذج؟
- ثبّت حسب البنية لديك: العجلات الرسمية على CUDA 13.0 وCUDA 12.9 وROCm 7.2.2، وصور Docker لكل معمارية — بما فيها
vllm/vllm-openai-cpuوXPU. - اختبر قبل الاعتماد: القيم الافتراضية المتغيّرة (
max_num_batched_tokens، وprefix caching لـ Mamba) قد تغيّر بصمة الذاكرة وسلوك الإنتاجية، لا فقط سرعته. - خطط لتقسيم الخبير المشترك إن كنت تشغّل Kimi-K3 — 17 جيبيبايت لكل GPU فارق عملي بين عقدة تعمل وأخرى لا تعمل.
- راقب المشهد: الإصدار يصل مع تصاعد جدي في تخصيص المحركات للنماذج الجديدة (Kimi-K3 وHy4 preview وLing 3.0) — النافذة بين صدور النموذج ودعمه الكامل في vLLM تتقلص بوضوح.