
Qwen3.8-Flash-Next: علي بابا تفتح معمارية الجيل القادم Qwen4
أطلق فريق Qwen التابع لعلي بابا نموذج Qwen3.8-Flash-Next بأوزان مفتوحة، لكن الغرض منه غير معتاد لإصدار بحجم رائد: هو موجود أساسًا ليكشف معماريته الخاصة. فبدلًا من ترقية اعتيادية لرقم الإصدار، يُقدَّم Qwen3.8-Flash-Next صراحةً كمعاينة تجريبية للتصميم الذي سيقوم عليه Qwen4 — ونشر الفريق الأوزان الكاملة (125 مليار معلمة) على Hugging Face لأي شخص لفحصها أو تشغيلها أو ضبطها الدقيق (Fine-tuning).
ما الذي حدث؟
نشرت Qwen النموذج في 26 أغسطس 2026، مرفقًا بتقرير تقني وأوزان مفتوحة على Hugging Face وModelScope، بترخيص qwen-community-1.0. وفي الإعلان نفسه، أكد الحساب الرسمي لـ Qwen عن منتج مرتبط لكنه مختلف: Qwen3.8-Flash (بدون “-Next”)، وهو نسخة إنتاجية “مبنية على Qwen3.8-Flash-Next بميزات إنتاجية إضافية” — نافذة سياق افتراضية أكبر تصل إلى مليون رمز، وأدوات مدمجة رسميًا — ستُطرح كنموذج مُدار عبر منصة QwenCloud بسعر 0.16 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج.
هذان حالتا إطلاق مختلفتان تمامًا، والخلط بينهما يشوّه ما هو متاح فعليًا اليوم:
- Qwen3.8-Flash-Next — أوزان مفتوحة، متاحة الآن، قابلة للتنزيل والاستضافة الذاتية.
- Qwen3.8-Flash — النسخة الإنتاجية عبر الـ API — مُعلَنة بسعر محدد، لكنها لم تُطلَق بعد. منشور Qwen الرسمي يقول إن نقطة نهاية QwenCloud “ستكون متاحة قريبًا”.
بطاقة النموذج (Model Card) واضحة في تأطيرها البحثي: هذا الإصدار “يُرقّي بشكل منهجي أربعة محاور — الانتباه، البقايا، التضمين، والتحسين — لتحسين قدرة النموذج مع زيادة كفاءة الحساب وسعة النموذج واستقرار التدريب.” قراءته كمعاينة لمعمارية Qwen4 لا كمنتج تجاري نهائي هي القراءة الصحيحة.
لماذا يهم؟
نموذج MoE بأثر تفعيل صغير فعليًا. يحمل Qwen3.8-Flash-Next 125 مليار معلمة إجمالية، لكن ينشّط منها 6 مليارات فقط لكل رمز — إضافة إلى جدول تضمين N-gram منفصل بـ 51 مليار معلمة، ووحدة تنبؤ متعدد الرموز (Multi-Token Prediction) بـ 4 مليارات معلمة تُستخدم أثناء التدريب فقط. بالنسبة لمن يستضيف النموذج ذاتيًا، عدد المعلمات النشطة هو ما يحدد تكلفة الاستدلال ومتطلبات العتاد، وليس الإجمالي الكبير.
تدريب أرخص بشكل لافت. تذكر Qwen أن النموذج استغرق نحو تُسع (1/9) حجم حسابات تدريب Qwen3.7-Plus فقط، مع تفوق في مهام البرمجة والإنتاجية المكتبية — وهذا ادعاء عن كفاءة التدريب، لا تكلفة الاستدلال، لكنه ذو دلالة إن صمد أمام التدقيق المستقل.
المعمارية تحوّل حقيقي، لا تجديد تسويقي للاسم. أعيد بناء أربعة أنظمة فرعية من جيل Qwen3 السابق، مفصّلة أدناه، وتضعها Qwen كقالب لـ Qwen4 لا كتجربة معزولة.
تفكيك المعمارية: أربعة أنظمة فرعية أُعيد بناؤها
1. الانتباه — Gated DeltaNet + Qwen Sparse Attention (QSA)
يستبدل النموذج الانتباه التقليدي بمزيج هجين: Gated DeltaNet (GDN)، وهي آلية انتباه خطي (Linear Attention) تضغط السياق التاريخي بكفاءة (48 رأس خطي لـ V، و16 لـ QK، ببعد 128 لكل رأس)، مقترنة بـ Qwen Sparse Attention (QSA) — 24 رأس استعلام، ورأسي مفتاح-قيمة، ببعد 256 — التي تستخدم مفهرسًا خفيفًا ومضغوطًا لاختيار السياق المهم. القرار التصميمي الجوهري: يعمل QSA على مستوى الكتلة الصغيرة (micro-block) لا على تقييم كل رمز على حدة، ما يقلّص عبء التوجيه الذي تدفعه عادةً مخططات الانتباه المتناثر على مستوى الرمز. الترميز الدوراني للموضع (RoPE) يعمل بـ 64 بُعدًا عبر 48 طبقة محوّل.
2. البقايا (Residual) — Gated Residual
اتصال بقايا (Residual Connection) موزّع على 4 فروع، مع رتبة عنق زجاجة (Bottleneck Rank) بـ 320 بُعدًا، يحل محل الاتصال التقليدي — بهدف منح الشبكة تحكمًا أدق في تدفق المعلومات بين الطبقات.
3. التضمين (Embedding) — جدول بحث N-gram
جدول بـ 51 مليار معلمة يُفهرس ثنائيات وثلاثيات الرموز (Bigrams/Trigrams) عند الطبقة الثانية، ما يوسّع سعة النموذج بحساب إضافي ضئيل — وهي معلمات خارج نطاق الـ 6 مليارات النشطة وخارج خبراء MoE الموجَّهين، لكنها تسهم في القدرة التمثيلية في كل تمريرة أمامية.
4. التحسين (Optimization) — Muon وAdamW بلا إحماء تدريجي للدفعات
يوزّع التدريب فئات الأوزان بين مُحسِّنَي Muon وAdamW، بضبط دقيق حول دقة التعامد (Orthogonalization) وكيفية تقسيم المعلمات المدمجة بينهما. كما ألغت Qwen مرحلة الإحماء التدريجي لحجم الدفعة (Batch-Size Warmup) المعتادة، والانطلاق مباشرة بحجم الدفعة المستهدف — تغيير تنسبه الشركة إلى “قوانين توسّع مُعاد ضبطها” مستخلَصة من عملية التدريب هذه.
تحت هذه الركائز الأربع يقبع نظام MoE بـ 512 خبيرًا، يوجّه 10 خبراء + خبير مشترك واحد لكل رمز (ببُعد وسيط 640 لكل خبير) — وهي الآلية التي تُبقي 6 مليارات فقط من أصل 125 مليار معلمة إجمالية نشطة في أي تمريرة أمامية.
نافذة السياق وتحذير حقيقي
يأتي Qwen3.8-Flash-Next بنافذة سياق (Context Window) أصلية تبلغ 262,144 رمزًا، قابلة للتمديد إلى مليون رمز عبر تحجيم YaRN لـ RoPE. بطاقة النموذج تشير إلى مفاضلة حقيقية هنا: تحجيم YaRN ثابت (Static)، وهو ما قد يضعف الأداء على النصوص القصيرة مقارنة بنموذج مضبوط خصيصًا لذلك الطول. إن كان عبء عملك قصير السياق في الغالب، فمن المفيد قياس ذلك فعليًا قبل افتراض أن ميزة السياق الطويل مجانية.
المعايير — تُقرأ كأرقام ذاتية التقرير
يذكر التقرير التقني لـ Qwen، من بين أرقام أخرى: DeepSWE 1.1 بـ 58.7، وSWE-bench Pro بـ 62.5، وGPQA Diamond بـ 91.7، وLiveCodeBench v6 بـ 91.9 على الجانب اللغوي؛ وClawEval-MM بـ 64.4 (pass@3)، وAndroidWorld بـ 84.5، وMathVision بين 90.6 و95.7 (مع وبدون سلسلة التفكير) على الجانب متعدد الوسائط. هذه أرقام قياس Qwen نفسها، بإعدادات تقييمها الخاصة — تُعامَل كما يستحق أي معيار من صانع النموذج: مؤشر اتجاهي، لا حكم مستقل مثبت. وكما حدث مع إطلاق GLM-5.3-Flash ونموذج الرؤية من DeepSeek، فإن الأوزان المفتوحة تعني أن المجتمع يمكنه، وغالبًا سيقوم، بإعادة تشغيل هذه الاختبارات بشكل مستقل خلال أيام.
كيف تجربه عمليًا؟
الأوزان مدعومة بالفعل عبر أبرز أدوات الاستضافة الذاتية: SGLang، وvLLM، وHugging Face Transformers، وllama.cpp، وMLX، وUnsloth، مع نسخ مُكمَّمة (Quantized) — منها NVFP4 وGGUF — ظهرت من المجتمع بالفعل. ونظرًا لإجمالي 125 مليار معلمة، فإن تشغيل النموذج الكامل ما زال يتطلب عتادًا متعدد وحدات المعالجة الرسومية (GPU) أو ذاكرة كبيرة، رغم أن 6 مليارات معلمة فقط تُنشَّط لكل رمز — إذ لا بد أن يُخزَّن جدول N-gram والخبراء غير النشطين في مكان ما بالذاكرة أو يُدار بكفاءة عبر منصة الاستدلال.
أما بالنسبة للاستدلال المُدار دون استضافة ذاتية، فالمسار المُعلَن هو واجهة QwenCloud بمجرد إطلاق Qwen3.8-Flash، بالسعر المُعلَن 0.16/0.47 دولار لكل مليون رمز — وهو ما يستحق مقارنته بمشهد أسعار الـ API الذي غطيناه في تقرير أسعار الواجهات البرمجية بمجرد أن تُفتح تلك الواجهة فعليًا.
القيود
- المعايير مُقدَّمة من الشركة نفسها. لا توجد بعد تقييمات مستقلة عند نشر هذا المقال.
- تحجيم YaRN الثابت يضحّي ببعض جودة السياق القصير مقابل التمديد إلى مليون رمز.
- وضع التفكير (Thinking Mode) مفعّل افتراضيًا، ما يضيف زمن استجابة وتكلفة رموز إضافية لكل رد ما لم يُعطَّل صراحة.
- واجهة الـ API الإنتاجية لم تُطلَق بعد. سعر 0.16/0.47 دولار مُعلَن، وليس شيئًا يمكن التعامل معه فعليًا حاليًا.
- الترخيص هو qwen-community-1.0، وليس ترخيصًا مفتوحًا تصريحيًا (Permissive) مثل MIT أو Apache — راجع بنوده مقابل حالة استخدامك قبل النشر التجاري، خصوصًا على نطاق واسع.
ماذا يفعل المطور الآن؟
إن كنت تتابع اتجاه معمارية نماذج علي بابا، فهذا الإصدار هو أوضح إشارة متاحة قبل إطلاق Qwen4 نفسه — اقرأ التقرير التقني، لا عدد المعلمات فقط. وإن كنت تقيّمه للاستخدام الفعلي، استضف الأوزان المفتوحة ذاتيًا على حمولة عملك الحقيقية قبل الالتزام بميزانية لطبقة الـ API التي لم تُطلَق بعد، وتعامل مع ادعاءات “تُسع تكلفة التدريب” والمعايير كفرضيات تحتاج اختبارًا، لا حقائق مستقرة.