STACKDUST
EN
مخطط OpenRouter يُظهر تصدر ox-alpha (الاسم التجريبي لـ GLM-5.3-Flash) بأكثر من 23 تريليون رمز

GLM-5.3-Flash: ذكاء يقترب من Opus 4.8 بعُشر التكلفة — وأوزان مفتوحة بترخيص MIT


في خطوة تعيد ترتيب سباق النماذج المفتوحة، أطلقت شركة Z.ai نموذج GLM-5.3-Flash، وهو أول نموذج متعدد الوسائط natively في سلسلة GLM-5. الخلاصة الرقمية سريعة: 320 مليار معلمة إجمالية، 18 مليار معلمة نشطة فقط، نافذة سياق (Context Window) بمليون رمز، وأوزان منشورة فعليًا على Hugging Face تحت ترخيص MIT. الشركة تصف الأداء بأنه «يقترب من Claude Opus 4.8 في معايير البرمجة والوكلاء، بتكلفة تعادل العُشر».

ما الذي حدث؟

أعلنت Z.ai عن النموذج في 26 أغسطس 2026 في تدوينة رسمية عنوانها “GLM-5.3-Flash: Frontier Intelligence, Flash Cost”، ورفعته إلى منصتها البرمجية مباشرة. لكن الحكاية الأكثر إثارة حدثت قبل الإعلان: اختبرت الشركة النموذج بشكل مجهول تحت الاسم الرمزي ox-alpha على منصتي OpenRouter وOpenCode، حيث تصدّر قائمة النماذج الأكثر استخدامًا في أسبوعه الأول — ومعالجة 23.2 تريليون رمز على OpenRouter أي 2.3 ضعف النموذج التالي، و43 تريليون رمز على OpenCode. والأهم من ذلك كله: هذه الحركة كلها، وفق الشركة، خدمت على رقائق ذكاء اصطناعي صينية.

بعد أيام قليلة من الإطلاق، نُشرت الأوزان الكاملة على Hugging Face بترخيص MIT — وهو نقطة فارقة، لأن إطلاق GLM-5.3 الكامل (غير Flash) في 14 أغسطس جاء بدون أوزان، مع وعد بنشرها لاحقًا بعد فحوصات السلامة. النسخة Flash وصلت بالأوزان من اليوم الأول.

لماذا يهم؟

ثلاثة أسباب تجعل هذا الإطلاق أهم من إصدار نموذج عادي:

أولًا، اقتصاديات عمل الوكلاء (Agents). عبء العمل النموذجي لعامل برمجي آلي يعني ملايين الرموز لكل مهمة. نموذج يقترب من أداء الفئة الأم per-task بعُشر التكلفة يغيّر حساب الجدوى بالكامل للمشاريع التي تشغّل وكلاء على نطاق واسع. النقطة التي تطرق لها إعلان Z.ai: النموذج دفع حدود Pareto في مؤشر Artificial Analysis Intelligence Index (الإصدار v4.1.1) بنتيجة 57 نقطة عند 0.045 دولار للمهمة — مستوى ذكاء كان متاحًا سابقًا بتكلفة أعلى بعشر مرات تقريبًا، وفق أرقام الشركة نفسها.

ثانيًا، الفجوة بين النموذج المفتوح والمغلق تضيق فعلًا. في جدول المعايير الرسمي، يقترب GLM-5.3-Flash من Claude Opus 4.8 في عدة محاور: على Z.ai Code Bench (مشغّلًا داخل Claude Code 2.1.207 وبأقصى جهد reasoning) سجل 29.0 مقابل 29.5 لـ Opus 4.8، وتفوق عليه في DeepSWE v1.1 (63.4 مقابل 58.0) وAutomationBench (48.8 مقابل 41.0). هذه أرقام الشركة، ويلزم التعامل معها بحذر منهجي — لكنها متسقة مع الاستقبال المجتمعي الصاخب لـ ox-alpha قبل الكشف.

ثالثًا، الترخيص. MIT تعني: استخدم، عدّل، أدمج في منتج تجاري، بلا قيود عملية. للحكومات والشركات والمختبرات التي تريد ملكية كاملة لبنيتها التحتية للذكاء الاصطناعي، هذه أقوى نقطة في القصة.

ما الجديد تقنيًا؟

النموذج يبدأ من قاعدة مدرّبة حديثًا وليس نسخة مصغرة من GLM-5.3، مع إعادة تصميم معمارية كبرى:

  • انتباه هجين (Hybrid Attention): للمرة الأولى في السلسلة، يجمع النموذج بين الانتباه الخطي (Linear Attention) لالتقاط الاعتماديات المحلية عبر نمذجة الحالة، والانتباه المتناثر (Sparse Attention) لاسترجاع السياق العالمي عبر مفهرس خفيف. النتيجة المعلنة مقارنة بـ GLM-5.3: خفض حسابات الانتباه بمقدار 3.0 أضعاف وحجم KV cache بمقدار 4.4 أضعاف.
  • mHC (Manifold-Constrained Hyper-Connections): تقنية لتحسين كفاءة التوسع.
  • عدد طبقات أقل بكثير: 45 طبقة مقابل 92 في GLM-4.5 رغم تقارب العدد الإجمالي للمعلمات.
  • تدريب متعدد الوسائط من الصفر: مسبق التدريب على 30 تريليون رمز تشمل النصوص والصور والفيديو — النموذج يقرأ لقطات الشاشة والمستندات ولوحات التحكم كصور مباشرة، وهو ما يجعله مناسبًا لسيناريوهات computer use.

استخدام النماذج في OpenCode: ox-alpha في المركز الأول بأسبوعه الأول

الأرقام المهمة — ومن قاسها

جدول Z.ai الرسمي يضم مقارنات مع DeepSeek-V4-Vision-Exp وGPT-5.6 Terra وGemini 3.7 Flash وOpus 4.8. أبرز ما يستحق التثبيت (كلها من قياسات الشركة):

المعيار GLM-5.3-Flash GLM-5.2 Claude Opus 4.8
Terminal Bench 2.1 84.3 81.0 85.0
DeepSWE v1.1 63.4 46.2 58.0
AutomationBench v1.0.6 48.8 26.2 41.0
Toolathlon Verified 78.4 59.9 76.2

تنبيه منهجي واجب: هذه معايير ينشرها صانع النموذج نفسه، بإعدادات تقييم يحددها هو. ليست مؤامرة، لكنها ليست حكمًا محايدًا أيضًا. النقاط التي يتراجع فيها النموذج أمام المنافسين موجودة في الجدول نفسه — مثل NL2Repo (56.3 مقابل 69.7 لـ Opus 4.8) ومعايير الفيديو (MVBench 77.8 مقابل 82.2 لـ Gemini 3.7 Flash) — وهذا بحد ذاته مؤشر صحة نسبي للجدول.

كيف تجربه عمليًا؟

ثلاثة مسارات جاهزة اليوم:

# عبر Ollama (نسخة مستضافة سحابيًا بصفر احتفاظ بالبيانات)
ollama run glm-5.3-flash:cloud

للتشغيل المحلي الذاتي، الأوزان على Hugging Face مدعومة في SGLang وvLLM وTransformers وKTransformers. أما عبر الـ API فالتوثيق الكامل في مركز مطوري Z.ai، والنموذج متاح أيضًا ضمن أدوات الوكلاء الشهيرة — Ollama يدرجه كخيار جاهز داخل Claude Code وOpenCode وغيرهما.

القيود

  • معايير البائع: حتى تظهر نتائج مستقلة (مثل ليفادير المجتمعي أو Artificial Analysis المستقل)، تعامَل المقارنات مع Opus 4.8 كمطالبة تسويقية قوية وليست حقيقة مثبتة.
  • الفجوات الحقيقية موجودة: الاستدلال البصري على الفيديو والمستودعات الضخمة (NL2Repo) ما زالا مجالَي تفوق للمنافسين.
  • حجم النموذج: 320 مليار معلمة إجمالية ليست “Flash” بمعنى التشغيل على اللابتوب — التوفير الحقيقي في التكلفة السحابية وفي عدد المعلمات النشطة، لا في متطلبات العتاد المنزلي.

ماذا يفعل المطور الآن؟

إن كنت تبني على وكلاء برمجيين، خصّص ساعة لتجربة النموذج على حمولتك الفعلية: نفس المهام، نفس الـ harness، وقارن التكلفة لكل مهمة منجز — لا المعايير المعلنة. الفارق الذي يهم هو دولار لكل وحدة عمل، وهنا تحديدًا يدّعي GLM-5.3-Flash تفوقه. وإن كانت منظمتك تبحث عن أساس مفتوح لبناء قدرات داخلية، ترخيص MIT مع أوزان كاملة يجعل هذا النموذج مرشحًا طبيعيًا للقائمة المختصرة.

Sources


المقال التاليوكلاء Claude يدخلون مرحلة الإنتاج: توفر عام لـ computer use وbrowser use وSkills API وFiles APIالمقال السابقأهلاً بك في STACKDUST