STACKDUST
EN
تصور تقني لمعالج Jalapeño المخصص للاستدلال من OpenAI يوضح شريحة الحوسبة المركزية وست وحدات من ذاكرة HBM4 فائقة السرعة

في قلب «Jalapeño»: كيف تُهدد رقاقة OpenAI المخصصة بدقة 3 نانومتر وهيمنة HBM4 بـ 15.4 تيرابايت/ثانية عرش إنفيديا


لسنوات طويلة، ظل عنق الزجاجة في ثورة الذكاء الاصطناعي التوليدي محصورًا في عتاد التدريب (Training Compute). أما اليوم، مع هيمنة أسراب الوكلاء الأذكياء (Agentic Swarms)، والاستدلال المستمر أثناء الاختبار (Test-Time Reasoning)، وسلاسل استدعاء الأدوات المتتالية، فقد انتقلت المعركة الاقتصادية والتقنية بالكامل إلى ميدان الاستدلال (Inference). وفي فعاليات مؤتمر Hot Chips 2026 (المنعقد بين 25 و26 أغسطس)، رفعت OpenAI الستار رسميًا عن معمارية «Jalapeño» — أول معالج استدلال مخصص بالكامل (Custom ASIC) صممته الشركة من الصفر لتشغيل النماذج اللغوية الضخمة.

تم تطوير المعالج بالتعاون الوثيق مع Broadcom وتصنيعه عبر مسابك TSMC بدقة 3 نانومتر، ليمثل أجرأ خطوة هندسية تتخذها OpenAI: التخلي عن أعباء معالجات الرسوميات العامة (GPUs) لحساب حزمة سيليكونية تدمج 216 جيجابايت من ذاكرة HBM4 المتطورة بنطاق ترددي هائل يبلغ 15.4 تيرابايت/ثانية، داخل غلاف حراري لا يتجاوز 700 واط.

ما الذي حدث؟

بعد إشارات مبكرة لنيتها دخول عالم السيليكون، قدّمت OpenAI في Hot Chips أول تفكيك تقني شامل للميكرو-معمارية (Microarchitecture)، ونتائج القياسات الميدانية (Telemetry)، وخارطة طريق النشر:

  1. تصميم نقي للاستدلال (Blank-Slate Inference): على عكس معمارية Blackwell من إنفيديا (مثل B200 وGB200 وGB300) التي تضطر لموازنة مهام التدريب ومعالجة الرسوميات ودعم العمليات الرياضية العائمة FP64، جُرِّد Jalapeño تمامًا من دوائر التحكم الخاصة بالتدريب، وركّز بنسبة 100% على حوسبة المصفوفات الكثيفة وذاكرة النطاق الترددي الفائق.
  2. نظام ذاكرة فائق السرعة: تدمج الحزمة 6 مكدسات من ذاكرة HBM4 بسعة إجمالية 216 جيجابايت ونطاق ترددي مذهل يبلغ 15.4 تيرابايت/ثانية — وهو ما يكسر جدار الذاكرة (Memory Wall) الذي يقيد سرعة توليد الكلمات الرمزية (Tokens).
  3. معمارية مكانية من 64 شريحة نواة (Core Slices): قُسِّمت شريحة الحوسبة المركزية إلى 64 شريحة نواة مستقلة، تتصل كل منها مباشرة بقناة الذاكرة HBM المقابلة لها لتقليل زمن انتقال البيانات عبر الشريحة إلى الصفر تقريبًا.
  4. محرك حسابي يدعم التدرج الدقيق (Microscaling FP): تدعم وحدات التنفيذ صيغ الحساب الرياضية الدقيقة MXFP (بما في ذلك MXFP8 وMXFP6)، مما يحافظ على الاستقرار العددي لطبقات الانتباه ويقلل استهلاك ذاكرة الـ KV Cache إلى النصف.
  5. إنجاز قياسي خلال 9 أشهر بمساعدة الوكلاء: استغرقت دورة التطوير من كتابة مسودات المنطق الرقمي (RTL) وحتى مرحلة إرسال المخطط للمسبك (Tape-out) 9 أشهر فقط، بفضل استخدام أسراب من وكلاء الذكاء الاصطناعي البرمجية داخل OpenAI لتصميم المخططات وتوزيع الترددات والتحقق الأوتوماتيكي من التوقيتات.

بيانات الأداء والمقارنة مع إنفيديا Blackwell

تُظهر اختبارات الأداء المستقلة باستخدام منصة InferenceX التابعة لـ SemiAnalysis الفارق بين المعالجات المخصصة ووحدات GPU العامة:

المعيار / الخاصية رقاقة OpenAI Jalapeño (ASIC) منظومة NVIDIA Blackwell GB200 / GB300 فارق التفوق
دقة التصنيع TSMC بدقة 3 نانومتر TSMC 4NP (معدلة 5 نانومتر) / 3 نانومتر كثافة ترانزستورات أعلى
سعة الذاكرة المدمجة 216 جيجابايت HBM4 192 إلى 288 جيجابايت HBM3e / HBM4 تكامل الجيل الجديد من الذاكرة
نطاق تردد الذاكرة 15.4 تيرابايت/ثانية 8.0 إلى 12.0 تيرابايت/ثانية تفوق بنسبة +28% إلى +92%
الاستهلاك الحراري (TDP) 700 واط 1,200 إلى 1,400 واط توفير 40% إلى 50% من الطاقة
الإنتاجية لكل كيلوواط المرجع الأساسي (InferenceX) المنظومة المرجعية القياسية 1.5× إلى 1.9× إنتاجية أعلى/كيلوواط
زمن أول رمز (TTFT) تم قياسه على GPT-OSS 120B المنظومة المرجعية القياسية استجابة أسرع بـ 1.7× إلى 2.4×
زمن التوليد بين الرموز تم قياسه على DeepSeek R1 وKimi المنظومة المرجعية القياسية زمن استجابة أقل حتى 3.6×

والأهم أن الاختبارات لم تقتصر على نماذج OpenAI المغلقة، بل شملت نماذج مفتوحة المصدر رائدة مثل DeepSeek R1 وGPT-OSS 120B وKimi K2.5، مما أثبت أن المعالج هو محرك عام لتسريع المحولات (Transformers) وليس معالجًا مقيدًا بنموذج وحيد.

لماذا يهم هذا الإعلان؟

1. أزمة اقتصاديات الاستدلال والطاقة

مع تحول نماذج التفكير التوليدي (Reasoning Models) إلى التفكير المطول، وانخراط الوكلاء في مئات نداءات الأدوات لكل مهمة مستخدم (كما رأينا في منظومة Claude Agent Stack وتحقيقات أمان الوكلاء)، تضاعف عدد الرموز التوليدية بمعدلات تفوق نمو المستخدمين. لقد أصبحت الطاقة الكهربائية لمراكز البيانات — وليس توفر الرقائق فقط — هي السقف الصلب لتوسع الذكاء الاصطناعي. إن تحقيق كفاءة أعلى بـ 1.5× إلى 1.9× لكل كيلوواط يعني مباشرة خفض تكلفة تشغيل واجهات البرمجة (APIs) ومضاعفة القدرة الاستيعابية لكل ميجاواط طاقة.

2. كسر جدار الذاكرة وخفض زمن التأخير التفاعلي

في مهام توليد النصوص التفاعلية بحجم دفعة منخفض (Batch size = 1 إلى 4)، تكون المعالجات مقيدة كليًا بسرعة نقل الأوزان من الذاكرة. بفضل 15.4 تيرابايت/ثانية و64 شريحة نواة متصلة محليًا، يغذي Jalapeño وحدات الحساب بسرعات تقضي على فترات الانتظار، مخفضًا زمن التأخير بين الرموز حتى 3.6×. بالنسبة للمطورين الذين يبنون وكلاء صوتيين في الوقت الفعلي أو مساعدي برمجة داخل بيئات التطوير (IDEs)، فإن النزول تحت 15 ميلي ثانية لكل رمز يغير تجربة الاستخدام جذريًا.

3. السيادة على سلسلة التوريد وهوامش الأرباح

فرضت إنفيديا هوامش ربح تجاوزت 70% بفضل احتكارها لمنظومة CUDA والعتاد المتقدم. عبر التحالف المباشر مع Broadcom للتصميم، وTSMC للتصنيع، وCelestica لتجميع المنظومات، تحجز OpenAI خطوط إنتاج مضمونة وتستعيد هوامش البنية التحتية لحسابها الخاص.

4. سيليكون صممه وكلاء الذكاء الاصطناعي

القصة الأكثر إثارة خلف الكواليس هي سرعة الإنجاز: تسعة أشهر فقط من الصفر إلى الشريحة المطبوعة تُعد معجزة هندسية في عالم المعالجات المعقدة ذات التغليف المتقدم 2.5D. عزت OpenAI هذا الإنجاز إلى استخدام وكلاء برمجة وتحسين بالتعلم المعزز أداروا عمليات محاكاة المخططات المكانية وإغلاق التوقيتات الدقيقة بالتوازي.

تفاصيل المعمارية: 64 شريحة نواة ومحرك MXFP

تعتمد معالجات GPU التقليدية على مصفوفات تحويل مركزية (Crossbar Switches) لنقل البيانات بين وحدات الذاكرة ونوى الحوسبة، مما يستهلك جزءًا كبيرًا من طاقة المعالج في مجرد تحريك البيانات.

يعالج Jalapeño هذه المعضلة عبر معمارية الشرائح المكانية (Spatial Slicing):

  • اقتران 1:1 بين النواة والذاكرة: تنقسم الشريحة إلى 64 وحدة متطابقة. تحتوي كل وحدة على مصفوفة انقباضية ثابتة الأوزان (Weight-Stationary Systolic Array)، ووحدة معالجة متجهات، وواجهة مباشرة ملاصقة لقناة الذاكرة المقابلة.
  • تنفيذ ثابت الأوزان: أثناء توليد الرموز، تُحمَّل أوزان النموذج مرة واحدة في ذاكرة SRAM السريعة داخل النواة، بينما تتدفق المدخلات الحسابية عبرها، مما يلغي استنزاف طاقة القراءة المتكررة من ذاكرة HBM.
  • تنسيق MXFP الأصلي: بدلًا من الاكتفاء بـ FP8 التقليدي، يدعم المعالج تنسيق Microscaling الذي يشارك معامل مقياس واحد لكل 32 عنصرًا رياضيًا مع تمثيل 4 أو 6 أو 8 بت، مما يقلل حجم ذاكرة التخزين المؤقت (KV Cache) دون فقدان دقة الاستدلال في السياقات الطويلة.

ماذا يعني هذا للمطورين والمؤسسات؟

على الرغم من أن معالج Jalapeño مخصص لأسطول مراكز بيانات OpenAI السحابية ولن يُباع كبطاقات مستقلة، إلا أن تأثيره سيظهر في السوق عبر:

  • تخفيضات مرتقبة في أسعار الـ API: مع بدء نشر الخوادم في أواخر 2026 وتوسعها عبر مراكز بيانات بعدة جيجاوات في 2027، ستمتلك OpenAI هامشًا ماليًا لخفض أسعار استهلاك الرموز لنماذج مثل GPT-5.6 Sol ونماذج التفكير المستقبلية.
  • استجابة أسرع لتطبيقات الوكلاء: التطبيقات المعقدة التي تنفذ دورات تخطيط وتفكير متكررة ستعمل بسلاسة وسرعة فائقة نتيجة تقليص زمن استجابة التوليد.
  • تسارع تنويع السيليكون: مع استثمار جوجل في TPU v6 وميتا في MTIA وأمازون في Trainium وOpenAI في Jalapeño، يتجه كبار مزودي السحابة بثبات نحو التحرر من أحادية المزود التجاري.

التحديات والقيود

رغم الأرقام المبهرة، تواجه المنظومة تحديات واقعية تشمل:

  1. نضج المترجمات والبرمجيات (Software Stack): تمتلك منظومة CUDA من إنفيديا أسبقية 18 عامًا من التحسين. تحتاج OpenAI إلى تطوير مترجمات برمجية تضمن تشغيل المعماريات البحثية الجديدة بسرعة ودون كتابة أكواد منخفضة المستوى يدويًا.
  2. عقبات تصنيع وتغليف CoWoS: يتطلب دمج شريحة ضخمة مع 6 مكدسات HBM4 قدرات تغليف متقدمة تظل خاضعة لقيود السعة الإنتاجية لدى TSMC.
  3. مراحل النشر الفعلي: يبدأ النشر التجريبي في الربع الأخير من عام 2026، بينما ستدخل القدرات الضخمة بالجيجاوات حيز التشغيل خلال عام 2027.

الخلاصة

يؤرخ معالج Jalapeño لنضج هندسة الذكاء الاصطناعي وانتقالها من مجرد تجارب خوارزمية إلى تكامل عمودي كامل بين السيليكون والمترجمات والنماذج العصبية. إن امتلاك سيليكون استدلال مخصص بهذه الكفاءة هو السلاح الأساسي لخفض تكلفة الذكاء الاصطناعي وجعله متاحًا على مدار اللحظة لكل مطور ومؤسسة.


المصادر


المقال التاليبروتوكول MCP يتخلى عن الجلسات: ماذا يعني إصدار 2026-07-28 لخوادمك؟المقال السابقOpenAI تنشر القصة الكاملة لاختراق وكلائها لـ Hugging Face — وتحقيق METR المستقل يؤكد التفاصيل