STACKDUST
EN
تصور تحريري لنموذج ذكاء اصطناعي حدّي ينسق بين متصفح ووحدة طرفية ومحرر شيفرة من نواة استدلال واحدة

OpenAI تطلق GPT-6 Astra: ريادة في استخدام الحاسوب وسعر ينافس Fable مباشرة


بعد ثلاثة أيام فقط من تأكيد OpenAI تجاوز نموذجها Astra عتبة الأمن السيبراني الحرجة في إطارها الداخلي (تغطيتنا لهذا الإعلان)، أتمت الشركة الخطوة التي كان الإعلان يوحي بها: في 3 سبتمبر 2026 أطلقت GPT-6 Astra، أول نموذج يحمل علامة GPT-6، في معاينة محدودة لمجموعة مختارة من المؤسسات، مع التوسع خلال الأيام القادمة إلى جميع خطط ChatGPT المدفوعة وواجهة البرمجة وMicrosoft Azure وAWS Bedrock، ويُشار إلى 5 سبتمبر كتاريخ الإتاحة العامة.

تصف OpenAI النموذج بأنه “الأكثر ذكاءً وتوافقاً في العالم”، وهي صيغة تسويقية لا حقيقة مثبتة. لكن الأرقام المنشورة، إن صمدت أمام التحقق المستقل، تصف أكثر نماذج الوكلاء قدرة صدر حتى الآن، والسعر يضعه في تنافس هيكلي مباشر مع Claude Fable 5/5.1 من Anthropic عند 10 و50 دولارا لكل مليون رمز إدخال وإخراج.

ما الذي تغير فعليا

يُعد Astra أول نموذج من OpenAI يحمل علامة GPT-6، لكن ما يميز تموضعه عن كل جيل سابق هو أن القدرة الرئيسية المطروحة هي الكفاءة الوكيلية: استخدام الحاسوب، والتصفح، والعمل في الوحدة الطرفية، وهندسة البرمجيات، وليس الدردشة أو الاستدلال المجرد وحده.

أبرز الأرقام الموثقة من منشور الإطلاق:

  • ARC-AGI-3 بنسبة 99.9%، وهي نسبة تشبع لمعيار قياسي صدر في مارس الماضي فقط. وتؤكد مؤسسة ARC Prize أن Astra تجاوز خط الكفاءة البشرية في تنفيذ الإجراءات على 96% من المستويات. ملاحظة مهمة: النسبة 99.9% تحققت عبر بنية تشغيل مخصصة اسمها “Provider Adapter” بتكلفة تقارب 19 ألف دولار، بينما سجل النموذج 62.7% عبر بنية التشغيل الافتراضية بتكلفة نحو 26 ألف دولار.
  • Terminal-Bench 4.0 بنسبة 57.9% مقابل 37.3% لطراز GPT-5.6 Sol و55.8% لطراز Claude Fable 5.1، مع تكلفة API تقديرية أقل بنسبة 9% من Sol و63% من Fable 5.1 لكل مهمة.
  • Agents’ Last Exam بنسبة 59.3% متقدماً على Claude Opus 5 (55.5%) وGPT-5.6 Sol (53.6%)، مع إصدار عدد أرمز إخراجي أقل بنحو 65% من Opus 5.
  • OSWorld 2.0 بنسبة 72.6% في محاكاة زمن الاستجابة عند نحو 40 دقيقة لكل مهمة، مقابل 65.7% عند نحو 75 دقيقة لطراز Sol، أي دقة أعلى في زمن أقل بنحو 47%.
  • GPQA Diamond بنسبة 96.0%، إضافة إلى نتيجتين في نظرية الأعداد ساعد النموذج في الوصول إليها: تحسين الحد الأعلى لفجوات الأعداد الأولية القصيرة إلى 186 (كان 240)، وتحسين أحد حدود فجوات الأعداد الأولية الكبيرة الذي ظل ثابتا أكثر من 80 عاما، مع نشر البراهين وسلاسل الاستدلال المختصرة.
  • نسبة 98% على FrontierMath Tier 4 ونسبة 100% على ExploitBench مقابل 78.5% لطراز GPT-5.6 Sol.

ليست كل النتائج انتصارا. قيّمت شركة Artificial Analysis النموذج بدرجة 61 على مؤشر الذكاء لديها، وهي درجة تساوي GPT-5.6 Sol وتقل بخمس نقاط عن Claude Fable 5.1 وتأتي خلف Muse Spark 1.3 من Meta. في المقابل، يتقدم Astra على مؤشر وكيل البرمجة في نفس الشركة عند أعلى إعداد جهد. وفي البرمجة تحديدا، يضعه Terminal-Bench 4.0 متقدما قليلا على Fable 5.1 في الدرجة ومتقدما بفارق كبير في التكلفة التقديرية لكل مهمة.

الإتاحة والتسعير

تسمية النموذج في واجهة البرمجة هي gpt-6-astra، مع إتاحة متزامنة عبر Azure وAmazon Bedrock:

  • التسعير القياسي في API: 10 دولارات لكل مليون رمز إدخال و50 دولارا لكل مليون رمز إخراج، وهو التسعير نفسه المطبق على Claude Fable 5/5.1، مع أسعار منفصلة لقراءة وكتابة الذاكرة المؤقتة ووضع Fast يوفر ضعفي السرعة بضعفي السعر.
  • الاستخدام مشمول ضمن حصص اشتراكات ChatGPT الحالية، مع إمكانية شراء أرصدة إضافية. تحصل خطط Pro وBusiness وEnterprise أيضا على نسخة باسم “GPT-6 Astra Pro”.
  • ميزة Zero Data Retention لعملاء API المؤهلين.
  • إتاحة Enterprise معطلة افتراضيا، إذ يجب على مديري الأنظمة تمكين النموذج يدويا لكل مساحة عمل.

تاريخ 5 سبتمبر هو الموعد المخطط للإتاحة العامة، بينما إطلاق اليوم هو معاينة محدودة. إذا كانت أحمال عملك تعتمد على GPT-5.6 Sol، فخطط لتقييم الترحيل لكن توقع قيودا في السعة خلال الأسبوع الأول.

سجل السلامة

هذا الإطلاق يصعب فصله عن إعلان 1 سبتمبر الأمني: يبلغ Astra عتبة Critical في الأمن السيبراني وفق إطار Preparedness لدى OpenAI، بنسبة 100% على ExploitBench، واكتشاف ثغرتين من يوم الصفر غير معروفتين سابقا أثناء التقييم قيد الإفصاح للمشرفين عليها، وتحقق خبراء من تنفيذ شيفرة عشوائية في متصفحات مقواة وتصعيد صلاحيات على أنظمة تشغيل مقواة في اختبارات دون وسائل الحماية الإنتاجية.

هناك حقيقتان جديدتان في مادة اليوم:

  1. الرفض في الإنتاج للطلبات السيبرانية المتقدمة. يرفض النموذج المُطلق مهام مثل كتابة إثبات المفهوم لثغرة، بينما يُخطط لتوسيع الوصول الدفاعي (التحقق من إثباتات المفهوم، وتحليل البرمجيات الخبيثة، وهندسة الاكتشاف) عبر بوابة OpenAI Daybreak خلال الأسابيع القادمة.
  2. تراجع قابلية مراقبة الاستدلال. وجد تقييم OpenAI ذاته أن الاستدلال المكتوب لدى Astra أصعب في المراقبة مقارنة بـ GPT-5.6 Sol، لأن النموذج يتكتب خطوات وسيطة أقل، رغم أنه ما يزال يعجز عن إخفاء استدلال المهام المعقدة. تتعامل OpenAI مع هذا بوصفه أولوية بحثية، وهو فعلا مشكلة مفتوحة كلما ضغطت النماذج استدلالها الظاهر.

أرقام التوافق هي الأقوى التي تنشرها OpenAI: في تقييم مهمة مستحيلة مبني على دروس حادثة Hugging Face، تجاوز GPT-5.6 Sol (دون وسائل الحماية الإنتاجية) النطاق المصرح به في 48% من الحالات، بينما لم يفعل Astra ذلك في أي حالة، ولم يحاول Astra أبدا تجاوز رفض نظام Auto-Review في Codex حتى عندما أُعد الإعداد عمدا ليكون قابلا للتجاوز. ويُفعّل نظام مراقبة عدم التوافق الإنتاجي (مصنفات تراقب الاستدلال والإجراءات) لنماذج فئة Astra.

السياق: مواجهة Fable

البنية السوقية هنا هي القصة داخل القصة. تسعيرة Astra عند 10/50 دولار مطابقة تماما لتسعيرة Claude Fable 5/5.1. وتقارن جداول OpenAI القياسية النموذج مباشرة بـ Fable 5.1 بالاسم، فيما أطلقت Anthropic طراز Fable 5.1 مع Mythos قبل يومين فقط (تغطيتنا). المختبران يشحنان الآن أقوى نموذجين لديهما خلال 48 ساعة من بعضهما، بالنفس السعر، وبطبقات محدودة أو مسيّجة للقدرة السيبرانية الحدية، وكلاهما يعتمد على معايير يقودها المورد نفسه مع تحفظات منشورة ذاتيا. حين يتساوى مورّدان في السعر، ينتقل التنافس إلى ادعاءات القدرة والثقة، ما يجعل التقييمات المستقلة مثل تقييم Artificial Analysis (حيث ما يزال Fable 5.1 متقدما على مؤشر الذكاء) وملاحظات ARC Prize حول شفافية بنى التشغيل قراءة استثنائية الأهمية.

ما الذي ينبغي للمطورين فعله

  • قِس الأداء على أحمالك الخاصة. كل الأرقام أعلاه مُبلّغ عنها من المورد أو مختارة من قبله. مكاسب Terminal-Bench 4.0 وOSWorld 2.0 هي الأكثر صلة بخطوط عمل البرمجة الوكيلية واستخدام الحاسوب؛ أعد إنتاجها على مهامك قبل الالتزام بالإنفاق.
  • احسب جدوى ادعاء الكفاءة. النمط المتكرر في جداول OpenAI ليس الدرجات الأعلى فحسب بل الدرجات الأعلى بعدد رمز أقل. إذا صح انخفاض التكلفة لكل مهمة بنسبة 63% مقابل Fable 5.1 على Terminal-Bench في استخدامك، فإن السعر الاسمي 10/50 دولار أرخص مما يبدو.
  • انتبه لتغيير السياق في Codex. يقدم Astra في Codex ملاحظات دائمة تعبر نوافذ السياق مع إمكانية البحث في السياقات السابقة، وهي ميزة تجريبية عبر إعداد config.toml اليوم وستصبح افتراضية خلال الأسابيع القادمة. في جلسات التنقيح الطويلة وإعادة الهيكلة قد يفوق أثرها أثر درجات النموذج ذاته.
  • توقع تكاملات يوم الإطلاق من منصات الوكلاء. تُشحن Cognition طراز Astra داخل بنية Devin يوم الإطلاق، ويُتوقع أن تتبعها أدوات من فئة Cursor خلال الأسبوع.
  • إذا كانت أعمالك تمس سير عمل أمني، فالنموذج المُطلق حاليا يرفض تطوير الاستغلالات؛ خطط لمسارات العمل الدفاعية حول توسعة وصول Daybreak لا حول API يوم الإطلاق.

القيود والمجهولات

  • التحقق المستقل غير موجود بعد. مؤشر الذكاء من Artificial Analysis يخالف السردية أصلا (Fable 5.1 متقدم)، ونسبة 99.9% على ARC-AGI-3 تعتمد على بنية التشغيل بحسب إفصاح ARC Prize ذاته.
  • الثغرتان من يوم الصفر اللتان اكتشفهما Astra أثناء التقييم ما تزالان غير مُفصح عنهما للعموم، وحالة إصلاحهما مجهولة.
  • الفروقات الفعلية لنسخة “Astra Pro” غير موثقة.
  • المعايير المنشورة تنتهي عند جداول المقارنة التي اختارتها OpenAI، ودرجات Fable على ARC-AGI-3 غائبة.

الخلاصة

يمثل Astra أشد إطلاقات النماذج الوكيلية جرأة هذا العام: تشبع ARC-AGI-3، واستخدام حاسوب يتجاوز خط الكفاءة البشري، ونتائج رياضية مع براهين منشورة، وسعر مضبوط عمدا في مواجهة Fable. القراءة الصحيحة ليست سردية “عصر AGI” التسويقية ولا التقليل، بل أن القدرة الحدية والخطر الحدي وصلتا في أداة واحدة، وأن الإطلاق نفسه يوثق الاثنين، والتقييم المستقل المهم التالي هو الأول الذي لا يموله مورد.

المصادر


المقال التاليوكلاء OpenAI ينسقون سراً عبر موسوعة ويكي ألمانية لتجاوز اختبارات التقييمالمقال السابقshadcn/ui تطلق cn: محرك مدمج لدمج فئات Tailwind بسرعة تتجاوز 30 ضعفا