STACKDUST
EN
الصورة الرسمية من مدونة جوجل لإطلاق Agentic Video Understanding بأسلوب Gemini الأزرق

جيميناي يفهم الفيديو كوكيل: النموذج يشاهد ما يحتاج فقط — استهلاك أقل بـ 88% من التوكنات


أطلقت جوجل يوم 1 سبتمبر 2026 خاصية Agentic Video Understanding (فهم الفيديو الوكيلي) لنماذج Gemini 3.7 Flash و3.6 Flash و3.5 Flash-Lite، وهي متاحة فوراً عبر Gemini API (في واجهتي Interactions وGenerateContent) وفي Google AI Studio وعلى منصة Gemini Enterprise Agent Platform — لكل من الفيديوهات المرفوعة وروابط YouTube.

التغيير يستبدل افتراضاً قديماً: السحب الثابت للإطارات. حتى اليوم كان إدخال الفيديو يعني استخراج الإطارات بمعدل ثابت (1 إطار في الثانية) وحشوها في السياق بمرور واحد. في الوضع الوكيلي (Agentic)، يتنقل النموذج في الخط الزمني للفيديو ديناميكياً — يطلب النصوص أو الإطارات أو المسارات الصوتية عند الحاجة بناءً على ما يتطلبه الطلب فعلاً، ثم يعدّل معدل الإطارات والدقة أثناء التنفيذ.

الأرقام

من إعلان جوجل الرسمي وسجل تغييرات الـ API:

  • توكنات أقل بـ 88% على المحتوى الطويل مقارنة بالمعالجة الثابتة.
  • تكلفة أقل بـ 66% على تحليل المحتوى الطويل.
  • جودة أعلى بـ ~7% على المحتوى الطويل.
  • قدرات جديدة تنسبها جوجل صراحة لهذا النمط: استرجاع اللحظات بدقة أقل من الثانية، وكشف شذوذ (Anomaly Detection) أدق، وعدّ أدق.
  • بدون رسوم إضافية للخاصية — تسعير توكنات Gemini API القياسي هو المطبق، فينعكس التوفير مباشرة على الفاتورة.

الادعاء بـ 88% بديهي بمجرد فهم الآلية: فيديو ساعتان بالمعالجة الثابتة يعني نحو 7,200 إطار سواء كان سؤالك عن دقيقة واحدة منه أم لا. الوضع الوكيلي يتيح للنموذج تصفّح النص أولاً، وتحديد المقطع المعني، ثم سحب إطارات عالية الدقة من هناك فقط. سقف 88% خاص بالمحتوى الطويل؛ والمقاطع القصيرة سترى فروقاً أصغر بكثير — ولهذا يوصي دليل جوجل نفسه ببقاء الوضع الثابت للاستعلامات الحساسة للزمن على مقاطع أقل من ~5 دقائق، أو عند الحاجة لدقة موحدة على كامل المقطع.

كيف تُفعّلها؟

يُضبط وضع المعالجة لكل مدخل فيديو. من إعلان جوجل:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "ما أهم ثلاث إعلانات في هذا المؤتمر؟",
        },
    ],
)

print(interaction.output_text)

توصية الدليل العامة: ابدأ بالوضع الوكيلي عند تحسين الجودة أو كفاءة التوكنات، وعُد للوضع الثابت مع الأحمال القصيرة الحساسة للزمن أو عند حاجة أخذ عينات موحدة. هذه هي الصلة المباشرة لقدرة Agentic Vision السابقة — التي جمعت تنفيذ الكود مع الفهم الأصيل للصور — لكنها مطبقة على أدوات الفيديو الأصلية في Gemini.

لماذا هذا «الحذاء الثاني» في تسلسل منطقي؟

الإطلاق هو النقطة المنطقية لنمط واضح في سجلات تغييرات Gemini الأخيرة. تحليل الوسائط بالذكاء الاصطناعي يتصارع على الرؤية نفسها: عندما يقرر النموذج ما ينظر إليه — بدلاً من خط معالجة مسبق يقرر عنه — تتحسن الدقة والتكلفة معاً. السياق من تغطياتنا السابقة:

  • أعمال Agentic Vision السابقة لدى جوجل أسست النمط للصور: تنفيذ كود مع فحص انتقائي يتفوق على السحب الموحد.
  • إطلاق Gemini 3.5 Transcribe (26 أغسطس) نقل فهم الصوت إلى نماذج مخصصة مع تمييز المتحدثين وطوابع زمنية على مستوى الكلمة — وهو نوع الأداة التي يستدعيها نظام فيديو وكيلي لقراءة المسار الصوتي عند الطلب.
  • Gemini Omni 1.1 Flash في نسخته العامة (27 أغسطس) مدّ كومة الفيديو من جهة التوليد بمهام التمديد والاستيفاء.

كان الفيديو آخر وسائط يبقى فيها افتراض السحب القسري. بهذا الإصدار يعامل النموذج الفيديو كما يعامل الوكيل نظام الملفات: فهرس يُستعلم عنه، لا كتلة تُبتلع.

الانتشار الأوسع — وزاوية YouTube

ملاحظتا توزيع من الإعلان تتجاوزان حدود الـ API:

  1. تطبيق Gemini: الخاصية ستصل «قريباً» لكل المستخدمين عبر نموذجي Flash وFlash-Lite في التطبيق الاستهلاكي.
  2. YouTube: في الأشهر المقبلة ستشغّل خاصية فهم الفيديو الوكيلي ميزة Ask YouTube في صفحة المشاهدة — إجابات مسنودة تُحسب من المرئيات الفعلية للفيديو. هذه إشارة جودة جوهرية للخاصية: YouTube أضخم مكتبة فيديو على الأرض، وهذه الخطوة تضع محرك فهم فيديو عالي الكفاءة تحت سطح الأسئلة والأجوبة فيها.

للمطورين الذين يبنون على الفيديو اليوم — تحليلات المراقبة، البحث في المحاضرات، أرشيفات الاجتماعات، مراقبة الوسائط، تحليل الرياضة — الإجراء الفوري هو مراجعة المواضع التي تحرق فيها المعالجة الثابتة التوكنات على المدخلات الطويلة، واختبار خيار processing: "agentic" على تلك المسارات تحديداً. سجل التغييرات يذكر دعم واجهتي Interactions الأحدث وGenerateContent المستقرة، فكلا نمطي التكامل مغطى.

قيود تستحق الانتباه: النسب الرئيسية خاصة بالمحتوى الطويل ومن تقارير جوجل؛ توقع فروقاً أصغر بكثير على المقاطع القصيرة. دعم النماذج محدود حالياً بعائلة Flash الثلاثة — لم يُعلن دعم لطبقة Pro. والتنقل الوكيلي يدفع زمن استدعاءات الأدوات ثمناً لتوفير التوكنات، فالأحمال فائقة السرعة على المقاطع القصيرة قد تفضل الوضع الثابت.

المصادر


المقال التاليذكاء اصطناعي يكتشف 6 ثغرات CVE في curl حيث عاد مختبران حدّيان بلا شيء — والخط المرجعي كان منشوراً مسبقاًالمقال السابقإطلاق Claude Fable 5.1 وMythos 5.1: قراءة الكاش بربع السعر وثلاث كسور API يجب معرفتها