STACKDUST
EN
نتائج معايير DeepSeek الرسمية لمقارنة V4-Flash-Vision-Exp مع النماذج المنافسة

DeepSeek تضيف الرؤية إلى نموذجها الاقتصادي: V4-Flash-Vision-Exp متاح تجريبيًا على المنصة


بعد أشهر من بقائها خارج سباق الرؤية في الفئة الاقتصادية، أطلقت DeepSeek في 21 أغسطس 2026 نموذج DeepSeek-V4-Flash-Vision-Exp — أول نموذج قادر على قراءة الصور في فئة Flash لديها. الإطلاق تجريبي (Experimental) عبر اسم النموذج deepseek-v4-flash-vision-exp على منصة الـ API مباشرة.

ما الذي حدث؟

النموذج الجديد يبقى مطابقًا لـ V4-Flash في قدرات النصوص — الاستدلال، الوكلاء، المعرفة العامة — ويضيف طبقة الرؤية فوقها. ادعاء الشركة الأساسي: في معايير الوكلاء متعددة الوسائط حقق النموذج قفزة كبيرة عن V4-Flash واقترب أداؤه من Claude Opus 4.8. الأرقام تفصيلية ومنشورة في التدوينة الرسمية، وهي — كالعادة — قياسات صانع النموذج.

الجانب العملي هو ما يميز هذا الإطلاق تحديدًا:

  • تسعير غير تقليدي للصور: كل صورة تُحتسب حتى 384 رمزًا فقط، وبسعر V4-Flash النصي نفسه. للمقارنة: كثير من المنافسين يحتسبون الصور بمئات إلى آلاف الرموز حسب الدقة. بمعنى: قراءة صورة تكلف تقريبًا كما تكلف فقرة نصية.
  • ثلاث طرق لإدخال الصور: Base64 داخل الطلب، أو رابط خارجي، أو الرفع مسبقًا إلى Files API ثم الإشارة إليه بـ file_id.
  • Files API مجانية وأطلقت مع النموذج نفسه: ارفع الصورة مرة واحدة وأعد استخدامها عبر الطلبات دون إعادة إرسال.
  • توافق واسع: يدعم Chat Completions وMessages وResponses API — أي أن الكود الحالي المبني على صيغة OpenAI يحتاج تعديل model وإضافة كتلة الصورة فقط.

تجربة سريعة

from openai import OpenAI

client = OpenAI(api_key="...", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{"role": "user", "content": [
        {"type": "text", "text": "استخرج بيانات هذا الفاتورة إلى JSON"},
        {"type": "image_url",
         "image_url": {"url": "data:image/jpeg;base64,<BASE64>"}},
    ]}],
)
print(response.choices[0].message.content)

الصيغ المدعومة: JPEG وPNG وGIF وWebP، ويُكتشف النوع من محتوى الملف لا من امتداده. الحد الأقصى لحجم طلب البيانات المضمّنة 48 ميغابايت.

لماذا يهم؟

المعنى الاستراتيجي أعمق من ميزة جديدة: DeepSeek كانت آخر ملاعب الفئة الاقتصادية الكبرى بدون رؤية. الآن دورة “نموذج نصي رخيص + وكلاء + رؤية” مكتملة لديها، والمنافسة المباشرة تقع على وكلاء معالجة المستندات ولقطات الشاشة — وهي أكثر الأحمال تكرارًا في الإنتاج فعليًا. وحين تكون كل صورة 384 رمزًا بسعر Flash، تصبح أحمال مثل معالجة آلاف الفواتير شهريًا قابلة للحساب بسهولة: التكلفة تقترب من تكلفة النص المجرد.

إذا كنت تستخدم V4-Flash في وكلاء اليوم، فالانتقال إلى النسخة البصرية لا يغيّر شيئًا في منطق النصوص — فالنموذج “مطابق” في القدرات النصية وفق الشركة — ويفتح لك باب الواجهات البصرية دون ترحيل.

القيود — اقرأها قبل الاعتماد

  • حالة تجريبية صريحة: الاسم ينتهي بـ -Exp، أي أن السلوك والأسعار قد يتغيران دون سابق طويل. لا تبنِ مسارًا إنتاجيًا حرجًا عليه بعد.
  • 384 رمزًا سعر جيد لكنه سقف تفاصيل: الصور عالية الكثافة (مستندات مضغوطة، لوحات تحكم معقدة) قد تفقد دقة القراءة مقارنة بنماذج رؤية تحتسب بدقة أعلى.
  • “قريب من Opus 4.8” ادعاء البائع: انتظر القياسات المستقلة قبل ترسيخ المقارنة.

ماذا يفعل المطور الآن؟

جرّب النموذج على ثلاث عينات من حمولتك الفعلية: فاتورة، لقطة شاشة من تطبيقك، ورسم بياني. قِس دقة الاستخراج والتكلفة الفعلية للرموز. إن كانت النتائج مقبولة، فأنت لديك أرخص طبقة رؤية متاحة حاليًا للوكلاء — مع خطة بديلة جاهزة يوم تخرج النسخة المستقرة أو يتغير السعر.

Sources


المقال التاليClaude in Chrome متاحًا رسميًا: متصفحك صار بيئة عمل للوكلاءالمقال السابقوكلاء Claude يدخلون مرحلة الإنتاج: توفر عام لـ computer use وbrowser use وSkills API وFiles API