
DeepSeek تضيف الرؤية إلى نموذجها الاقتصادي: V4-Flash-Vision-Exp متاح تجريبيًا على المنصة
بعد أشهر من بقائها خارج سباق الرؤية في الفئة الاقتصادية، أطلقت DeepSeek في 21 أغسطس 2026 نموذج DeepSeek-V4-Flash-Vision-Exp — أول نموذج قادر على قراءة الصور في فئة Flash لديها. الإطلاق تجريبي (Experimental) عبر اسم النموذج deepseek-v4-flash-vision-exp على منصة الـ API مباشرة.
ما الذي حدث؟
النموذج الجديد يبقى مطابقًا لـ V4-Flash في قدرات النصوص — الاستدلال، الوكلاء، المعرفة العامة — ويضيف طبقة الرؤية فوقها. ادعاء الشركة الأساسي: في معايير الوكلاء متعددة الوسائط حقق النموذج قفزة كبيرة عن V4-Flash واقترب أداؤه من Claude Opus 4.8. الأرقام تفصيلية ومنشورة في التدوينة الرسمية، وهي — كالعادة — قياسات صانع النموذج.
الجانب العملي هو ما يميز هذا الإطلاق تحديدًا:
- تسعير غير تقليدي للصور: كل صورة تُحتسب حتى 384 رمزًا فقط، وبسعر V4-Flash النصي نفسه. للمقارنة: كثير من المنافسين يحتسبون الصور بمئات إلى آلاف الرموز حسب الدقة. بمعنى: قراءة صورة تكلف تقريبًا كما تكلف فقرة نصية.
- ثلاث طرق لإدخال الصور: Base64 داخل الطلب، أو رابط خارجي، أو الرفع مسبقًا إلى Files API ثم الإشارة إليه بـ
file_id. - Files API مجانية وأطلقت مع النموذج نفسه: ارفع الصورة مرة واحدة وأعد استخدامها عبر الطلبات دون إعادة إرسال.
- توافق واسع: يدعم Chat Completions وMessages وResponses API — أي أن الكود الحالي المبني على صيغة OpenAI يحتاج تعديل
modelوإضافة كتلة الصورة فقط.
تجربة سريعة
from openai import OpenAI
client = OpenAI(api_key="...", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{"role": "user", "content": [
{"type": "text", "text": "استخرج بيانات هذا الفاتورة إلى JSON"},
{"type": "image_url",
"image_url": {"url": "data:image/jpeg;base64,<BASE64>"}},
]}],
)
print(response.choices[0].message.content)
الصيغ المدعومة: JPEG وPNG وGIF وWebP، ويُكتشف النوع من محتوى الملف لا من امتداده. الحد الأقصى لحجم طلب البيانات المضمّنة 48 ميغابايت.
لماذا يهم؟
المعنى الاستراتيجي أعمق من ميزة جديدة: DeepSeek كانت آخر ملاعب الفئة الاقتصادية الكبرى بدون رؤية. الآن دورة “نموذج نصي رخيص + وكلاء + رؤية” مكتملة لديها، والمنافسة المباشرة تقع على وكلاء معالجة المستندات ولقطات الشاشة — وهي أكثر الأحمال تكرارًا في الإنتاج فعليًا. وحين تكون كل صورة 384 رمزًا بسعر Flash، تصبح أحمال مثل معالجة آلاف الفواتير شهريًا قابلة للحساب بسهولة: التكلفة تقترب من تكلفة النص المجرد.
إذا كنت تستخدم V4-Flash في وكلاء اليوم، فالانتقال إلى النسخة البصرية لا يغيّر شيئًا في منطق النصوص — فالنموذج “مطابق” في القدرات النصية وفق الشركة — ويفتح لك باب الواجهات البصرية دون ترحيل.
القيود — اقرأها قبل الاعتماد
- حالة تجريبية صريحة: الاسم ينتهي بـ
-Exp، أي أن السلوك والأسعار قد يتغيران دون سابق طويل. لا تبنِ مسارًا إنتاجيًا حرجًا عليه بعد. - 384 رمزًا سعر جيد لكنه سقف تفاصيل: الصور عالية الكثافة (مستندات مضغوطة، لوحات تحكم معقدة) قد تفقد دقة القراءة مقارنة بنماذج رؤية تحتسب بدقة أعلى.
- “قريب من Opus 4.8” ادعاء البائع: انتظر القياسات المستقلة قبل ترسيخ المقارنة.
ماذا يفعل المطور الآن؟
جرّب النموذج على ثلاث عينات من حمولتك الفعلية: فاتورة، لقطة شاشة من تطبيقك، ورسم بياني. قِس دقة الاستخراج والتكلفة الفعلية للرموز. إن كانت النتائج مقبولة، فأنت لديك أرخص طبقة رؤية متاحة حاليًا للوكلاء — مع خطة بديلة جاهزة يوم تخرج النسخة المستقرة أو يتغير السعر.