
Gemini 3.5 Transcribe وTranscribe Live: جوجل تستبدل Chirp بنموذجين لمعالجة الصوت والتنقيح الدلالي الذكي
أعلنت شركة جوجل رسميًا إحالة نظام Chirp 3 الصوتي القديم إلى التقاعد، مستبدلة إياه بنموذجين متخصصين تم بناؤهما مباشرة على البنية التحتية متعددة الوسائط لعائلة نماذج Gemini: نموذج gemini-3.5-transcribe المخصص لمعالجة الملفات الصوتية المسجلة مسبقًا، ونموذج gemini-3.5-transcribe-live الموجه للبث التدفقي ثنائي الاتجاه منخفض زمن الاستجابة عبر بروتوكول WebSockets.
يمثل هذا الإطلاق نقلة جوهرية عن نماذج التعرف التلقائي على الكلام (ASR) التقليدية؛ فبدلاً من الاكتفاء بمطابقة الأصوات (Phonemes) بالحروف الأبجدية، يستفيد المحرك الجديد من النمذجة التسلسلية العميقة أثناء مرحلة فك الترميز (Decoding) لتنفيذ تنقيح دلالي فوري (Semantic Normalization)، يعالج التراجعات والتعديلات الكلامية اللحظية للمتحدث، ويزيل ترددات التلعثم اللغوي تلقائيًا قبل إنتاج النص النهائي.
البنية الهندسية الثنائية للنماذج
لتجنب المفاضلة بين دقة المعالجة المجمعة (Batch) وسرعة الاستجابة اللحظية (Streaming)، فصلت جوجل الحل إلى مسارين تقنيين مستقلين:
| الخاصية / المعيار | gemini-3.5-transcribe (المعالجة المجمعة) |
gemini-3.5-transcribe-live (البث الحي) |
|---|---|---|
| حالات الاستخدام الأساسية | الملفات المسجلة، الاجتماعات المؤرشفة، البودكاست | الإملاء الفوري، وكلاء الصوت التفاعليون، الترجمة الحية |
| بروتوكول النقل | REST / gRPC (v1beta/models) |
WebSockets (v1alpha/live) |
| معدل خطأ الكلمات (WER) | 2.6% | 4.0% |
| تحديد المتحدثين (Diarization) | مدمج تلقائيًا حتى 3 متحدثين (speaker_0…) |
معالجة أحادية المسار على شكل كتل مجزأة |
| الطوابع الزمنية للكلمات | دقة متناهية بالمللي ثانية للبداية والنهاية | طوابع مرحلية للفرضيات التراكمية |
| انحياز المفردات المخصصة | مدعوم عبر قائمة custom_vocabulary |
مدعوم أثناء مصافحة الجلسة الأولية |
| تغطية اللغات | أكثر من 85 لغة مع التعرف التلقائي | أكثر من 85 لغة مع التعرف التلقائي |
التنقيح الذكي: المعالجة الدلالية أثناء فك الترميز
الابتكار الأكثر إثارة في Gemini 3.5 Transcribe هو ما تطلق عليه جوجل النسخ الصوتي الذكي (Smart Transcription). في الأنظمة التقليدية، تتطلب إزالة الكلمات الزائدة تصدير النص الخام إلى نموذج لغوي منفصل أو استخدام قواعد برمجية معقدة. أما في Gemini 3.5، فتتم هذه المعالجة لحظيًا داخل حلقة فك الترميز.
1. المعالجة الفورية للتراجع والتصحيح الذاتي
عندما يغير المتحدث رأيه أثناء سياق الحديث، يدرك النموذج المقصد النهائي ويخرج الصيغة المصححة فقط:
- الصوت المنطوق: “دعنا نحدد موعد الاجتماع يوم الثلاثاء—لا، أقصد الخميس الساعة الثالثة عصرًا.”
- المخرجات التقليدية (ASR):
دعنا نحدد موعد الاجتماع يوم الثلاثاء لا أقصد الخميس الساعة الثالثة عصرا - مخرجات Gemini 3.5 Transcribe:
دعنا نحدد موعد الاجتماع يوم الخميس الساعة 3:00 عصرًا.
2. التخلص التلقائي من التردد والتلعثم
تُحذف أصوات التردد وعلامات التلعثم اللغوي (مثل: “أممم”، “يعني”، التكرار غير المقصود) تلقائيًا:
- الصوت المنطوق: “نحن، أممم، لاحظنا أن، يعني، زمن الاستجابة ارتفع بعد النشر.”
- مخرجات Gemini 3.5 Transcribe:
لاحظنا أن زمن الاستجابة ارتفع بعد النشر.
[!NOTE] وضع النص الحرفي (Verbatim Mode): في البيئات القانونية، والتحقيقات الجنائية، والتدقيق الطبي حيث يُشترط توثيق كل صوت وتلعثم بدقة متناهية، يمكن للمطورين تمرير المعامل
"transcription_mode": "VERBATIM"لتعطيل الفلترة الدلالية وتدوين الكلام حرفيًا كما نُطق.
الأداء القياسي والاختبارات الميدانية
توضح بيانات جوجل انخفاض زمن الاستخراج النهائي للنص بنسبة 70% مقارنة بنظام Chirp 3 السابق:
- الدقة الفائقة: سجل نموذج المعالجة المجمعة معدل خطأ بالكلمات بلغ 2.6%، متفوقًا على Whisper large-v3 في المقاطع الصوتية الحوارية المشوشة.
- زمن استجابة البث: يحقق اتصال WebSockets متوسط زمن استجابة للكلمات الجزئية قدره 180 مللي ثانية، مع تثبيت المقطع النهائي في أقل من 450 مللي ثانية من انتهاء النطق.
- الكشف التلقائي متعدد اللغات: يدعم النموذج التحول التلقائي بين أكثر من 85 لغة بما فيها اللغة العربية بدقة تشكيل ودمج المصطلحات التقنية المعربة والإنجليزية.
دليل التكامل البرمجي للمطورين
1. المعالجة المجمعة للملفات (gemini-3.5-transcribe)
تتيح واجهة REST إرسال الملفات الصوتية المشفرة بترميز Base64 مع تحديد معايير التجزئة والمفردات المتخصصة:
POST /v1beta/models/gemini-3.5-transcribe:generateContent
Content-Type: application/json
{
"contents": [
{
"parts": [
{
"inline_data": {
"mime_type": "audio/mp3",
"data": "<BASE64_ENCODED_AUDIO>"
}
}
]
}
],
"generation_config": {
"audio_transcription_config": {
"diarization_enabled": true,
"max_speakers": 3,
"enable_word_timestamps": true,
"custom_vocabulary": [
"Kubernetes",
"eBPF",
"GraphQL",
"Model Context Protocol"
]
}
}
}
وتُرجع الاستجابة كائنات مهيكلة مفصولة حسب هوية المتحدث:
{
"candidates": [
{
"content": {
"parts": [
{
"speaker_tag": "speaker_0",
"text": "هل قمنا بالتحقق من نقاط نهاية بروتوكول سياق النموذج (MCP)؟",
"start_time": "0.120s",
"end_time": "2.450s"
},
{
"speaker_tag": "speaker_1",
"text": "نعم، بيانات القياس عن بُعد عبر eBPF تعمل بكفاءة.",
"start_time": "2.600s",
"end_time": "4.800s"
}
]
}
}
]
}
2. البث المباشر الحي (gemini-3.5-transcribe-live)
للتطبيقات التفاعلية، يتم إنشاء مقبس اتصال مستمر (WebSocket) عبر Gemini Live API:
import WebSocket from "ws";
const ws = new WebSocket(
"wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=" + API_KEY
);
ws.on("open", () => {
// 1. بدء الاتصال وتحديد النموذج
ws.send(JSON.stringify({
setup: {
model: "models/gemini-3.5-transcribe-live",
generationConfig: {
responseModalities: ["TEXT"]
}
}
}));
});
// 2. ضخ حزم الصوت بترميز PCM 16kHz
function streamAudioChunk(pcmBuffer) {
ws.send(JSON.stringify({
realtimeInput: {
mediaChunks: [{
mimeType: "audio/pcm;rate=16000",
data: pcmBuffer.toString("base64")
}]
}
}));
}
// 3. استقبال النصوص الحية المفرغة
ws.on("message", (data) => {
const response = JSON.parse(data.toString());
if (response.serverContent?.modelTurn?.parts) {
const text = response.serverContent.modelTurn.parts[0].text;
console.log("النص المفرغ:", text);
}
});
التطبيقات الميدانية والأنظمة المستفيدة
تم دمج النموذج فعليًا داخل منظومة منتجات جوجل:
- تطبيق Rambler على أندرويد: تشغيل محرك الإملاء الصوتي النظامي مع إظهار النص المنقح فور التحدث.
- تطبيق Gemini على macOS: تولي الإدخال الصوتي متعدد الوسائط في الوقت الحقيقي.
- الوكلاء الأذكياء متعددو الوسائط: بناء حلقات محادثة صوتية كاملة (Full-Duplex Voice Loops) دون الحاجة لخوادم وسيطة لتحويل الصوت إلى نص.
مسار الترحيل من Chirp 3: ما يجب على المطورين مراعاته
- جدول إيقاف Chirp 3: ينبغي لمستخدمي Cloud Speech-to-Text v2 المعتمدين على Chirp 3 بدء الترحيل إلى
gemini-3.5-transcribeللاستفادة من تحسين السرعة بنسبة 70% وخفض نسبة الأخطاء. - توحيد الفوترة: تخضع نماذج Gemini 3.5 الصوتية لنموذج التسعير الموحد لرموز ومعالجة Gemini API بدلاً من حساب الدقائق القديم.
- سقف تحديد المتحدثين: يدعم المحرك المدمج حتى 3 متحدثين في نفس الجلسة. وتبقى الجلسات الكبيرة (أكثر من 3 متحدثين) بحاجة لطبقات تجميع وتصنيف صوتي إضافية.