أعلنت Google عن Gemini 3.5 Transcribe، وهو نموذج لتحويل الكلام إلى نص لا يهدف إلى نسخ التسجيل كلمةً بكلمة فحسب، بل إلى تحويل الحديث العفوي والمتقطع إلى نص منسّق وأكثر سلاسة. وتقول الشركة إنه نموذجها الأكثر دقةً لتحويل الكلام إلى نص حتى الآن، وتقدّمه بوصفه خطوة كبيرة إلى الأمام مقارنةً بنموذج Chirp 3 السابق.
1
12
لكن هذه القفزة تحمل مفاضلة مهمة: فالنظام الذي يحذف كلمات مثل «آه» و«همم»، ويدمج التصحيحات أثناء الكلام، ويستنتج ما أراده المتحدث، قد ينتج كتابةً أفضل، لكنه قد يحافظ بدرجة أقل على الصياغة الأصلية الدقيقة.
ما الذي يغيّره Gemini 3.5 Transcribe؟
يعتمد النموذج على ما تسميه Google «التفريغ الذكي». وبدلاً من الإبقاء على كل تردد أو جملة مبتورة في النتيجة النهائية، يستطيع تنظيف عثرات الكلام، واعتماد تصحيح المتحدث، وإضافة علامات الترقيم، وتطبيق التنسيق. كما يمكنه تنفيذ أوامر تحرير صوتية وتحويل الكلام غير المنظم إلى نثر أسهل قراءة.
1
8
12
وهذا يجعله مناسباً خصوصاً للاستخدامات اليومية، مثل الإملاء الصوتي، وتدوين الملاحظات، وكتابة الرسائل، وملء النماذج. يستطيع المستخدم التحدث في صورة أفكار متفرقة أو عبارات محادثية، ثم الحصول على نص أقرب إلى مسودة جاهزة بدلاً من تفريغ خام يحتاج إلى تحرير طويل.
وتقول Google إن النموذج يتعامل أيضاً مع الضوضاء الخلفية والمصطلحات التقنية والمفردات المتخصصة. ويمكن للمستخدمين تزويده بمفردات مخصّصة، حتى تكون أسماء الأشخاص والمنتجات والمصطلحات المرتبطة بمجال معين أقرب إلى التهجئة المطلوبة. كما يكتشف تلقائياً أكثر من 85 لغة.
1
7
وعند معالجة تسجيلات صوتية موجودة مسبقاً، يوفّر النموذج طوابع زمنية وإمكانية تمييز المتحدثين لما يصل إلى ثلاثة أشخاص، بحيث يستطيع المطور ربط كل جزء من النص بالمتحدث المناسب.
1
Gemini 3.5 Transcribe مقابل Chirp 3: دقة أعلى وسرعة أكبر
تصف Google النموذج الجديد بأنه تحسن كبير مقارنةً بمحرك Chirp 3 السابق. ووفق أرقام تستند إلى قياسات من Artificial Analysis، يبلغ معدل خطأ الكلمات 2.6% للصوت غير المتدفق و4.0% في وضع البث، مع خفض بنسبة 70% في الوقت اللازم للوصول إلى التفريغ النهائي.
3
4
9
مع ذلك، لا ينبغي التعامل مع هذه الأرقام باعتبارها ضماناً موحداً لكل الحالات. فمعدل خطأ الكلمات يتغير بحسب اللغة واللهجة وجودة التسجيل والضوضاء ومجموعة الاختبار المستخدمة. كما تبرز مواد Google نتيجة مختلفة على معيار FLEURS، إذ تسجل معدل خطأ يبلغ 5.50% في وضع البث؛ ولا يمكن مقارنتها مباشرةً بكل قياس من جهة خارجية لأن ظروف الاختبار ليست متطابقة.
1
الخلاصة العملية أوضح من أي رقم منفرد: تستهدف Google تقليل زمن الاستجابة في التفاعلات المباشرة، وتحسين شكل النص النهائي في التسجيلات أو الإملاء الصوتي.
مساران للمطورين: الصوت المباشر والتسجيلات الجاهزة
تشرح Google طريقتين لاستخدام النموذج، بحسب طبيعة التطبيق.
التفريغ في الوقت الفعلي
يستهدف الخيار المباشر التطبيقات التي تحتاج إلى استقبال الصوت باستمرار وإنتاج استجابات سريعة. وتتيح Live API من Google تفاعلات صوتية آنية بزمن استجابة منخفض، كما يمكنها توفير تفريغ لكل من كلام المستخدم ومخرجات النموذج.
12
20
وقد يفيد ذلك في المساعدات الصوتية، والترجمة أو التسميات النصية المباشرة، وواجهات المحادثة، والتطبيقات التي تحتاج إلى ظهور النص بينما لا يزال الشخص يتحدث. كما تميّز وثائق واجهة البرمجة بين أنماط الطلبات الأحادية والبث والتفاعل الآني في تطبيقات Gemini.
24
تفريغ التسجيلات الصوتية
بالنسبة إلى الصوت المسجّل مسبقاً، يستطيع المطور رفع ملف صوتي أو الإشارة إلى موقعه، ثم إرساله عبر مسار التفاعل في Gemini API. يناسب هذا الخيار معالجة تسجيل موجود، حيث تكون الطوابع الزمنية والتنسيق والمفردات المخصّصة ونسب الكلام إلى المتحدثين أهم من الاستجابة خلال أجزاء من الثانية.
1
12
18
وتوصي وثائق Gemini API الأحدث باستخدام Interactions API كواجهة قياسية للتطبيقات الجديدة، بينما صُممت Live API للتجارب الصوتية والمرئية المستمرة ذات زمن الاستجابة المنخفض.
19
20
أين تستخدمه Google بالفعل؟
لا يقتصر Gemini 3.5 Transcribe على كونه نموذجاً تجريبياً للمطورين. وتشير التقارير إلى أنه يشغّل بالفعل ميزة الإملاء الصوتي Rambler في لوحة مفاتيح Gboard على Android، كما يُستخدم في تطبيق Gemini على macOS.
2
13
26
وتقول Google إن دعم تحويل الكلام إلى نص سيصل قريباً إلى متصفح Chrome. وعند إطلاقه، سيتمكن المستخدمون من الإملاء مباشرةً في حقول النص على الويب، بما في ذلك الرسائل والمنشورات والنماذج والأوامر الموجهة إلى Gemini، بدلاً من حصر الإدخال الصوتي في تطبيق مستقل.
1
8
13
ويأتي النموذج إلى جانب Gemini 3.5 Live وGemini 3.5 Live Experimental ضمن مجموعة الصوت الأوسع التي تسميها Google Gemini Audio. وفي هذه المنظومة، يركّز Transcribe على تحويل الكلام إلى نص، بينما تستهدف نماذج Live التجارب الصوتية التفاعلية.
12
26
المفاضلة الأساسية: نص مصقول أم سجل أمين؟
أقوى مزايا Gemini 3.5 Transcribe هي أيضاً أبرز حدوده. فحذف كلمات التردد ودمج التصحيحات يجعل الناتج أسهل قراءة، لكنه يغيّر العلاقة بين التسجيل والنص الناتج.
قد يحذف النص المصقول تردداً له دلالة، أو يحتفظ بالصيغة المصححة فقط من العبارة، أو يخفف من أسلوب المتحدث الخاص. وهذا مرغوب غالباً عند إملاء رسالة أو إعداد ملاحظات. لكنه يصبح أقل ملاءمة عندما تكون الكلمات نفسها هي الدليل.
لذلك، في المقابلات والسجلات القانونية أو الطبية والبحوث ووثائق الإتاحة والاقتباسات، ينبغي الاحتفاظ بالتسجيل الأصلي ومراجعة المقاطع المهمة. وما لم يوفّر التطبيق وضعاً واضحاً للتفريغ الحرفي، فمن الأفضل فهم Gemini 3.5 Transcribe على أنه نظام تفريغ ذكي يعيد التحرير، لا مسجل محايد يحوّل الصوت إلى نص فقط.
ماذا يعني الإعلان؟
تدفع Google بالتعرف على الكلام خطوةً أقرب إلى الكتابة بمساعدة الصوت. فـGemini 3.5 Transcribe يجمع بين التفريغ والتنظيف والتنسيق واكتشاف اللغة وتخصيص المفردات ومعلومات المتحدثين، مع مسارات منفصلة للصوت المباشر والتسجيلات الجاهزة.
1
12
وبالنسبة إلى المطورين، قد يقلل ذلك كمية المعالجة اللاحقة المطلوبة بعد التعرف على الكلام. أما للمستخدمين، فقد يجعل الإملاء يبدو أقل شبهاً بالتحدث بحذر إلى آلة، وأكثر شبهاً بإملاء مسودة أولية على محرر.
ويبقى السؤال الأهم ليس ما إذا كان النموذج قادراً على إنتاج نص أنظف، بل ما إذا كان التطبيق يحتاج إلى نص أنظف — أم إلى سجل دقيق لكل ما قيل.