גוגל הציגה את Gemini 3.5 Transcribe — מודל דיבור־לטקסט שנועד לעשות יותר מהעתקה מדויקת של כל מילה שנאמרה. במקום להשאיר על הדף כל “אממ”, עצירה וניסוח שננטש באמצע, המודל מנסה להפוך דיבור טבעי ולא מסודר לטקסט מלוטש, מובנה וקל יותר לשימוש. גוגל מציגה אותו כמודל הדיבור־לטקסט המדויק ביותר שלה עד כה, וכקפיצת מדרגה לעומת Chirp 3. 1 12
החידוש עשוי להפוך הכתבה קולית, כתיבת הודעות, רישום הערות ועריכת טקסט באמצעות פקודות קוליות לנוחים בהרבה. אבל יש כאן הסתייגות חשובה: מערכת שמנקה את הדיבור ומנסה להבין את הכוונה אינה בהכרח מתעדת בדיוק את מה שהדובר אמר.
מה Gemini 3.5 Transcribe עושה אחרת?
Gemini 3.5 Transcribe מבוסס על מה שגוגל מכנה “תמלול חכם”. הוא יכול להסיר מילות מילוי והיסוסים, לשלב תיקון עצמי של הדובר, להוסיף סימני פיסוק ולעצב את הטקסט. בנוסף, הוא מסוגל לקבל הוראות עריכה קוליות ולהפוך רצף של רעיונות או משפטים חלקיים לטקסט קריא ומאורגן יותר. 1 8 12
בפועל, המשמעות היא שאפשר לדבר בחופשיות — כמו שמדברים עם אדם אחר — ולקבל תוצאה שקרובה יותר להודעה, למסמך או לתשובה מוכנה, במקום תמלול גולמי שדורש עריכה ידנית.
המודל אמור להתמודד גם עם רעשי רקע, מונחים טכניים ואוצר מילים מקצועי. גוגל מאפשרת למפתחים להוסיף אוצר מילים מותאם אישית, כך ששמות, מוצרים ומונחים ייחודיים יופיעו בסבירות גבוהה יותר באיות הרצוי. המערכת מזהה באופן אוטומטי יותר מ־85 שפות. 1 7
בעיבוד אודיו מוקלט, Gemini 3.5 Transcribe מספק חותמות זמן וזיהוי דוברים עבור עד שלושה אנשים, כך שניתן לקשר חלקים שונים בתמלול למשתתפים המתאימים. 1
Gemini 3.5 Transcribe לעומת Chirp 3: מהירות ודיוק
גוגל מציגה את המודל החדש כשיפור משמעותי לעומת Chirp 3, מודל התמלול הקודם שלה. לפי מדידות של Artificial Analysis שצוטטו בדיווחים, Gemini 3.5 Transcribe הגיע לשיעור שגיאות מילים של 2.6% באודיו שאינו מוזרם ו־4.0% באודיו בסטרימינג, ובמקביל קיצר ב־70% את הזמן הנדרש לקבלת תמלול סופי. 3 4 9
עם זאת, לא כדאי לראות בנתונים האלה הבטחה לתוצאה זהה בכל מצב. שיעור שגיאות מילים תלוי בשפה, במבטא, באיכות ההקלטה, ברעשי רקע ובמערך הנתונים שנבדק. בחומרים הרשמיים של גוגל מופיעה גם תוצאה של 5.50% במצב סטרימינג במבחן FLEURS, אך תנאי הבדיקה אינם זהים בהכרח למדידות של גופים חיצוניים. 1
המסקנה המעשית פשוטה יותר מכל מספר בודד: גוגל מכוונת גם להפחתת ההשהיה בשיחות חיות וגם להפקת טקסט נקי יותר מהקלטות או מהכתבה.
שני מסלולים למפתחים: בזמן אמת או מקובץ מוקלט
גוגל מציעה מסלולי שימוש שונים בהתאם לסוג האפליקציה.
תמלול בזמן אמת
האפשרות החיה מיועדת לאפליקציות שמקבלות זרם אודיו רציף וצריכות להגיב במהירות. ה־Live API של גוגל תומך באינטראקציות קוליות בזמן אמת ובהשהיה נמוכה, ויכול לספק תמלול הן של קלט המשתמש והן של פלט המודל. 12 20
מסלול כזה מתאים, בין היתר, לעוזרות קוליות, לכתוביות חיות, לממשקי שיחה ולאפליקציות שצריכות להציג טקסט בזמן שהאדם עדיין מדבר. בתיעוד ה־API של גוגל מופיעות גם תבניות עבודה חד־פעמיות, זורמות ובזמן אמת עבור אפליקציות Gemini. 24
תמלול אודיו מוקלט
כאשר מדובר בהקלטה קיימת, המפתח יכול להעלות קובץ אודיו או להפנות אליו דרך תהליך האינטראקציות של Gemini API. המסלול הזה מתאים יותר לעבודה שבה חותמות זמן, עיצוב, אוצר מילים מותאם אישית וזיהוי דוברים חשובים יותר מתגובה כמעט מיידית. 1 12 18
בתיעוד הכללי של Gemini API, גוגל ממליצה על Interactions API כממשק ברירת המחדל לאפליקציות Gemini חדשות. לעומת זאת, Live API מיועד לחוויות קוליות וחזותיות רציפות, שבהן זמן תגובה נמוך הוא תנאי מרכזי. 19 20
היכן המודל כבר מופיע?
Gemini 3.5 Transcribe אינו נשאר בשלב של הדגמת מעבדה. לפי דיווחים, הוא כבר מפעיל את Rambler, יכולת ההכתבה הקולית של Gboard באנדרואיד, וכן את אפליקציית Gemini ב־macOS. 2 13 26
גוגל מסרה גם שתמיכה בדיבור־לטקסט תגיע ל־Chrome. אם התוכנית תתממש, משתמשים יוכלו להכתיב ישירות לכל שדה טקסט באתר — למשל בתיבת הודעה, בטופס, בפוסט או בשדה פרומפט — ולא רק בתוך אפליקציה ייעודית. 1 8 13
ההשקה מגיעה לצד Gemini 3.5 Live ו־Gemini 3.5 Live Experimental, במסגרת משפחת האודיו הרחבה יותר שגוגל מכנה Gemini Audio. Transcribe מתמקד בהפיכת דיבור לטקסט, ואילו דגמי Live מיועדים לאינטראקציות קוליות בזמן אמת. 12 26
היתרון הגדול הוא גם הסיכון המרכזי
היכולת להפוך דיבור לטקסט מלוטש היא כנראה התכונה הבולטת ביותר של Gemini 3.5 Transcribe — והיא גם המגבלה החשובה ביותר שלו.
מחיקה של מילות מילוי ושילוב תיקונים עצמיים הופכים את התוצאה לקריאה ונוחה יותר, במיוחד בעת כתיבת הודעה או הערות. אך באותה פעולה עצמה עלולים להיעלם היסוס בעל משמעות, ניסוח ראשוני, סגנון דיבור אישי או המילים המדויקות שבהן השתמש הדובר.
לכן, בראיונות, בתיעוד משפטי או רפואי, במחקר, בתיעוד נגישות או בכל מצב שבו נדרש ציטוט מדויק, כדאי לשמור את קובץ האודיו המקורי ולבדוק ידנית קטעים חשובים. כל עוד אין במימוש מסוים מצב “תמלול מילולי” ברור, עדיף להתייחס ל־Gemini 3.5 Transcribe כמערכת תמלול חכמה שעורכת את הדיבור — ולא כמקליט ניטרלי שמעתיק אותו ללא שינוי.
מה ההכרזה אומרת?
גוגל מקרבת את זיהוי הדיבור לעולם של כתיבה בסיוע קולי. Gemini 3.5 Transcribe משלב תמלול עם ניקוי טקסט, עיצוב, זיהוי שפה, אוצר מילים מותאם אישית ומידע על הדוברים, ומציע מסלולים נפרדים לאודיו חי ולהקלטות. 1 12
עבור מפתחים, המשמעות עשויה להיות פחות עבודת עיבוד לאחר זיהוי הדיבור. עבור משתמשים, ההכתבה עשויה להרגיש פחות כמו דיבור זהיר מול מכונה ויותר כמו מסירת טיוטה ראשונית לעורך.
השאלה המרכזית אינה אם המודל יודע להפיק טקסט נקי יותר. השאלה היא מה נדרש בכל שימוש: טקסט נקי — או תיעוד מדויק של כל מה שנאמר.