גוגל הכריזה ב־23 בספטמבר 2026 על שני מודלים שמייצרים דיבור מטקסט: Gemini 3.8 Flash TTS ו־Gemini 3.8 Flash-Lite TTS. ההבדל המרכזי הוא סוג העבודה שאליו כל אחד מכוון. Flash TTS שם דגש על יצירת קול בעל אופי מוגדר ועל בימוי ההגשה; Flash-Lite TTS מכוון להפקת אודיו בהיקף גדול ובעלות נמוכה יותר, למשל לדיבוב ולסוכני קול.
4
27
במה כדאי לבחור?
אם צריך להמציא קול לדמות ולהגדיר כיצד תישמע בסצנה, Flash TTS הוא האפשרות היצירתית. לפי גוגל, אפשר לתאר בשפה רגילה את תפקיד הדמות, המבטא ומאפייני הקול שלה, ואז לתת הוראות לאופן ההגשה של שורות בתסריט.
4
30
אם המשימה היא להפיק כמויות גדולות של דיבור, Flash-Lite TTS הוא המודל שגוגל מייעדת לכך. הוא מכוון לדיבוב, ליצירת תוכן אודיו ולסוכני קול, אך עדיין מאפשר לכוון את הטון, הקצב וההבעה. כלומר, Lite אינו שם נרדף לדיבור אחיד ונטול הנחיות.
27
30
יצירת קול לעומת שכפול קול
גוגל אומרת שאפשר לבחור מבין יותר מ־2,000 קולות מוכנים, או ליצור קול חדש באמצעות תיאור טקסטואלי. אפשר גם לביים חילופי דברים ולציין שורה אחר שורה איך הדברים ייאמרו — למשל מבחינת טון, מבטא וקצב.
4
28
29
לפי גוגל, יצירת קולות נתמכת ביותר מ־100 שפות וניבים. רשימות מודלים של צד שלישי מציינות 130 שפות ל־Flash TTS ו־101 ל־Flash-Lite TTS. אלה נתוני כיסוי מדווחים, ולא הבטחה שכל קול או יכולת זמינים בכל שפה.
27
17
18
שכפול קול הוא פעולה אחרת מיצירת קול לדמות חדשה: הוא נשען על הקלטה של אדם קיים. בדיווחים על ההשקה תוארה דגימת ייחוס של כ־30 שניות, לצד בדיקת הסכמה לפני השכפול.
22
23
אילו הגנות הוצגו, ומה אומרים מבחני הביצועים?
גוגל אומרת ששכפול קול כולל אימות הסכמה. בדיווחי ההשקה תוארו גם סימון אודיו שנוצר באמצעות SynthID והצמדת אישורי מקור מסוג C2PA לקולות משוכפלים. אלה אמצעי הגנה, לא ערובה לכך שכל שימוש לרעה נמנע.
23
34
בתוצאות שדווחו בעת ההשקה, Flash TTS קיבל 71.4 ודורג ראשון במבחן Voice Design של Hume AI; דיווח נוסף מציין תוצאה של 60.8 במדד למידול מבטאים. גוגל מסרה ששני המודלים תפסו את שני המקומות הראשונים במדד האיכות הכללי של Hume AI. מדובר בתוצאות מדווחות של מבחנים, ולא בבדיקה עצמאית של ביצועי המודלים בכל יישום.
19
21
היכן אפשר להשתמש בהם?
גוגל הודיעה שהפצת שני המודלים למפתחים החלה ב־23 בספטמבר דרך Google AI Studio ו־Gemini API. בהערות העדכון של ה־API רשומים מודלי הדיבור ונקודת גישה לקולות, Voices endpoint, כזמינים לשימוש כללי. במוצרי גוגל צוין ש־Flash TTS יגיע ל־Gemini Notebook ו־Flash-Lite TTS ל־Google Vids; הגישה דרך Gemini Enterprise הוצגה ככזו שתגיע בקרוב. אין להסיק מכך שכל יכולת קול הייתה זמינה בכל אחד מהמוצרים ביום ההשקה.
29
32
בדיווחים ראשוניים על שילובים הוזכרו פלטפורמות ובהן Agora, LiveKit, Pipecat ו־Vercel, וכן חברות שבוחנות שימושים בדיבוב, בהתאמה לשפות ובסוכני קול, ובהן Figma, HeyGen ו־Wondercraft. אלה דוגמאות להתעניינות ולשילוב מוקדם, לא עדות לזמינות זהה בכל השירותים.
37