Gemini 3.5 Transcribe — нова модель Google для перетворення мовлення на текст і швидший наступник Chirp 3: за вимірюваннями Artificial Analysis, час до отримання фінальної транскрипції скоротився на 70%, а частка поми... Модель перетворює недосконале усне мовлення на готовіший текст: прибирає слова паразити, врахову...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google представила Gemini 3.5 Transcribe — модель перетворення мовлення на текст, яка має не просто дослівно відтворювати аудіо, а перетворювати уривчасту, неформальну розмову на відредагований і структурований текст. Вона орієнтована на диктування, нотатки, повідомлення та голосове редагування, де важливіший готовий результат, ніж буквальна розшифровка кожного слова. Google називає Gemini 3.5 Transcribe своєю найточнішою моделлю speech-to-text і позиціонує її як значний крок уперед порівняно з Chirp 3. 1 12
Це покращення має важливий нюанс. Система може прибрати «е-е», «м-м», виправити обмовку та відновити задум фрази. У підсумку текст стає читабельнішим, але в ньому може залишитися менше точних слів мовця.
Gemini 3.5 Transcribe побудована навколо того, що Google називає інтелектуальною транскрипцією. Замість того щоб зберігати кожну паузу, повтор чи незавершене речення, модель може прибирати мовні запинки, враховувати самовиправлення, розставляти розділові знаки та застосовувати форматування. Вона також реагує на голосові команди редагування й перетворює неструктуроване мовлення на зрозуміліший текст. 1 8 12
Для повсякденного голосового введення це означає, що користувач може надиктувати чернетку повідомлення або нотатки звичайною розмовною мовою — і отримати результат, ближчий до готового тексту, без тривалого ручного редагування.
Модель також має працювати з фоновим шумом, технічними термінами та вузькоспеціальною лексикою. Google дозволяє додавати власний словник, щоб імена, назви продуктів і терміни з конкретної галузі частіше розпізнавалися з потрібним написанням. Автоматично визначається понад 85 мов. 1 7
Під час обробки попередньо записаного аудіо Gemini 3.5 Transcribe може додавати часові мітки й розрізняти до трьох співрозмовників. 1
Google подає Gemini 3.5 Transcribe як суттєве вдосконалення попередньої моделі Chirp 3. Дані, наведені з посиланням на вимірювання Artificial Analysis, вказують на частку помилок у словах на рівні 2,6% для непотокового аудіо та 4,0% для потокового. Час до отримання фінальної транскрипції, за цими даними, скоротився на 70%. 3 4 9
Однак ці показники не варто сприймати як універсальну гарантію. Частка помилок залежить від мови, акценту, якості запису, фонового шуму та набору даних, на якому проводилося тестування. У власних матеріалах Google наводить результати тесту FLEURS, зокрема 5,50% помилок у потоковому режимі. Цей показник не можна безпосередньо порівнювати з усіма сторонніми вимірюваннями, оскільки умови тестів відрізняються. 1
Практичний висновок простіший за будь-який окремий бенчмарк: Google намагається одночасно зменшити затримку в живих взаємодіях і зробити фінальний текст чистішим для записів та диктування.
Google описує окремі способи використання моделі залежно від завдання.
Варіант для живої роботи розрахований на застосунки, яким потрібен безперервний аудіопотік і швидка реакція. Gemini Live API підтримує голосові взаємодії з низькою затримкою та може повертати транскрипції як введення користувача, так і відповіді моделі. 12 20
Такий підхід може бути корисним для голосових асистентів, живих субтитрів, діалогових інтерфейсів і сервісів, яким потрібен текст ще під час того, як людина говорить. Документація API також розрізняє унітарні, потокові та режими взаємодії в реальному часі для застосунків Gemini. 24
Для готових записів розробник може завантажити аудіофайл або передати на нього посилання через сценарій взаємодії Gemini API. Цей варіант більше підходить для обробки вже наявного запису, коли важливі часові мітки, форматування, власний словник і розподіл реплік між спікерами, а не реакція за частки секунди. 1 12 18
Загальна документація Gemini API рекомендує Interactions API як стандартний інтерфейс для нових застосунків Gemini. Live API призначений передусім для безперервних голосових і візуальних сценаріїв із низькою затримкою. 19 20
Gemini 3.5 Transcribe не залишилася лише експериментом для розробників. За повідомленнями, вона вже забезпечує роботу Rambler — функції голосового диктування в Gboard для Android, — а також застосунку Gemini на macOS. 2 13 26
Google заявляє, що підтримка speech-to-text незабаром з’явиться і в Chrome. Це дасть змогу диктувати текст безпосередньо в будь-які вебполя — зокрема в повідомленнях, дописах, формах і запитах — а не лише в окремому застосунку. 1 8 13
Модель представили разом із Gemini 3.5 Live та Gemini 3.5 Live Experimental у межах ширшої аудіолінійки Google під назвою Gemini Audio. У цій групі Transcribe відповідає за перетворення мовлення на текст, тоді як Live-моделі орієнтовані на інтерактивну роботу з аудіо. 12 26
Найсильніша функція Gemini 3.5 Transcribe водночас є її головним обмеженням. Видалення слів-паразитів і врахування самовиправлень роблять результат зручнішим для читання, але змінюють зв’язок між аудіо та транскрипцією.
Відредагований текст може не передати важливі паузи, зберегти лише виправлену версію фрази або згладити індивідуальну манеру мовлення. Для диктування повідомлення, чернетки чи нотаток це часто саме те, що потрібно. Але коли важливе кожне слово, ситуація інша.
Під час роботи з інтерв’ю, юридичними або медичними записами, дослідницькими матеріалами, документацією доступності чи цитатами варто зберігати оригінальне аудіо та перевіряти важливі фрагменти. Якщо конкретна реалізація не пропонує чіткого дослівного режиму, Gemini 3.5 Transcribe слід сприймати як інтелектуальну систему транскрипції з редагуванням, а не як нейтральний диктофон, що без змін переносить звук у текст.
Google наближає розпізнавання мовлення до голосового написання текстів. Gemini 3.5 Transcribe поєднує транскрипцію з очищенням, форматуванням, визначенням мови, налаштуванням словника та інформацією про спікерів, а також пропонує окремі сценарії для живого й записаного аудіо. 1 12
Для розробників це може означати менше додаткової обробки після розпізнавання. Для користувачів — диктування, яке більше нагадує передачу чернетки редактору, ніж спробу говорити з машиною ідеально чітко.
Зрештою, головне питання полягає не в тому, чи здатна модель створити чистіший текст. Важливіше зрозуміти, що потрібно конкретному застосунку: відредагований текст чи точний запис сказаного.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe — нова модель Google для перетворення мовлення на текст і швидший наступник Chirp 3: за вимірюваннями Artificial Analysis, час до отримання фінальної транскрипції скоротився на 70%, а частка поми...
Gemini 3.5 Transcribe — нова модель Google для перетворення мовлення на текст і швидший наступник Chirp 3: за вимірюваннями Artificial Analysis, час до отримання фінальної транскрипції скоротився на 70%, а частка поми... Модель перетворює недосконале усне мовлення на готовіший текст: прибирає слова паразити, враховує самовиправлення, додає форматування, підтримує власний словник і автоматично визначає понад 85 мов.
Розробники можуть використовувати окремі сценарії для аудіо в реальному часі та попередньо записаних файлів.