Gemini 3.5 Transcribe — новая модель Google для преобразования речи в текст и более быстрый преемник Chirp 3: по измерениям Artificial Analysis, время получения итоговой расшифровки сократилось на 70%, а частота ошибо... Модель удаляет слова паразиты, учитывает самокоррекции говорящего, форматирует текст, поддержива...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google представила Gemini 3.5 Transcribe — модель преобразования речи в текст, которая должна не просто механически записывать каждое произнесённое слово, а превращать сбивчивую устную речь в более аккуратный и структурированный текст. Компания называет её своей самой точной моделью распознавания речи и существенным шагом вперёд по сравнению с Chirp 3. 1 12
Для диктовки сообщений, заметок и команд это выглядит как полезное обновление. Однако есть важная оговорка: система, которая убирает «э-э» и «гм», исправляет оговорки и пытается понять замысел говорящего, может сделать текст лучше для чтения — но менее точным как дословная запись разговора.
В основе модели лежит то, что Google называет интеллектуальной транскрибацией. Gemini 3.5 Transcribe может удалять слова-паразиты и незавершённые фразы, учитывать исправления говорящего, расставлять знаки препинания и добавлять форматирование. Кроме того, модель способна выполнять команды по редактированию текста голосом и превращать набор несвязных фрагментов в более читабельную прозу. 1 8 12
На практике это означает, что пользователю не обязательно говорить идеально ровно и заранее формулировать каждое предложение. Можно надиктовать черновик разговорными фразами, а на выходе получить текст, больше похожий на готовое сообщение, заметку или ответ в форме.
Google также заявляет об улучшенной работе с фоновым шумом, техническими терминами и специализированной лексикой. Разработчики смогут передавать собственный словарь, чтобы имена, названия продуктов и профессиональные термины распознавались в нужном написании. Модель автоматически определяет более 85 языков. 1 7
При обработке заранее записанного аудио Gemini 3.5 Transcribe поддерживает временные метки и разделение реплик между тремя говорящими. Это позволяет связать отдельные фрагменты расшифровки с конкретными участниками разговора. 1
Google позиционирует новую модель как заметное улучшение по сравнению с Chirp 3. Согласно измерениям Artificial Analysis, на которые ссылаются публикации о запуске, частота ошибок в словах составляет 2,6% для аудио без потоковой передачи и 4,0% для потокового режима. Время до получения итоговой расшифровки, по этим данным, уменьшилось на 70%. 3 4 9
Эти показатели нельзя воспринимать как универсальную гарантию для любой записи. Word Error Rate — доля ошибок в распознанных словах — зависит от языка, акцента, качества микрофона, фонового шума и конкретного набора тестов. В собственных материалах Google приводит результаты теста FLEURS: 5,50% ошибок в потоковом режиме. Напрямую сравнивать эту цифру со всеми сторонними измерениями нельзя, поскольку условия тестирования различаются. 1
Тем не менее общий замысел понятен: Google одновременно стремится уменьшить задержку в живых голосовых приложениях и улучшить качество финального текста при диктовке или обработке записи.
Google предлагает разные способы интеграции модели в зависимости от задачи.
Потоковый вариант рассчитан на приложения, которым нужно постоянно принимать аудио и быстро реагировать на речь пользователя. Gemini Live API поддерживает голосовые взаимодействия с малой задержкой и может возвращать расшифровки как пользовательского ввода, так и ответа модели. 12 20
Такой сценарий подходит для голосовых ассистентов, живых субтитров, разговорных интерфейсов и сервисов, которым нужен текст ещё во время речи собеседника. В документации Google также описаны обычные, потоковые и интерактивные способы работы с Gemini API. 24
Для готовых записей разработчик может загрузить аудиофайл или передать ссылку на него через API Gemini. Этот вариант удобнее, когда важны временные метки, форматирование, пользовательский словарь и разделение реплик, а не реакция за доли секунды. 1 12 18
В общей документации Gemini API Google рекомендует Interactions API как стандартный интерфейс для новых приложений. Live API предназначен прежде всего для непрерывных голосовых и визуальных взаимодействий с низкой задержкой. 19 20
Gemini 3.5 Transcribe уже не ограничивается демонстрацией для разработчиков. По данным публикаций, модель используется в Rambler — функции голосовой диктовки клавиатуры Gboard на Android, — а также в приложении Gemini для macOS. 2 13 26
Google также готовит поддержку технологии в Chrome. После её появления пользователи смогут диктовать текст непосредственно в веб-поля: например, в сообщения, публикации, формы и запросы к ИИ, не открывая отдельное приложение для голосового ввода. 1 8 13
Модель появилась вместе с Gemini 3.5 Live и Gemini 3.5 Live Experimental в рамках более широкой аудиолинейки Gemini Audio. Transcribe отвечает главным образом за преобразование речи в текст, тогда как модели Live ориентированы на интерактивное аудиообщение. 12 26
Самая сильная сторона Gemini 3.5 Transcribe одновременно является её главным ограничением. Удаление слов-паразитов и объединение самокоррекций делают результат заметно удобнее для чтения, но меняют связь между аудиозаписью и текстом.
В отредактированной версии может не остаться значимых пауз и колебаний, первоначальная формулировка может быть заменена исправленным вариантом, а индивидуальная манера речи — сглажена. Для диктовки сообщения или подготовки черновика это обычно плюс. Но если важны точные слова, ситуация меняется.
При расшифровке интервью, юридических или медицинских материалов, исследовательских записей, документов для людей с ограниченными возможностями или цитат стоит сохранять исходное аудио и проверять важные фрагменты вручную. Пока в конкретной реализации не предусмотрен явно обозначенный дословный режим, Gemini 3.5 Transcribe разумнее воспринимать как интеллектуальную систему редактирования речи, а не как нейтральный диктофон, который фиксирует каждое слово.
Google приближает распознавание речи к голосовому письму. Gemini 3.5 Transcribe объединяет транскрибацию с очисткой текста, форматированием, определением языка, пользовательским словарём и информацией о говорящих, а также предлагает отдельные сценарии для прямого аудиопотока и готовых записей. 1 12
Для разработчиков это может сократить объём последующей обработки распознанного текста. Для пользователей диктовка должна стать менее похожей на разговор с машиной, которая требует идеальной дикции, и больше — на передачу черновика редактору.
Но главный вопрос после запуска звучит иначе: приложению нужен красиво оформленный текст или точная запись того, что действительно было сказано?
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Gemini 3.5 Transcribe — новая модель Google для преобразования речи в текст и более быстрый преемник Chirp 3: по измерениям Artificial Analysis, время получения итоговой расшифровки сократилось на 70%, а частота ошибо...
Gemini 3.5 Transcribe — новая модель Google для преобразования речи в текст и более быстрый преемник Chirp 3: по измерениям Artificial Analysis, время получения итоговой расшифровки сократилось на 70%, а частота ошибо... Модель удаляет слова паразиты, учитывает самокоррекции говорящего, форматирует текст, поддерживает пользовательский словарь и автоматически определяет более 85 языков.
Разработчики могут использовать отдельные сценарии для аудиопотока в реальном времени и заранее записанных файлов.