Объявлено: 16 июня 2026 года .
Что внедрено: Флагманская модель синтеза речи (Text-to-Speech, TTS) Realtime TTS-2 от исследовательской лаборатории Inworld AI, доступная в формате исследовательского превью . В рейтинге Artificial Analysis Speech Arena эта модель занимает первое место среди решений для реального времени. Отличительная черта — «осведомленность о разговоре»: модель анализирует полный аудиоконтекст, улавливает тон, темп и эмоциональное состояние, а управлять голосом можно простыми фразами вроде «будь бодрее» на любом из 200+ поддерживаемых языков
.
Как работает с TRTC: Inworld TTS встраивается как готовый компонент в экосистему Tencent RTC через уже существующий интерфейс StartAIConversation, который поддерживает интеграцию со сторонними TTS-системами .
Итог для бизнеса: Разработчик получает закрытый стек (распознавание → большая языковая модель → синтез речи), где ответ звучит эмоционально созвучно ситуации, а один и тот же персонаж сохраняет узнаваемый голос на любом языке .
Оба партнерства закрывают базовые сенсорные блоки разговорного ИИ на инфраструктуре TRTC. Вместо многолетней разработки собственных моделей Tencent Cloud предлагает бизнесу готовую, распределенную по миру платформу с предустановленным «слухом» и «голосом» от узкопрофильных лидеров.
Это часть более широкой стратегии. Ранее компания заключила соглашение со Stream (фреймворк Vision Agents) для создания мультимодальных ИИ-агентов , а 16 июня на конференции Tencent Cloud Day Korea представила портфель интегрированных ИИ-агентов
. Все шаги направлены на то, чтобы сделать TRTC стандартной транспортной средой для реального времени в ИИ-приложениях, ориентированных на развивающиеся рынки и многоязычную аудиторию.