Ngày 23/9/2026, Google công bố Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, hai mô hình chuyển văn bản thành lời nói (text-to-speech, viết tắt là TTS). Điểm khác biệt chính không phải Flash-Lite chỉ đọc văn bản một cách đơn điệu: Google định vị Flash TTS cho công việc cần thiết kế giọng và chỉ đạo diễn xuất kỹ, còn Flash-Lite TTS cho quy trình tạo âm thanh số lượng lớn, chú trọng chi phí.
4
27
30
Nên chọn mô hình nào?
Flash TTS phù hợp khi giọng nói là một phần quan trọng của nội dung, chẳng hạn nhân vật trong một cảnh có kịch bản. Theo Google, người dùng có thể mô tả vai trò, giọng vùng miền và đặc điểm âm sắc để tạo một giọng mới, rồi đưa chỉ dẫn về cách thể hiện lời thoại.
4
30
Flash-Lite TTS được Google hướng đến các tác vụ quy mô lớn như lồng tiếng, sản xuất nội dung âm thanh và trợ lý tương tác bằng giọng nói. Mô hình này vẫn hỗ trợ điều chỉnh sắc thái và nhịp đọc; chữ “Lite” ở đây nói lên định hướng tối ưu chi phí và sản lượng, không có nghĩa là thiếu khả năng điều khiển cách nói.
27
30
Tạo giọng mới khác gì tái tạo giọng có sẵn?
Google cho biết người dùng có thể chọn từ hơn 2.000 giọng có sẵn hoặc tạo giọng bằng câu lệnh ngôn ngữ tự nhiên. Họ cũng có thể chỉ đạo đoạn đối thoại qua lại và quy định từng câu cần được đọc với sắc thái, giọng vùng miền hay nhịp độ ra sao.
4
28
29
Tạo một giọng nhân vật mới khác với tái tạo giọng của người có thật. Cách thứ hai dùng bản ghi của một người nói làm mẫu; các bài viết về đợt ra mắt mô tả mẫu tham chiếu dài khoảng 30 giây và bước kiểm tra sự đồng ý trước khi tái tạo.
22
23
Về ngôn ngữ, Google mô tả khả năng tạo giọng trên hơn 100 ngôn ngữ và phương ngữ. Danh mục mô hình do bên thứ ba tổng hợp nêu con số cụ thể hơn: 130 ngôn ngữ cho Flash TTS và 101 cho Flash-Lite TTS. Không nên hiểu các con số này là mọi giọng nói và mọi tính năng đều hoạt động trong từng ngôn ngữ được liệt kê.
27
17
18
Biện pháp an toàn và kết quả đánh giá
Google nói tính năng tái tạo giọng có bước xác minh sự đồng ý. Các bài viết về đợt ra mắt còn mô tả âm thanh được tạo ra có dấu nhận diện SynthID, trong khi giọng tái tạo đi kèm thông tin xác thực nội dung C2PA. Đây là các biện pháp bảo vệ, không phải bảo đảm loại bỏ mọi khả năng bị lạm dụng.
23
34
Theo kết quả được công bố khi ra mắt, Flash TTS đạt 71,4 điểm, đứng đầu bài đánh giá Voice Design Benchmark của Hume AI; một bài viết khác nêu mức 60,8 điểm ở phép đo mô phỏng giọng vùng miền. Google cũng cho biết Flash TTS và Flash-Lite TTS chiếm hai vị trí đầu trên Overall Quality Index của Hume AI. Đó là kết quả đánh giá được báo cáo, không phải lời bảo đảm về chất lượng trong từng ứng dụng thực tế.
19
21
Đã có thể dùng ở đâu?
Google thông báo bắt đầu triển khai cả hai mô hình trong Google AI Studio và Gemini API từ ngày 23/9. Ghi chú phát hành API của hãng liệt kê các mô hình TTS và Voices endpoint — điểm truy cập API dành cho giọng nói — ở trạng thái phát hành rộng rãi. Với sản phẩm dành cho người dùng, Google nêu Flash TTS trong Gemini Notebook và Flash-Lite TTS trong Google Vids; quyền truy cập qua Gemini Enterprise được thông báo là sắp có. Điều đó không đồng nghĩa mọi tính năng giọng nói đều đã xuất hiện trong mọi sản phẩm ngay ngày đầu.
29
32
Các bài viết về tích hợp ban đầu nhắc tới Agora, LiveKit, Pipecat và Vercel, cùng những doanh nghiệp tìm hiểu ứng dụng lồng tiếng, bản địa hóa hoặc trợ lý giọng nói như Figma, HeyGen và Wondercraft. Đây là những ví dụ về sự quan tâm và tích hợp ban đầu, không phải xác nhận rằng mọi tính năng đều đã sẵn dùng trên tất cả nền tảng đó.
37