Gemini 3.5 Transcribe là mô hình chuyển giọng nói thành văn bản mới của Google, được giới thiệu như phiên bản kế nhiệm nhanh và chính xác hơn Chirp 3; một số phép đo được dẫn lại cho thấy thời gian tạo bản chép lời cu... Mô hình có thể biến lời nói thiếu cấu trúc thành văn bản dễ dùng hơn bằng cách bỏ từ đệm, xử lý...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google đã giới thiệu Gemini 3.5 Transcribe, mô hình chuyển giọng nói thành văn bản được thiết kế để làm nhiều hơn việc chép lại từng từ trong tệp âm thanh. Thay vì giữ nguyên mọi tiếng “ừm”, đoạn ngập ngừng hay câu nói bỏ dở, mô hình có thể biến lời nói tự nhiên thành nội dung được làm sạch và định dạng rõ ràng hơn — phù hợp với việc đọc chính tả, ghi chú, soạn tin nhắn và điều khiển chỉnh sửa bằng giọng nói. Google gọi đây là mô hình chuyển giọng nói thành văn bản chính xác nhất của hãng và xem nó là bước tiến lớn so với Chirp 3. 1 12
Tuy nhiên, điểm này cũng tạo ra một khác biệt quan trọng: văn bản dễ đọc hơn không đồng nghĩa với bản ghi trung thành tuyệt đối hơn. Khi hệ thống tự bỏ từ đệm, xử lý câu sửa lại và suy đoán ý định của người nói, nó có thể tạo ra một bản nháp tốt hơn nhưng giữ lại ít hơn cách diễn đạt nguyên bản.
Gemini 3.5 Transcribe được xây dựng quanh khái niệm “phiên âm thông minh” của Google. Mô hình có thể loại bỏ các yếu tố gây ngắt quãng, đưa phần tự sửa của người nói vào câu hoàn chỉnh, thêm dấu câu và áp dụng định dạng. Ngoài ra, người dùng có thể yêu cầu chỉnh sửa văn bản bằng giọng nói hoặc biến những mẩu ý rời rạc thành đoạn văn dễ đọc hơn. 1 8 12
Cách tiếp cận này đặc biệt phù hợp với các tình huống nhập liệu hằng ngày. Người dùng có thể nói như đang ghi nhanh một ý tưởng hoặc đọc một tin nhắn còn lộn xộn, sau đó nhận được văn bản gần với bản hoàn chỉnh thay vì phải tự sửa từng câu.
Google cho biết mô hình cũng được thiết kế để xử lý tiếng ồn nền, thuật ngữ kỹ thuật và từ vựng chuyên ngành. Người dùng có thể cung cấp từ vựng tùy chỉnh để tăng khả năng nhận diện đúng tên riêng, tên sản phẩm hoặc cách viết đặc thù trong từng lĩnh vực. Gemini 3.5 Transcribe tự động phát hiện hơn 85 ngôn ngữ. 1 7
Khi xử lý âm thanh đã ghi sẵn, mô hình có thể cung cấp mốc thời gian và phân biệt tối đa ba người nói. Tính năng này giúp nhà phát triển gắn từng phần nội dung với đúng người tham gia cuộc trò chuyện. 1
Google mô tả Gemini 3.5 Transcribe là một cải tiến đáng kể so với mô hình phiên âm Chirp 3 trước đây. Các số liệu được dẫn lại từ phép đo của Artificial Analysis cho thấy tỷ lệ lỗi từ là 2,6% với âm thanh không truyền trực tiếp và 4,0% với âm thanh truyền trực tiếp; thời gian cần để tạo bản phiên âm cuối cùng giảm 70%. 3 4 9
Dù vậy, không nên xem đây là cam kết hiệu năng áp dụng cho mọi trường hợp. Tỷ lệ lỗi từ còn phụ thuộc vào ngôn ngữ, giọng vùng miền, chất lượng bản ghi, tiếng ồn nền và bộ dữ liệu đánh giá. Tài liệu của Google cũng nêu kết quả trên bộ kiểm thử FLEURS, trong đó tỷ lệ lỗi từ ở chế độ truyền trực tiếp là 5,50%. Con số này không thể so sánh trực tiếp với mọi phép đo bên thứ ba vì điều kiện thử nghiệm khác nhau. 1
Điểm rút ra thực tế là Google đang nhắm đến cả hai mục tiêu: giảm độ trễ trong các cuộc tương tác trực tiếp và tạo ra đầu ra sạch hơn cho lời đọc chính tả hoặc bản ghi đã có sẵn.
Google cung cấp các cách sử dụng khác nhau tùy ứng dụng cần xử lý âm thanh trực tiếp hay tệp ghi âm.
Tùy chọn trực tiếp dành cho các ứng dụng cần nhận luồng âm thanh liên tục và phản hồi nhanh. Gemini Live API hỗ trợ tương tác giọng nói thời gian thực với độ trễ thấp, đồng thời có thể cung cấp bản chép lời cả phần người dùng nói lẫn phần phản hồi của mô hình. 12 20
Cách tích hợp này có thể phục vụ trợ lý giọng nói, phụ đề trực tiếp, giao diện hội thoại và các ứng dụng cần hiển thị văn bản ngay khi người dùng đang nói. Tài liệu tham khảo API của Google cũng phân biệt các mô hình tương tác đơn lẻ, truyền trực tiếp và thời gian thực cho các ứng dụng Gemini. 24
Với bản ghi có sẵn, nhà phát triển có thể tải tệp âm thanh lên hoặc tham chiếu đến tệp rồi gửi qua luồng tương tác API của Gemini. Cách này phù hợp hơn với những công việc mà mốc thời gian, định dạng, từ vựng tùy chỉnh và thông tin người nói quan trọng hơn tốc độ phản hồi tức thì. 1 12 18
Tài liệu Gemini API hiện khuyến nghị Interactions API làm giao diện tiêu chuẩn cho các ứng dụng Gemini mới. Trong khi đó, Live API hướng đến các trải nghiệm giọng nói và hình ảnh liên tục, cần độ trễ thấp. 19 20
Đây không chỉ là công nghệ đang nằm trong giai đoạn thử nghiệm dành cho nhà phát triển. Theo các báo cáo, Gemini 3.5 Transcribe đã được dùng để vận hành Rambler — tính năng đọc chính tả trên Gboard của Android — và ứng dụng Gemini trên macOS. 2 13 26
Google cũng cho biết tính năng chuyển giọng nói thành văn bản sẽ sớm được đưa vào Chrome. Khi đó, người dùng có thể đọc chính tả trực tiếp vào các ô nhập văn bản trên web, chẳng hạn khi soạn tin nhắn, bài đăng, biểu mẫu hoặc câu lệnh cho chatbot, thay vì phải mở một ứng dụng riêng. 1 8 13
Mô hình này được công bố cùng Gemini 3.5 Live và Gemini 3.5 Live Experimental trong nhóm sản phẩm âm thanh mà Google gọi là “Gemini Audio”. Trong hệ sinh thái này, Transcribe tập trung vào việc biến lời nói thành văn bản, còn các mô hình Live hướng tới trải nghiệm tương tác bằng âm thanh. 12 26
Tính năng mạnh nhất của Gemini 3.5 Transcribe cũng chính là giới hạn đáng lưu ý nhất. Việc xóa từ đệm và gộp các câu tự sửa giúp văn bản dễ đọc, nhưng làm thay đổi mối quan hệ giữa âm thanh gốc và bản phiên âm.
Một kết quả đã được làm mượt có thể bỏ qua những khoảng ngập ngừng mang ý nghĩa, chỉ giữ lại phiên bản cuối của một câu hoặc làm mờ phong cách nói riêng của mỗi người. Điều này thường hữu ích khi đọc chính tả tin nhắn, ghi chú hoặc nội dung cho biểu mẫu. Nhưng nó lại kém phù hợp khi từng chữ đều quan trọng.
Với phỏng vấn, hồ sơ pháp lý hoặc y tế, tài liệu nghiên cứu, hồ sơ hỗ trợ tiếp cận hay những đoạn trích dẫn, người dùng nên giữ lại tệp âm thanh gốc và kiểm tra các phần quan trọng. Nếu hệ thống không cung cấp chế độ phiên âm nguyên văn rõ ràng, Gemini 3.5 Transcribe nên được hiểu là công cụ phiên âm có biên tập thông minh — không đơn thuần là máy ghi lại chính xác mọi lời đã nói.
Gemini 3.5 Transcribe đưa công nghệ nhận diện giọng nói tiến gần hơn đến việc viết có sự hỗ trợ của giọng nói. Mô hình kết hợp phiên âm với làm sạch nội dung, định dạng, phát hiện ngôn ngữ, từ vựng tùy chỉnh và thông tin người nói, đồng thời cung cấp quy trình riêng cho âm thanh trực tiếp và bản ghi có sẵn. 1 12
Với nhà phát triển, điều này có thể giảm lượng công việc hậu xử lý sau khi âm thanh được nhận diện. Với người dùng, đọc chính tả có thể bớt cảm giác phải nói thật hoàn hảo với máy móc và giống hơn việc đưa một bản nháp thô cho biên tập viên.
Câu hỏi còn lại không phải là mô hình có tạo ra văn bản sạch hơn hay không, mà là mỗi ứng dụng cần văn bản sạch — hay cần một bản ghi chính xác từng lời đã được nói.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Gemini 3.5 Transcribe là mô hình chuyển giọng nói thành văn bản mới của Google, được giới thiệu như phiên bản kế nhiệm nhanh và chính xác hơn Chirp 3; một số phép đo được dẫn lại cho thấy thời gian tạo bản chép lời cu...
Gemini 3.5 Transcribe là mô hình chuyển giọng nói thành văn bản mới của Google, được giới thiệu như phiên bản kế nhiệm nhanh và chính xác hơn Chirp 3; một số phép đo được dẫn lại cho thấy thời gian tạo bản chép lời cu... Mô hình có thể biến lời nói thiếu cấu trúc thành văn bản dễ dùng hơn bằng cách bỏ từ đệm, xử lý câu tự sửa, thêm dấu câu, định dạng nội dung, nhận diện từ vựng chuyên ngành và tự động phát hiện hơn 85 ngôn ngữ.
Gemini 3.5 Transcribe hỗ trợ cả âm thanh thời gian thực lẫn tệp ghi âm; công nghệ này đã xuất hiện trong tính năng đọc chính tả Rambler của Gboard và ứng dụng Gemini trên macOS, trong khi Google đang chuẩn bị đưa tính...