Gemini 3.8 Live hướng tới các ứng dụng hội thoại giọng nói khối lượng lớn, độ trễ thấp, có khả năng bám theo ngữ cảnh hình ảnh; Extended Thinking dành cho các tác vụ phức tạp, nhiều bước. Điểm mới đáng chú ý là Extended Thinking có thể tiếp tục phát lời nói trong khi lập kế hoạch, suy luận nền và chờ các công cụ bất...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google đã giới thiệu Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking — hai mô hình âm thanh-đến-âm thanh (audio-to-audio) dành cho tác nhân giọng nói và hội thoại trực tiếp theo thời gian thực. Bản tiêu chuẩn tập trung vào khả năng mở rộng, hiệu quả chi phí, đối thoại tự nhiên và bám ngữ cảnh hình ảnh; còn Extended Thinking nhắm đến các công việc khó hơn, cần suy luận nhiều bước trong nền. 10
2
Tính năng đáng chú ý nhất thuộc về Gemini 3.8 Live Extended Thinking. Theo Google, mô hình này có thể suy luận trong nền, lập kế hoạch và gọi các công cụ bất đồng bộ trong lúc vẫn tiếp tục truyền phản hồi âm thanh. Nếu một công cụ cần vài giây để hoàn tất, hệ thống có thể dùng những câu chuyển tiếp tự nhiên để duy trì cuộc hội thoại, thay vì bắt người dùng chờ trong im lặng. 1
2
Vì thế, khái niệm “suy luận đồng thời” ở đây không chỉ là phản hồi nhanh hơn. Trong thiết kế của Google, việc tạo lời nói, lập kế hoạch nền và hoạt động của công cụ bất đồng bộ có thể diễn ra song song. Về nguyên tắc, một tác nhân giọng nói có thể vừa giải thích bước tiếp theo, vừa chờ dữ liệu hoặc xử lý một quy trình nhiều bước.
Trải nghiệm thực tế có thuyết phục hay không vẫn phụ thuộc vào độ ổn định của công cụ, thiết kế hội thoại của tác nhân và việc lời nói trong thời gian chờ có thực sự hữu ích, thay vì chỉ là lấp khoảng lặng. 1
2
Google định vị Gemini 3.8 Live là lựa chọn cho trải nghiệm hội thoại quy mô lớn, độ trễ thấp, không bị chậm lại do cơ chế suy luận. Mô hình kết hợp đối thoại trực tiếp với khả năng bám ngữ cảnh hình ảnh, tức tác nhân có thể sử dụng thông tin hình ảnh song song với cuộc trò chuyện. 10
45
Đại diện Google cũng cho biết mô hình hỗ trợ 97 ngôn ngữ và có thể chuyển đổi giữa các ngôn ngữ trong cùng một cuộc hội thoại. Tuy vậy, nhà phát triển vẫn nên kiểm tra chất lượng từng ngôn ngữ, giọng địa phương, mức độ sẵn có theo khu vực và hiệu năng trong đúng tình huống sử dụng của mình. 16
Theo các bài viết về đợt ra mắt, Gemini 3.8 Live đạt 76,0 điểm và Gemini 3.8 Live Extended Thinking đạt 82,6 điểm trên Speech-to-Speech Quality Index; OpenAI GPT-Live-1, ở thiết lập nỗ lực suy luận trung bình, đạt 81,5 điểm. 25
Trong so sánh được nêu, Extended Thinking có điểm cao nhất. Nhưng đây không nên được hiểu là kết luận độc lập rằng một hệ thống luôn vượt trội ở mọi môi trường triển khai. Một tác nhân giọng nói dùng thực tế còn phải xử lý việc người dùng ngắt lời, giọng nói đa ngôn ngữ và nhiều chất giọng, độ chính xác khi gọi công cụ, độ trễ khi tải cao, an toàn, khả năng quan sát vận hành và tổng chi phí cho mỗi tác vụ hoàn thành.
Nói cách khác, các con số này là một tín hiệu đánh giá, không phải phán quyết mua sắm cho mọi tổng đài, trợ lý hay quy trình chăm sóc khách hàng. 25
Bảng giá chính thức của Google xếp cả hai mô hình mới vào Live API. Ở gói tiêu chuẩn trả phí, giá âm thanh đầu vào là 3,00 USD mỗi một triệu token, tương đương 0,005 USD/phút; âm thanh đầu ra là 12,00 USD mỗi một triệu token, tương đương 0,018 USD/phút. Giá đầu vào văn bản là 0,75 USD mỗi một triệu token; đầu ra văn bản, bao gồm token suy luận, là 4,50 USD mỗi một triệu token. 37
Điểm cần lưu ý là không nên lấy giá token của Gemini 3.8 Flash rồi áp vào các mô hình Live. Khi lập ngân sách, đội ngũ triển khai nên dùng bảng giá Live API và tài liệu mô hình hiện hành, sau đó thử nghiệm với các phiên sử dụng thực tế. Chi phí của một tác nhân giọng nói sẽ phụ thuộc vào tỷ lệ âm thanh đầu vào, âm thanh đầu ra, ngữ cảnh hình ảnh, văn bản và các công cụ liên quan. 37
Google DeepMind liệt kê cả hai mô hình ở trạng thái phát hành rộng rãi (generally available). Theo bảng công bố, Gemini 3.8 Live và Extended Thinking đều có mặt trên ứng dụng Gemini, Google AI Studio, Gemini API và Google Enterprise Agent Platform.
Riêng Google Search Live được liệt kê cho Extended Thinking, trong khi Google Workspace được liệt kê cho Gemini 3.8 Live. 54
Với nhà phát triển, đây là lựa chọn giữa một mô hình đối thoại trực tiếp tiêu chuẩn và một mô hình suy luận mạnh hơn, cùng thuộc họ âm thanh-đến-âm thanh. Với doanh nghiệp, câu hỏi không chỉ là mô hình nào đã được mở, mà còn là sản phẩm nào phù hợp, chính sách kiểm soát dữ liệu, khu vực địa lý và con đường tích hợp cho hệ thống dự định triển khai. 54
Thông điệp cạnh tranh lớn nhất của Google là một bộ công nghệ thời gian thực tích hợp hơn: hội thoại bằng lời nói, bám ngữ cảnh hình ảnh, suy luận nền và công cụ bất đồng bộ trong cùng một họ mô hình. Về lý thuyết, điều này có thể giảm phần việc phải ghép nối riêng lẻ giữa nhận dạng giọng nói, mô hình văn bản, điều phối công cụ và tổng hợp giọng nói — đồng thời giữ mạch hội thoại khi tác vụ còn đang được xử lý. 1
10
GPT-Live-1 của OpenAI vẫn là một đối trọng đáng chú ý, đặc biệt với các đội ngũ đánh giá hành vi hội thoại song công. Tuy nhiên, so sánh benchmark được nêu là quá hẹp để quyết định lựa chọn nền tảng. Một quy trình đánh giá đáng tin cậy cần dùng các cuộc gọi đại diện cho thực tế và đo cách xử lý ngắt lời, độ đúng của lời gọi công cụ, hiệu năng đa ngôn ngữ, kiểm soát an toàn, khả năng phục hồi sau lỗi, độ trễ và chi phí trên mỗi kết quả hoàn thành. 25
Các tài liệu ra mắt hiện có chưa xác lập chính sách cụ thể về đóng dấu nước âm thanh SynthID cho Gemini 3.8 Live hoặc Extended Thinking. Google cho biết SynthID đã được mở rộng để đóng dấu nước và nhận diện văn bản do ứng dụng Gemini và trải nghiệm web tạo ra. Tuy nhiên, thông tin này không xác nhận mọi luồng âm thanh từ hai mô hình Live đều được đóng dấu nước, cũng không nêu chi tiết cơ chế nhận diện hoặc điều khoản triển khai. 59
Tương tự, các thông báo tích hợp trong hệ sinh thái có thể thay đổi nhanh. Trước khi chốt kiến trúc sản phẩm, các nhóm nên kiểm tra lại tài liệu mô hình, bảng giá, phạm vi hỗ trợ nền tảng và điều khoản dịch vụ hiện hành. 37
54
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Gemini 3.8 Live hướng tới các ứng dụng hội thoại giọng nói khối lượng lớn, độ trễ thấp, có khả năng bám theo ngữ cảnh hình ảnh; Extended Thinking dành cho các tác vụ phức tạp, nhiều bước.
Gemini 3.8 Live hướng tới các ứng dụng hội thoại giọng nói khối lượng lớn, độ trễ thấp, có khả năng bám theo ngữ cảnh hình ảnh; Extended Thinking dành cho các tác vụ phức tạp, nhiều bước. Điểm mới đáng chú ý là Extended Thinking có thể tiếp tục phát lời nói trong khi lập kế hoạch, suy luận nền và chờ các công cụ bất đồng bộ trả kết quả.