Google 发布了两款面向实时语音智能体与实时对话的原生音频到音频模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。标准版定位于规模化、成本效率、流畅对话及视觉理解;Extended Thinking 则面向需要更高推理能力的复杂多步骤任务。
10
2
最大区别:任务还在跑,对话不必停
真正的分水岭在 Gemini 3.8 Live Extended Thinking。Google 表示,该模型能在持续输出语音时进行后台推理、规划,并调用异步工具。对于耗时较长的工具调用,它可以用自然的对话性衔接语维持互动,而不必等结果返回后才继续整段回复。
1
2
这意味着所谓“同时推理”并不只是轮次切换更快。按 Google 的设计,语音生成、后台规划与异步工具活动可以并行推进。比如,语音智能体可一边向用户说明正在处理的步骤,一边查询数据或完成多步流程。
不过,体验是否真正更好,仍取决于工具本身是否可靠、对话流程是否设计得当,以及这些持续语音是否提供有效信息,而非单纯填补沉默。
1
2
标准版 Gemini 3.8 Live 做什么
Google 将 Gemini 3.8 Live 定位为适合低延迟、高并发对话场景的选择,强调避免由推理带来的响应停顿。它把实时对话与视觉理解结合起来,智能体可结合画面或其他视觉上下文参与交流。
10
45
Google 相关人士还称,该模型支持 97 种语言,并可在同一段对话中切换语言。实际部署前,开发者仍应针对目标口音、语言质量、地区可用性及具体业务场景做测试验证。
16
基准成绩可以参考,但不能替代选型
发布后的对比报道显示,在 Speech-to-Speech Quality Index 中,Gemini 3.8 Live 得分为 76.0,Gemini 3.8 Live Extended Thinking 为 82.6;OpenAI 的 GPT-Live-1 在中等推理力度设置下为 81.5。
25
在该项对比中,Extended Thinking 分数最高;但这不能直接等同于已经独立验证的生产环境“综合最优”。真正上线语音智能体,还需要评估打断处理、带口音或多语言语音识别与生成、工具调用准确性、高负载延迟、安全控制、可观测性,以及每个成功完成任务的总体成本。上述数字只是一个评测信号,不是适用于每个客服中心或助手场景的最终结论。
25
价格:应以 Live API 价表为准
Google 官方价表将两款新模型归入 Live API。标准付费层中,音频输入为每百万 token 3.00 美元,或每分钟 0.005 美元;音频输出为每百万 token 12.00 美元,或每分钟 0.018 美元。文本输入为每百万 token 0.75 美元,文本输出(含思考 token)为每百万 token 4.50 美元。
37
这一点很关键:其他 Gemini 3.8 Flash 型号的 token 单价,并不自动适用于 Live 系列。预算测算应以最新 Live API 价表和模型文档为准,并用真实会话压测,因为实际成本会受到输入和输出音频、视觉上下文、文本以及关联工具调用比例的共同影响。
37
开发者、企业与消费者端的可用性
Google DeepMind 将两款模型均列为正式可用(GA)。其公开可用性表显示,两者均覆盖 Gemini 应用、Google AI Studio、Gemini API 以及 Google Enterprise Agent Platform。
其中,Extended Thinking 列入 Google Search Live;Gemini 3.8 Live 则列入 Google Workspace。
54
对开发者而言,这意味着可在同一原生音频到音频模型家族中,在“实时流畅对话”和“更强后台推理”之间选择。企业用户还需进一步确认目标产品入口、数据控制要求、部署地区及集成路径是否匹配自身方案。
54
对生产级语音智能体意味着什么
Google 的竞争重点是把语音交互、视觉理解、后台推理和异步工具整合进同一模型家族。理论上,这可减少团队将语音识别、文本大模型、工具编排和语音合成等多个组件自行拼接的工作,并让任务处理期间的对话保持连贯。
1
10
GPT-Live-1 仍是评估全双工对话能力时的重要参照,但单一基准比较不足以决定平台选择。更可靠的评估方式,是使用有代表性的真实通话,测量打断处理、工具调用正确率、多语言表现、安全机制、故障恢复、延迟,以及每项完成结果的成本。
25
目前尚未明确的事项
现有发布材料并未明确 Gemini 3.8 Live 或 Extended Thinking 的 SynthID 音频水印具体政策。Google 已表示,SynthID 已扩展至为 Gemini 应用和网页端生成的文本添加并识别水印;但这并不能证明这两款 Live 模型生成的每一段音频流都带有水印,也没有说明检测方式或覆盖范围。
59
同样需要谨慎看待生态整合信息:平台集成与合作支持变化很快。计划用于生产环境的团队,应在确定技术架构前核验最新模型文档、价格、平台可用性和适用服务条款。
37
54