Google在2026年9月发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,两款模型面向近实时语音对话。标准Live强调规模、成本、流畅交流和视觉依据,Extended Thinking则面向需要多步推理的复杂任务。实时语音Agent不应只追求声音自然,还要在延迟、打断、工具调用、隐私和复杂度之间做选择。
一、两款模型如何选择
导航说明、基础客服、实时翻译和设备控制更关注响应速度,优先测试标准Live。复杂诊断、长步骤规划和需要整合多项信息的任务可考虑Extended Thinking。不要因为“更强”就全部使用扩展推理,思考时间和成本可能影响对话节奏。可以按意图动态路由,简单问题走快模型,复杂任务升级。
二、语音延迟要拆开测量
整体等待由语音端点检测、上传、模型首包、工具执行和语音合成共同组成。只测接口响应无法解释用户为什么觉得慢。记录用户停顿到首个有效声音的时间、完整回答时间和被打断后的恢复时间。弱网、蓝牙耳机和移动设备都要单独测试。
三、打断与轮次管理
自然对话允许用户在模型说话时插入,但系统要判断是背景声音、简单附和还是真正打断。有效打断后立即停止播放并保留必要上下文,避免模型继续旧任务。涉及转账、发送和删除时,用户打断应优先取消待执行动作,而不是只改变后续文字。
四、视觉依据能做什么
标准Live支持结合视觉信息理解环境,可用于设备指导、商品识别和现场辅助。应用应明确摄像头何时开启,并在界面持续显示状态。不要默认持续上传。识别人脸、证件、医疗影像和私人空间时需要更严格授权,模型描述也要提示可能误判。
五、工具调用需要确认层
语音中的“帮我订”“发给他”容易出现指代不清。模型可以准备操作,但在金额、对象、地址和时间上必须复述确认。后端校验权限和参数,不能仅凭转写文本执行。对不可逆动作提供取消窗口,并在屏幕显示结构化摘要。
六、复杂推理何时升级
当任务包含多个约束、需要比较方案或连续使用工具时,可以切换Extended Thinking。升级前用一句话告诉用户正在进一步分析,避免沉默造成误解。若复杂任务超过语音适合的长度,应把详细结果同步到屏幕,语音只读结论和关键选择。
七、隐私与数据处理
麦克风和摄像头权限按需请求,结束会话后停止采集。日志优先保存转写与结构化事件,是否保存原始音视频要单独征得同意。企业会议、医疗和儿童场景需评估更严格的法规要求。开发调试日志也要脱敏,不能长期保留完整会话。
八、上线前测试清单
覆盖不同口音、语速、噪声、多人说话和网络波动;检查打断、重连、工具失败和超时;让用户完成真实任务并记录误操作。对高风险意图测拒绝和确认流程。实时Agent是否好用,不取决于一次演示多聪明,而在于它能否稳定听懂、及时回应,并在不确定时停下来问清楚。
资料来源:官方资料。本文依据官方信息独立整理,并结合实际场景扩展。