当地时间9月15日,谷歌宣布推出Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,定位为其迄今最先进的实时语音交互产品。其中标准版面向规模化与成本优化场景,Extended Thinking版本则面向高复杂度任务,强化多步推理能力。
基准成绩上,Extended Thinking版本以82.6分登顶Artificial Analysis语音对语音质量指数总榜第一,在tau-Voice智能体任务测试中完成率达68.6%,在Sierra的tau-Voice-banking金融场景基准中达35.1%;标准版在Big Bench Audio取得97.7%的成绩,并在用户偏好型榜单Speech Agent Arena中排名第二。定价方面,两款模型音频输入为每分钟0.005美元、输出每分钟0.018美元,已通过Gemini API与AI Studio向开发者开放。
产品特性上,模型可在对话中自动检测并切换97种支持的语言,近实时处理视觉输入,并支持在后台执行工具与API调用而不中断对话;所有生成音频均嵌入SynthID不可见水印。声网、LiveKit、Vercel等语音基础设施平台已同步完成接入。
【AICOR 点评】语音是下一个Agent入口,这条新闻把时间点又提前了。真正的看点是"异步工具调用不打断对话"——它意味着语音Agent从"问答玩具"跨入了"经办人"行列,客服、销售、政务热线这类重度语音场景的岗位设计将被重新评估。68.6%的任务完成率距离生产级仍有距离,企业引入时应当先在低风险流程试点、配套人工兜底,而不是直接替换整条客服线。
Aviso de Copyright Este artículo está asistido por IA, reescrito a partir de reportajes públicos. El copyright de la información pertenece a los autores y medios originales; el contenido es solo para compartir información del sector y no constituye asesoramiento de inversión ni comercial.
Por cuestiones de copyright, contacte a AICOR (400-601-8080 / WeChat: aicor-ai); lo gestionaremos con prontitud al recibir la notificación.