行业观察

谷歌推出Gemini 3.8 Live实时音频模型:语音智能体进入边聊边办事时代

发布日期 2026-09-16 作者 信息来源 IT之家 · https://www.toutiao.com/article/7685896440337400371/ · 2026-09-16 标签 AI原生组织 / 自身即产品 / 上线
谷歌发布Gemini 3.8 Live与Extended Thinking两款实时对话模型,支持97种语言切换、异步工具调用与后台多步任务执行。

当地时间9月15日,谷歌宣布推出Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,定位为其迄今最先进的实时语音交互产品。其中标准版面向规模化与成本优化场景,Extended Thinking版本则面向高复杂度任务,强化多步推理能力。

基准成绩上,Extended Thinking版本以82.6分登顶Artificial Analysis语音对语音质量指数总榜第一,在tau-Voice智能体任务测试中完成率达68.6%,在Sierra的tau-Voice-banking金融场景基准中达35.1%;标准版在Big Bench Audio取得97.7%的成绩,并在用户偏好型榜单Speech Agent Arena中排名第二。定价方面,两款模型音频输入为每分钟0.005美元、输出每分钟0.018美元,已通过Gemini API与AI Studio向开发者开放。

产品特性上,模型可在对话中自动检测并切换97种支持的语言,近实时处理视觉输入,并支持在后台执行工具与API调用而不中断对话;所有生成音频均嵌入SynthID不可见水印。声网、LiveKit、Vercel等语音基础设施平台已同步完成接入。

【AICOR 点评】语音是下一个Agent入口,这条新闻把时间点又提前了。真正的看点是"异步工具调用不打断对话"——它意味着语音Agent从"问答玩具"跨入了"经办人"行列,客服、销售、政务热线这类重度语音场景的岗位设计将被重新评估。68.6%的任务完成率距离生产级仍有距离,企业引入时应当先在低风险流程试点、配套人工兜底,而不是直接替换整条客服线。

版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。

如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。

← 返回新闻列表