9月23日,千问在2026云栖大会上发布Qwen-Audio-3.1系列语音大模型,共五款,覆盖语音识别(ASR)、音频理解(ASR-Next)、语音合成(TTS)、音频创作(TTS-Next)与实时交互(Realtime),形成理解、生成、交互、创作的完整音频能力栈,API已上架千问AI平台。
价格方面,Qwen-Audio全线语音模型下调:TTS降价约70%,Realtime降幅约85%,ASR降幅达95%。能力上,ASR支持约30种语言与16种中文方言,新增原生转写润色与分角色转写;TTS-Next可统一生成人声、音效与环境音;Realtime支持全双工对话与对话中工具调用,目前已与Qoder、千问办公及多款AI眼镜等智能硬件结合落地。
【AICOR点评】ASR直降95%是又一个词元通缩的样本:当语音调用成本趋近于零,过去因计费而精打细算的语音场景——实时质检、全量会议分析、口语陪练——将进入默认开启区间。语音入口的竞争逻辑也随之改变:从谁识别得准,转向谁听得懂业务、接得上工作流。对正在重构客户服务与内部协同的企业,建议重新测算一遍语音类AI场景的投入产出:半年前的立项模型今天很可能整体不成立,新的成本结构下,该做的是把语音智能体从试点线挪进生产主线。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。