9月23日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0,9月24日起逐步上线讯飞输入法,并通过讯飞开放平台提供API服务,后续将陆续落地讯飞AI眼镜、智能办公本、讯飞听见等产品。
据官方介绍,该模型采用非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术,在通用识别、复杂声学场景、上下文识别与文本流畅规范性方面明显提升,支持全国202个城市方言免切换识别,方言、高噪声、小音量等场景的表现优于业界最优水平。值得注意的是,其整体推理成本较上一代仅增加10%。识别结果还从一字不差升级为可结合语境流畅成文,自动精简冗余表达,减少用户手动润色。
【AICOR点评】语音是许多行业智能体的第一入口,而真实环境从不安静:车间噪声、方言口音、小声嘀咕,都是过去语音交互落不了地的硬骨头。讯飞这次的思路值得同行参考——不追单点极限,而是把复杂场景识别能力与推理成本曲线放在一起做工程权衡,用10%的成本增幅换取场景纵深。对企业部署而言,语音数字员工在客服、质检、会议纪要等非普通话、非安静环境的可用性将大幅提高。人机协同的密度,往往就取决于这些不起眼的听清能力。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。