行业观察

科大讯飞发布Spark-ASR-2.0:202城方言免切换,推理成本仅增10%

Published 2026-09-24 Author Source 新浪科技 · https://k.sina.com.cn/article_6192937794_17120bb4202002uocs.html · 2026-09-23 Tags AI-Native Organization / Self as Product / Launch
讯飞9月23日发布新一代语音识别大模型Spark-ASR-2.0,方言、高噪、小音量场景优于业界最优,推理成本较上代仅增10%,9月24日起上线讯飞输入法并开放API。

9月23日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0,9月24日起逐步上线讯飞输入法,并通过讯飞开放平台提供API服务,后续将陆续落地讯飞AI眼镜、智能办公本、讯飞听见等产品。

据官方介绍,该模型采用非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术,在通用识别、复杂声学场景、上下文识别与文本流畅规范性方面明显提升,支持全国202个城市方言免切换识别,方言、高噪声、小音量等场景的表现优于业界最优水平。值得注意的是,其整体推理成本较上一代仅增加10%。识别结果还从一字不差升级为可结合语境流畅成文,自动精简冗余表达,减少用户手动润色。

【AICOR点评】语音是许多行业智能体的第一入口,而真实环境从不安静:车间噪声、方言口音、小声嘀咕,都是过去语音交互落不了地的硬骨头。讯飞这次的思路值得同行参考——不追单点极限,而是把复杂场景识别能力与推理成本曲线放在一起做工程权衡,用10%的成本增幅换取场景纵深。对企业部署而言,语音数字员工在客服、质检、会议纪要等非普通话、非安静环境的可用性将大幅提高。人机协同的密度,往往就取决于这些不起眼的听清能力。

Copyright Notice This article is AI-assisted, rewritten from public reports. Copyright of the information belongs to the original authors and media; content is for industry sharing only and does not constitute investment or business advice.

For copyright concerns, contact AICOR (400-601-8080 / WeChat: aicor-ai); we will handle it promptly upon notification.

← Back to News