行业观察

阿里通义发布Qwen3.8-Omni-Flash:全模态Agent成本再降一个数量级

发布日期 2026-09-20 作者 信息来源 腾讯研究院 · https://www.sohu.com/a/1078322629_455313 · 2026-09-20 标签 AI原生组织 / 自身即产品 / 上线
新模型支持文本、图像、音频、视频输入与1M长上下文,音频输入API价格较上代下降超98%。

阿里通义团队9月19日正式发布新一代原生全模态模型Qwen3.8-Omni-Flash。该模型面向音视频Agent场景设计,支持文本、图像、音频、视频四类输入,具备100万Token长上下文与工具调用能力。官方披露,模型在30项评测中的平均表现较上代提升超过26%,音频能力整体超过Gemini 3.8 Flash。

商业层面,这次发布直接把音视频场景的使用成本大幅压低:每小时音频输入价格较上代下降超过98%,音视频输入整体降幅超过93%。同步开源的还有Qwen-MM-Plugins工具集与Qwen-Live Harness实时交互评测框架。应用场景上,模型可完成视频剪辑、短剧翻译配音、电影解说与会议纪要等端到端工作流,Agentic理解准确率升至67.8%。

【AICOR点评】成本下降一个数量级意味着商业模式被重新定义:过去只敢小规模试用的音视频内容生产,现在可以变成规模化、常态化的流水线。企业内容团队下一步要思考的不是能不能用AI做视频,而是如何把创意判断与工程交付拆成两个环节,让模型负责后者,人专注前者。

版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。

如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。

← 返回新闻列表