行业观察

阿里通义发布Qwen3.8-Omni-Flash,全模态模型从看懂走向做完

发布日期 2026-09-18 作者 信息来源 通义官网 · https://qwen.ai/ · 2026-09-18 标签 AI原生组织 / 自身即产品 / 上线
新一代原生全模态模型上线,1M上下文支持音视频Agent工作流,官方称音频输入API成本下降超98%。

阿里通义团队9月18日正式上线新一代原生全模态模型Qwen3.8-Omni-Flash。该模型定位真实生产力场景,核心目标是提升Agent能力,推动全模态模型从理解全模态内容走向规划任务、调用工具并完成创作。模型支持文本、图片、音频、视频输入,提供100万Token上下文窗口,音频输入覆盖113种语言和方言,已在通义平台与阿里云百炼API开放调用。

官方披露的性能数据显示,模型在29项评测中的平均得分较上代Qwen3.5-Omni-Plus提升超过25%;音频输入的API价格较上代下降超过98%,音视频输入成本下降超过93%。在视频剪辑、音乐视频创作、影视解说、音视频转图文摘要等综合工作流中,模型可自行决定分析哪些片段、调用哪些工具并交付成品。同步推出的还有Qwen-MM-Plugins工具集与开源实时交互运行时Qwen-Live Harness。

【AICOR点评】这轮发布最值得关注的不是跑分而是成本曲线:音频输入成本降98%,意味着过去因价格不敢交给模型的长视频、长音频场景,如今具备了批量处理的经济性。全模态能力叠加工具调用,内容生产岗位的分工将被重新切分——人负责定义什么是好,模型负责把流水线跑完。企业内容团队该开始重排岗位说明书了。

版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。

如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。

← 返回新闻列表