阿里通义团队9月18日正式上线新一代原生全模态模型Qwen3.8-Omni-Flash。该模型定位真实生产力场景,核心目标是提升Agent能力,推动全模态模型从理解全模态内容走向规划任务、调用工具并完成创作。模型支持文本、图片、音频、视频输入,提供100万Token上下文窗口,音频输入覆盖113种语言和方言,已在通义平台与阿里云百炼API开放调用。
官方披露的性能数据显示,模型在29项评测中的平均得分较上代Qwen3.5-Omni-Plus提升超过25%;音频输入的API价格较上代下降超过98%,音视频输入成本下降超过93%。在视频剪辑、音乐视频创作、影视解说、音视频转图文摘要等综合工作流中,模型可自行决定分析哪些片段、调用哪些工具并交付成品。同步推出的还有Qwen-MM-Plugins工具集与开源实时交互运行时Qwen-Live Harness。
【AICOR点评】这轮发布最值得关注的不是跑分而是成本曲线:音频输入成本降98%,意味着过去因价格不敢交给模型的长视频、长音频场景,如今具备了批量处理的经济性。全模态能力叠加工具调用,内容生产岗位的分工将被重新切分——人负责定义什么是好,模型负责把流水线跑完。企业内容团队该开始重排岗位说明书了。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。