行业观察

DeepSeek 多模态上新:V4-Flash-Vision-Exp 上线 API,视觉 Agent 能力接近 Opus 4.8

Publicado 2026-08-24 Autor Fuente 澎湃新闻 · https://www.thepaper.cn/newsDetail_forward_33825583 · 2026-08-21 Etiquetas Organización Nativa IA / Auto-Caso / Lanzamiento
DeepSeek 8月21日上线实验性多模态视觉理解模型 V4-Flash-Vision-Exp,视觉 Agent 能力接近 Opus 4.8,图片按 token 计费且价格与 V4-Flash 一致。

8月21日,DeepSeek 宣布实验性多模态视觉理解模型 V4-Flash-Vision-Exp 上线其 API 平台,正式开启多模态 API 服务。据介绍,该模型在 Agent、推理、世界知识等纯文本任务上与 DeepSeek-V4-Flash 正式版持平;而在需要视觉理解的 Agent 基准测试中,成绩相较 V4-Flash 大幅跃升,多模态 Agent 能力已接近 Opus 4.8。

计费方面,图片会转换成 token 按量计费,单张图片最多占用 384 tokens,价格与 V4-Flash 保持一致,开发者只需将 model 参数设为 deepseek-v4-flash-vision-exp 即可调用。同步推出的还有 Files API:图片文件上传一次后,可在不同请求中通过 file_id 反复引用,无需重复上传。

同一天,DeepSeek Harness 宣布更新并支持官方多模态,开发者预览版自 v0.1.0-rc.6 发布以来已连续完成三个版本迭代,重点覆盖多模态能力、子代理协作、跨平台兼容与使用体验。官方演示案例包括在 Agent 框架下生成商业定制自驾游 PPT、对官网进行二次创作,以及制作黏土怪物风格动态特效前端 Demo。

【AICOR 点评】DeepSeek 把视觉能力做成“Agent 原生”而非单纯的看图工具,方向踩得很准。对企业而言,视觉理解的真正价值在于让智能体直接读懂界面、图表与文档,进入业务流程的执行环节。配合 Files API 与 Harness 生态,企业搭建多模态人机协同工作流的门槛正快速下降,值得产研团队尽快纳入选型评估。

Aviso de Copyright Este artículo está asistido por IA, reescrito a partir de reportajes públicos. El copyright de la información pertenece a los autores y medios originales; el contenido es solo para compartir información del sector y no constituye asesoramiento de inversión ni comercial.

Por cuestiones de copyright, contacte a AICOR (400-601-8080 / WeChat: aicor-ai); lo gestionaremos con prontitud al recibir la notificación.

← Volver a Noticias