导语:DeepSeek正式推出视觉模型deepseek-v4-flash-vision-exp,这是V4系列首个支持图片输入的视觉模型。从Agent Harness发布时的"模型不支持图片"尴尬,到一周后迅速补齐视觉能力,DeepSeek正在把感知入口接入Agent工作流,为多模态Agent时代铺路。
DeepSeek终于"开眼"了。8月21日下午,DeepSeek官方API文档出现了一个新的模型:deepseek-v4-flash-vision-exp。这是DeepSeek V4系列首个直接支持图片输入的视觉模型,拥有1M上下文,最大输出长度384K,支持JSON Output、Tool Calls等能力。
就在一周前,DeepSeek刚开源了自己的Agent Harness。但一个非常实际的问题很快暴露:DeepSeek自己的模型没有视觉能力。在Harness的GitHub讨论区里,"怎么让DeepSeek看图"已经成为高频问题。开发者上传图片时,Harness直接返回:MODEL_DOES_NOT_SUPPORT_IMAGES。
社区开始自己给DeepSeek"装眼睛"。一种方案是在DeepSeek前面接一个视觉模型,先把图片转成文字描述再交给DeepSeek推理;另一种方案尝试修改Harness让图片先保存到工作区再由视觉插件读取。GitHub上已经出现了多个vision bridge插件。
V4 Flash Vision Exp的出现开始补上这块短板。它被放进了V4 Flash产品线而非V4 Pro,这意味着DeepSeek首先选择将视觉能力接入更小、更快、更便宜的模型。V4 Flash本身只有284B总参数、13B激活参数,定位高吞吐、低成本。
瞄准的不是单纯的图片聊天,而是大量发生在Agent里的视觉任务——读网页截图、识别报错界面、分析图表、查看软件UI、读取设计稿。这些任务对"单次图片理解达到最强"未必有极端要求,却非常在意速度、价格以及能否连续运行。
定价延续V4 Flash,图片按Token计费。每张图片最高换算为384 tokens,缓存命中空闲时段价格为0.05元/百万Token。DeepSeek继续把新能力压进现有Token计价体系,视觉理解再次进入价格战区间。
它仍然带有Exp后缀——DeepSeek此前也走过类似路线,先推出实验版验证新架构,再根据社区反馈决定最终版本。Vision Exp很可能承担类似角色:先把模型交给开发者,在真实图片和Agent工作流中寻找问题,再决定最终版本。
与此同时,DeepSeek同步推出了Files API,开发者可以先上传图片文件,通过file_id在不同请求中引用同一文件,无需重复上传。对于需要长期分析产品资料的Agent来说,这类文件管理能力的重要性正在提升。
多模态能力的加入让Agent能处理的信息范围进一步扩大。文字是人类交流的重要方式,但大量真实工作依赖图片、文件、界面和环境信息。一个只能处理文本的Agent,很难真正进入办公、设计、开发等复杂场景。DeepSeek通过V4 Flash Vision Exp、Files API以及Harness生态支持,正在尝试补齐这一环节。
免责声明:本文内容整理自公开报道,AI 产品动态与进展以官方发布为准,仅供参考,不构成任何投资建议。
发表评论 取消回复