DeepSeek Harness公测后不到一周便迎来首次重要更新,14项调整一口气落地:原生图片请求、图文混合输入、子代理扩充、Windows终端修复……多模态成为这版的重头戏。

8月20日,DeepSeek Harness的v0.1.0-rc.8版本正式上线。作为公测后的首个大版本,这次更新覆盖了多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向,既补上了Agent处理图片这类多模态任务的能力,也顺手完善了子代理协作与终端交互的细节。

新版本支持原生图片请求和图文混合输入,/goal、/plan等命令可以直接吃进图片;Claude Code、Codex进一步被纳入其子代理体系,Windows端的终端体验以及图片请求、流式生成、自定义网关等一批问题也得到修复。

这套Agent Harness在8月13日开启v0.1版本公测并同步开源,公测当晚就有人拉下源码实测,完成了88页论文翻译、贪吃蛇游戏开发等任务。仅仅过去不到一周,多模态就补上了,社区里讨论声一片。

图片终于能直接喂给模型了

根据官方更新日志,DeepSeek模型适配器现在可以通过配置启用原生图片请求。对于具备视觉能力的模型,Harness可以直接把图片送进模型;/goal、/plan等指令也支持图文混合输入。输入框里的@菜单还新增了文件和会话引用,用户能直接把本地文件、已有会话拉进当前任务。

这意味着,过去主要围绕文本、代码和工具调用的Agent工作流,现在可以把截图、图片这类视觉信息纳入任务上下文,使用边界明显变宽。

DeepSeek Harness 多模态界面
配图来自原报道《DeepSeek Harness首发新版本:14项更新,多模态能力拉满》。

子代理体系也在继续扩充。新版支持把Claude Code和Codex作为Profile Bundle按需安装,其中Codex支持非交互权限模式以及多个命名实例,方便在同一个任务里配置不同的Codex子代理。Windows用户这波也被照顾到:PTY终端加入了持久PowerShell会话,并在极简模式预设中默认开启,减少命令执行时频繁重建终端环境的问题。

一批公测期暴露的问题被集中修掉

除了新能力,这次更新还收拾了一批公测后的烂摊子。单张图片尺寸过大、或历史会话里图片累积过多,此前可能导致模型请求直接失败,新版做了处理;取消一次流式生成后,已经显示的回复前缀此前不会被带进下一轮提问或分叉会话,这个问题也修正了;对于使用自定义OpenAI兼容网关的开发者,新版修复了部分网关因请求格式差异无法调用、以及推理内容回传缺失的问题。

DeepSeek Harness 终端界面
配图来自原报道《DeepSeek Harness首发新版本:14项更新,多模态能力拉满》。

给纯文本模型拼出一副"工具眼"

更有意思的细节藏在社区里。有开发者测试DeepSeek Harness处理图片时发现,当所调用的模型本身没声明图像输入能力,直接调用read_image会先失败,但任务不会就此停下——从执行轨迹看,Harness随后会退到另一套工具链:先做OCR文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。

举个例子,一张带文字和简单图形的图片,可以被拆成"文字内容及坐标""背景颜色比例""特定区域像素变化""图片尺寸"等多组信息,最后这些结构化结果被重新交给文本大模型,让模型根据OCR文本、颜色占比、像素位置等证据"脑补"出整张图的大致内容。

这套能力跟视觉大模型直接理解图片仍有明显差距:对PPT截图、流程图、界面截图这类结构相对明确的图片,它能靠OCR和像素特征拿到不少有效信息;面对真实照片、复杂空间关系,能恢复的信息就十分有限。但从Agent Harness的角度看,这个设计思路很有意思——视觉能力并不完全绑死在底座模型上,工具也能承担一部分感知工作。

事实上,在官方加强多模态支持之前,社区里已经围绕视觉能力冒出一批插件,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通过pi2dsh桥接的pi-vision等。其中一些方案就是靠OCR、像素分析、结构化证据或独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为本身支持视觉的模型配置input: [text, image],直接接收图片。rc.8上线后,原生多模态模型和这类工具层视觉方案可以进一步配合使用。

"一切皆插件"的思路在延续

8月13日公测时,DeepSeek Harness团队就强调过核心设计思路是"一切皆插件":模型、工具、技能、会话、沙箱、存储、循环、调度和UI等Agent能力,都可以由不同插件组合替换。当Harness拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也能通过工具编排被重新拆解和实现。rc.8正是在强化这条路线:视觉模型可以原生收图,纯文本模型也能借视觉工具拿到部分图像信息;Claude Code和Codex则可以作为子代理按需装进同一套Harness。

DeepSeek Harness 插件体系
配图来自原报道《DeepSeek Harness首发新版本:14项更新,多模态能力拉满》。

除核心变化外,rc.8还加入了web_search并发查询、子代理reportDelivery及时唤醒父任务、本地运行dsh web自动打开浏览器等优化,并提升了大型历史会话分叉以及SQLite后端的读写性能。从8月14日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness仍处于快速迭代阶段。接下来值得期待的,是这套插件化Harness能否把更多模型、工具和Agent装进同一个体系,跑出更复杂、更稳定的任务流程。

免责声明:本文基于公开报道的事实信息整理,仅供参考,不构成任何投资或技术选型建议。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部