导语:DeepSeek在发完V4 Pro正式版之后,紧跟着把自己的Agent底座端了上来,名字叫Harness。它把整个Agent拆成一个个可以随手插拔的插件,核心是一个叫Cordis的内核,官方还配了100多个插件、写了88页论文讲原理。这篇文章带你把它从里到外过一遍。
先说个背景。昨天DeepSeek V4 Pro正式版刚上线,预告很久的Agent产品紧接着就落地了,这节奏够紧的。到作者写完这篇文章时,Harness在GitHub上已经冲到3.7万星,热度肉眼可见。我玩了一圈、翻完开发者文档、又装了几个插件,感受是:这东西确实不太一样,而且大概率是个两极分化的产品——喜欢的人觉得它代表未来,看不惯的人会觉得它粗糙到毫无用户体验可言。
先搞清楚Harness到底是啥
DeepSeek官网放了一条公式:Agent = Model + Harness。这个说法最早是LangChain在聊Agent Harness的时候提的,意思是好的Agent必须由外壳和模型一起构成。Claude Code、Codex、Workbuddy这些产品,本质都是外壳,得配上Claude Fable 5、GPT 5.6-Sol这类模型才能干活,否则就是个空架子。
一个完整的外壳,里面东西其实很多:工具、Skills系统、会话、沙箱、存储、Agent循环、调度、子Agent、工作流,等等。过去这些东西全被塞进一个以软件为名的壳里,比如Codex,厂商早就封装好了,用户几乎不用操心,真正能自己动手折腾的也就Skill和MCP这类地方,其余的你改不了,也懒得去改。
DeepSeek Harness的不一样在于:上面说的所有东西,全都变成了插件,随便你自定义。打个比方,过去的Agent像出厂整机,Harness更像模块化手机,什么部件都能自己换着来。
真正的核心只有一个,叫Cordis的内核,这个内核的作者加入了DeepSeek,这次还配套发了一篇88页的论文。内核做的事极其克制,只管插件的加载、卸载和依赖管理,其他一概不管。最厉害的是,Agent运行过程中随时换插件,运行状态都不带崩的。
支撑这一点的是两个特性。一个是时间可组合性(Temporal composability),意思是某个插件卸载之后,它之前产生的副作用能不能被彻底撤销;另一个是空间可组合性(Spatial composability),指的是一个插件依赖别的插件时,当那些插件出现、消失、发生变化,它能不能动态地重新整理自己的依赖关系。
这两个特性合起来,意味着Agent可以在运行中不断给自己开发、安装、卸载插件,不停给自己加能力或者减能力,某种意义上就是在自进化。所以与其说Harness是个Agent产品,不如说是一个为了展示Cordis内核、预设了100多个一方插件的科研成果——这正是"一切皆插件"这个理念真正的落点。
想通这一点,也就明白它为什么不叫DeepSeek Code、不叫Build,偏要取Harness这个很工程的名字,版本也叫开发者预览版。因为做的不是用户产品,是基建,是Harness系统,等的是全世界开发者进来一起插拔、一起把生态做起来,顺便完成Agent的自进化。社区为此吵成一团:一边喊理念封神,一边说这玩意儿鬼才用。新东西有争议太正常,最好的办法就是自己上手试一把。
装起来也就几步的事
官方入口在deepseek.com/harness/。看不懂安装命令也没关系,把它丢给任何本地Agent产品,让它帮你装。装好之后会弹出一个本地网址,复制到浏览器打开就行。
第一次运行要填DeepSeek API Key,去platform.deepseek.com申请一个,记得先充点钱。填完就进首页了,一个标准的WebUI,有意思的是这个界面本身也是一个UI插件,也就是说连界面你都能改。已经有群友(黑哥小黑子,blake)顺手做了皮肤插件。
模型可以选Flash和Pro两档,还能调思考强度。这里得提醒一句:DeepSeek正式官宣涨价了,而且涨得不轻。V4 Pro的缓存命中价格直接涨了12倍,高峰期的输出价格涨到离谱的27块。之前我还猜大概两倍左右,结果高峰起步就3倍,曾经的"价格屠夫"吸引力一下少了不少。
横向比一下,跟GLM、Qwen 3.8 Max已经拉不开多少差距了。何况GLM-5.3马上要发,价格大概率不动,能力基本又是开源SOTA,单从API性价比来说,V4 Pro可能比不过GLM。不过Harness并没把你锁死在自家模型上,它支持添加目录里的模型提供方,也支持自定义提供方、Base URL、协议和模型列表,以后完全可以把别家模型接进来,比如直接在Harness里用GLM。
回到首页点"选择工作区",添加一个项目目录,这就是你的Agent能操作的项目文件范围。
四种模式,别被绕晕
在搞懂了Cordis内核之后,千万不要把下面这四种模式当成Harness的真正机制,它们只是官方给的几种模板预设,方便你开箱即用的。
标准模式。第一次用、或者对底层机制不熟的话,无脑选这个。它自带完整的代码Agent能力:文件读写编辑、Shell、文件搜索、网页搜索、Skills、计划、目标、后台任务、子Agent和工作流,插件都预配好了。
PTC模式。拥有标准模式的全部能力,区别在工具的呈现方式上。标准模式里模型通常一次调一个工具,拿到结果再走下一步;PTC会丢给模型一套Code Mode SDK,让它写一段TypeScript程序,在一次run_code里把多个工具操作组合起来。原本可能要五次模型往返的读取、搜索、筛选、并行调用和整理,有机会压进一次执行,来回对话少了,也更适合结构化、多步骤、可并行的活儿,还省Token。代价是模型得具备稳定的代码规划能力,调试难度不低,小白先别碰。等遇到大量重复的工具往返,或者想测DeepSeek模型的程序化工具调用能力时,再开PTC。
极简模式。只给模型两个核心工具:一个持久Bash,一个文件编辑器。系统提示词固定成一句简单的"你是一个有帮助的软件工程助手",去掉上下文压缩和一堆额外能力。这个模式主要用来做最小环境下的模型基准测试,比如想对比两个模型的裸Agent能力时非常好用,日常用就别想了,你会发现基本没法用。
创造模式。它才是Harness最特别的地方,也是Cordis内核最棒的体现。它拥有标准模式的全部能力,还能检查自己正在运行的Cordis环境,在内存里试验插件,帮你创建新的Agent和插件。说白了,它能让Agent直接改造自己。你可以告诉它"帮我做一个只允许读代码、不允许改文件、专做安全审计的模式",也可以让它"做一个接入公司内部搜索、固定用某个模型、带三种专属Skills的研究Agent",甚至先让它检查自己身上缺什么插件,缺了当场造一个,挂进正在运行的流程。用一个比喻:Agent发现自己没有扳手,于是现场造了一把扳手,插到自己手上,接着用这把扳手继续干活。
会话日志与社区插件
Harness对开发者还有个很友好的设计:会话被做成了只追加的事件日志。模型看到的系统提示词、用户消息、推理内容、工具调用和结果、权限变化、上下文注入、压缩、子Agent调度,全都会成为日志里的事件,下一轮模型看到的历史,也是从这份日志重新推导出来的。这件事价值不小——以前Agent跑崩了,你只能看到失败或者死循环,根本不知道它从哪一步开始跑偏。现在轨迹视图可以按来源查看每一次运行,可观测、可审计、可复现,非常适合做研究。
官方第一方插件,在设置页面的插件栏里都能看到,看不懂也不用管,直接用就行,缺什么还可以用创造模式自己造。跟Harness一起上线的还有社区插件入口,有不少开发者做的三方插件,我挑了几个顺手的推荐一下。
dsh-at-file:装完直接在输入框@就能调用文件,很方便。
dsh-genui:允许模型在回复里直接渲染图表、表格、表单、Diff、Mermaid、交互面板之类的,很有用。
dsh-automation:给Harness补上自动化能力,刚需,就是交互感觉稍微有点问题。
DSH-better-sidebar:直接给Harness补上一套类似VS Code的工作台,文件管理、代码编辑、真实终端、Git、Diff、内嵌浏览器、后台任务和子代理状态都塞进侧边栏,功能更多,也更好用一些。
ModLens:给纯文本的DeepSeek模型补上视觉能力,配置好视觉通道之后,往对话里粘贴图片,模型就能读图,也是刚需。
总的来说,DeepSeek Harness是个很有意思的系统,插件插拔这个概念也确实漂亮,但从产品角度讲,对普通用户还很不友好:开发者术语多、使用门槛高、功能偏少、体验粗糙,每一步都可能劝退路人。不过DeepSeek本来就是更看重科研和探索的团队,就像他们的Slogan说的——探索未至之境。剩下的彩蛋,就留给大家自己去挖了。
免责声明:本文基于公开报道的事实信息整理,仅供参考,不构成任何投资或技术选型建议。
发表评论 取消回复