DeepSeek Harness 开源:一切皆插件、省 Token、Agent 还能改装自己
作者 | Echo Tang
出品 | CSDN(ID: CSDNnews)
8 月 12 日深夜,DeepSeek 毫无预兆地上线了 V4 Pro 正式版(我们此前已有详细报道:《DeepSeek V4 Pro 正式版深夜 上线》)。但真正让全球开发者社区炸锅的,是十几个小时后白天的第二记重拳——DeepSeek Harness,一个以 MIT 协议完全开源的 Agent 框架,v0.1 开发者预览版,代码推到 GitHub 的那一刻,Hacker News 上的讨论帖直接冲上了 TOP 1,截至目前,GitHub Star 已经涨到了近 40k。
一个模型公司,同一天发了一个旗舰模型和一个开源框架。前者回答“模型有多强”,后者回答“强了之后,怎么用起来”。V4 Pro 的事我们已经讲过了,这篇文章聚焦后者——DeepSeek Harness 到底是什么,为什么它值得开发者花时间看一眼,以及它背后那篇论文在说什么。
不是“DeepSeek 版 Claude Code”
先把定位说清楚。
DeepSeek Harness(简称dsh)不是一个新模型,而是让模型能够使用工具、执行任务、与开发者协作的基础设施。如果把 DeepSeek 的模型比作大脑,Harness 就是它的身体和工作台。官方给它的核心设计原则只有六个字:一切皆插件(Everything is a Plugin)。
这句话不是口号。打开 GitHub 仓库的架构文档,你会发现:模型适配器是插件,工具注册是插件,Session Log 是插件,Agent Loop 本身也是插件,沙箱是插件,审批策略是插件,甚至 UI 都是插件。所有这些组件通过 Cordis 服务与事件彼此协作,在配置层自由组合。开发者不需要改动 Harness 的源码,就能以插件的方式独立选择、替换或扩展其中的任何一个能力。
这和 Claude Code、Codex、OpenClaw 的区别在哪里?后者是产品——你用它,按它的规则来。Harness 更像是一套元框架——你用它组装自己的 Agent 产品。模型可以换,工具可以换,循环逻辑可以换,安全策略可以换,UI 可以换。
不过,Hacker News 上也有开发者对“一切皆插件”的长期可维护性提出了直接质疑:“所有依赖‘社区插件’来提供功能的产品,头六个月都运行得很好,之后就是不兼容、过时、缺乏一致性和治理的噩梦”(“Every product relying on ‘community plugins’ for their features implies it works fine the 6 first months, then it’s a nightmare”)。这是一个真实的担忧——任何插件化系统都面临生态治理的长期挑战。DeepSeek 给出的回应是理论层面的:Cordis 的形式化保证确保插件可以被安全卸载,依赖关系可以被正确管理。但 4000 个 Koishi 插件的实践和一个全球开发者社区的实践,量级完全不同。这个问题后面还会再谈。
四种模式
Harness 提供四种预设模式,每种加载不同的插件集合:
•标准模式:完整工具组合,日常开发使用;
•PTC 模式(Programmatic Tool Calling):模型生成一段 TypeScript 代码来编排多轮工具调用,中间数据留在运行环境里,只有最终结果进入模型上下文,大幅降低 Token 消耗;
•极简模式:仅保留一个 shell 工具和一个文件编辑工具,用于模型基准测试;
•创造模式:可以检查当前运行时、在内存中试验 Cordis 插件,甚至让 Agent 改装自身——比如让接入了 V4 Pro 的 Harness 给自己创建一个官方 Web UI 没有的“三栏模式”。
这组预设或许是“一切皆插件”最直观的产品化表达:底层的模型路由、会话持久化、沙箱和审批仍由共享宿主提供,预设只决定一个 Agent Context 中具体装入哪些能力。
此外,模型看到的一切——系统提示词、思维链、工具调用与结果、子 Agent 调度,以及每一次上下文注入——都会写入一份仅追加(append-only)的会话日志。在 Trajectory 视图中,开发者可以按来源查看这些信息。恢复、分叉、检索与回放也都共享同一份事件流。
为什么是 TypeScript?
一个 AI Agent 框架选择 Node.js/TypeScript 而非 Python,在 AI 社区是一个不寻常的决定。Hacker News 上关于这个选择的讨论引发了大量跟帖。一位开发者给出了直接的理由:“Python 基本上需要容器化,否则每六个月就会腐烂一次……相比之下,TypeScript 有更好的类型系统和异步支持,可以在 Web、移动端、桌面端和服务端运行,UI 生态也好得多,因为它复用了所有 Web 技术”(“Python basically requires containers unless you are OK with it bit-rotting every six months or so”)。当然也有人补了一刀:“pip 几乎发明了供应链攻击;npm 把它完善了。大概算打平”(“Pip practically invented the supply chain attack; npm perfected it. That’s probably a draw”)。
从“一切皆插件”的设计哲学看,这个选择是自洽的——TypeScript 的类型系统天然适合描述插件接口契约,而 npm 生态的模块化传统也与插件化架构更为匹配。
快速上手
已安装 Node.js 的开发者,一行命令启动:
npx @deepseek-ai/dsh webWeb UI 默认运行在http://127.0.0.1:3080。从源码运行:
git clone https://github.com/deepseek-ai/deepseek-harness.git cd deepseek-harness pnpm install pnpm run build pnpm dsh webMIT 协议,完全开源。支持 MCP 协议与 OpenAI 兼容端点,Python SDK 驱动随附的 JSON-RPC 运行时,让 Python 应用也可以启动会话、发送任务、接收通知。
论文说了什么?开发者为什么该关心
Harness 不是凭空搭出来的。DeepSeek 同步发布了一篇论文——《A Programming Paradigm for Spatiotemporal Composability》,三位作者:Yifan Shi(北京大学 & DeepSeek-AI)、Wei Zhang(北京大学)、Tianyi Cui(DeepSeek-AI),2026 年 8 月 13 日预印本,目前仍在活跃修订中。
标题很学术,但它要解决的问题每个写过插件系统的开发者都遇到过:你装了一个插件,它注册了事件监听、分配了资源、修改了全局状态;现在你想卸载它——怎么保证干净地恢复原状?再进一步:你的插件 B 依赖插件 A 提供的服务,A 被热卸载了——B 怎么办?
现有的工程实践对这两个问题的回答通常是:重启。VSCode 就是典型——论文统计了 top 100 扩展,87 个包含可执行代码,卸载时需要重启整个 extension host;只有 7 个声明了 extensionDependencies。换句话说,当前最流行的插件系统在“动态卸载”和“依赖管理”两个方向上基本是放弃状态。
论文把这两个问题抽象为两个正交维度:
时间可组合性——插件被移除时,它做过的所有事情(注册的事件、分配的资源、修改的状态)必须被完全回滚。论文的解法叫“可逆副作用”(revertible effects):每个操作在执行时自动记录逆操作,运行时负责追踪和恢复。对开发者来说,这意味着你写插件时只需要声明“我要做什么”,框架保证“卸载时怎么撤销”——类似 C++ 的 RAII 或 React 的 useEffect cleanup,但被提升为一个通用的运行时机制,而不是靠开发者手动记得写 dispose。
空间可组合性——插件之间的依赖关系必须被结构化地声明和动态解析。论文的解法叫“响应式协效应”(reactive coeffects):当你依赖的服务出现、消失或变化时,框架会主动通知你,并将变化分类为“激活”“去激活”或“中性”。对开发者来说,这意味着你不需要轮询依赖是否可用,也不需要处理“依赖突然消失”的边界情况——框架替你管理了。
两者统一为一套类型系统(context type),在此之上定义组件的概念,并给出了形式化证明:插件可以在运行时任意加载和卸载,系统始终保持一致性。论文证明了五个关键性质——保持性、时间可组合性、空间可组合性、进展性和汇合性——将这些保证从单个插件推广到整个交错运行的插件系统。
Hacker News 上一位读过论文的开发者给出了一个很实用的总结:“它为插件系统增加了热重载和动态启用/销毁的能力……框架要求每个插件声明如何初始化和如何析构(类似 C++ 的 RAII、Rust 的 Drop trait),运行时负责正确处理生命周期事件。如果你不熟悉 OSGi、iPOJO、React 的 useEffect,值得一读;否则浏览即可”(“I think it’s worth reading if you are not familiar with OSGi, iPOJO, React’s useEffect; for others, a skim is enough”)。
评价中肯。对于已经熟悉动态模块化系统的人来说,Cordis 的核心思想并不陌生——但它确实第一次把这些工程直觉形式化了,并且把验证场景推到了 Agent:一个会自我改装、动态加载工具和技能的 AI Agent,恰恰是“时空可组合性”最极端的应用场景。论文结尾也明确指出,自进化 Agent Harness 是 Cordis 范式的下一个验证方向。
论文的工程实现就是 Cordis 元框架本身。它的 Case Study 是Koishi——一个拥有超过 4000 个社区插件的聊天机器人框架,Cordis 正是从 Koishi 生态中孵化出来的。从聊天机器人到 AI Agent,Cordis 走的是一条“先在小生态验证,再推向大场景”的路径。
谁在写这个项目?
翻开贡献者页面,从 2026 年 5 月 9 日到 8 月 9 日的提交记录一目了然:
排名 | 贡献者 | 提交数 |
|---|---|---|
#1 | tianyicui(Tianyi Cui / 崔添翼) | 5,235 |
#2 | LegGasai | 1,361 |
#3 | imccyu | 1,168 |
#4 | Chinesezjc | 587 |
#5 | turtle1999 | 585 |
排名第一的崔添翼,正是论文的第三作者,也是 DeepSeek Harness 团队的负责人。据南华早报今年 5 月的报道,他于 2026 年 3 月加入 DeepSeek,此前是量化交易公司 TSY Capital 的联合创始人(该公司 2022 年成立于香港),更早之前在 Jane Street 工作。浙江大学毕业。DeepSeek 同事 Deli Chen 在 X 上介绍他时说:“the owner of this project is one of our most gifted workmate.”他的 X 账号 @tianyi 简介写着“Member of Technical Staff @ DeepSeek, Harness Team”,关注者已超过 2.5 万。
排名第二的 LegGasai,GitHub 主页显示是清华大学软件工程硕士毕业生,研究方向为 Agent & AI-Infra,曾参与 Apache 开源社区(OSPP Mentee、LFX Mentee),Pinned 仓库里第一个就是 fork 的 deepseek-harness。
一个前 Jane Street 量化交易员带队,一个清华 AI-Infra 方向的新锐工程师紧随其后,三个月内累计超过一万次提交——这个项目的工程密度不低。
同一天,两件事,一个逻辑
回过头来看,V4 Pro 和 Harness 同天发布不是巧合。
7 月 31 日 V4 Flash 正式版发布时,更新日志里有一行容易被忽略的信息:在公开 Code Agent benchmark 中,V4 Flash 使用的测试框架正是“即将发布”的 DeepSeek Harness 极简模式。也就是说,Harness 在正式公开之前,已经开始参与 DeepSeek 对自身模型 Agent 能力的评估。V4 Pro 正式版所有官方公布的 Agent 基准成绩——DeepSWE 62.7、Terminal Bench 2.1 的 87.9——都是在 Harness 极简模式下跑出来的。
模型和框架是一体两面。V4 Pro 的 Agent 能力需要一个足够灵活的运行环境才能释放,而 Harness 的“一切皆插件”设计需要一个足够强的模型才能展现价值。两者同天发布,DeepSeek 的意图很清楚:不只是发一个更强的模型,而是发一套从模型到工程框架的完整 Agent 基础设施。DeepSeek 不再满足于只提供一个可以被调用的模型,而是开始争夺模型之上的开发者入口。
Hacker News 上有开发者从竞争格局的角度做了一个更尖锐的判断:“他们目前占据了整个帕累托前沿——在每一个商业可用的输出质量水平上,都提供成本最低的模型。我们在 90 年代见过同样的态度,Silicon Graphics、Sun 对 Linux 和 Windows 的态度,最终导致了那些公司的毁灭”(“They currently own the entire Pareto frontier”)。类比是否恰当见仁见智,但 V4 Pro 以 Fable 5 六十分之一的价格逼近其 Agent 性能,再搭配一个完全开源的框架——这个组合拳的压力是实实在在的。
OpenAI 的答案是 Codex 和 Responses API。Anthropic 的答案是 Claude Code 和 MCP。现在 DeepSeek 给出了自己的答案:一个完全开源、MIT 协议、一切皆插件的 Agent Harness,背后有一篇严肃的 PL 论文做理论支撑,加上一个在 Agent 基准上逼近 Fable 5 的旗舰模型,价格是对方的六十分之一。
至于这个答案够不够好——v0.1,开发者预览版,官方自己也说“仍有许多细节有待改进和打磨,核心插件与基础接口也将在后续快速迭代演进”,仓库 README 里用加粗大写写着“THERE WILL BE COMPATIBILITY-BREAKING CHANGES”。但方向已经亮出来了,39000 颗 Star 是开发者用脚投的票。
相关链接:
• DeepSeek V4 Pro 正式版报道:https://mp.weixin.qq.com/s/NhDraVIppustqs4FIUdWhQ
• DeepSeek Harness 官方公告:https://mp.weixin.qq.com/s/mANdGRI4fO_sEbC1ECEoZQ
• GitHub 仓库:https://github.com/deepseek-ai/deepseek-harness
• Cordis 论文:https://github.com/cordiverse/paper
• Hacker News 讨论(TOP 1):https://news.ycombinator.com/item?id=49285244