基于 DeepSeek-V4-Pro-0813 与 DeepSeek Harness v0.1 开发者预览版的公开信息整理。
发布日期:2026 年 8 月 13 日 | 开源协议:MIT | 仓库:github.com/deepseek-ai/deepseek-harness


一、DSH 是什么:Model + Harness = Agent

DSH 不是新模型,也不是 API 客户端,而是一套 Agent 运行框架——负责把模型接入文件系统、终端、网页、代码工具和其他 Agent,并组织上下文、工具调用和任务执行。

传统聊天模型收到问题返回文本即结束,而 Coding Agent 需要"理解任务 → 寻找文件 → 修改代码 → 运行命令 → 检查结果 → 继续修改"的持续循环。决定最终效果的不只是模型本身,还包括模型拿到了什么工具、系统提示词如何组织、上下文怎样压缩、出错后是否重试、任务如何拆分。DSH 解决的就是从模型输出到真正执行之间的"最后一公里"。

对标产品:OpenAI Codex、Anthropic Claude Code。这是国内大模型厂商首次将"Agent Harness"作为独立开源产品线对外发布。


二、运行方式:Web UI 而非终端

启动命令:

npx @deepseek-ai/dsh web

前提:已安装 Node.js(建议 v18+)。首次下载约数十 MB,启动后在浏览器访问 http://127.0.0.1:3080/ 进入操作界面。

与 Claude Code 的交互形态差异

维度 Claude Code DeepSeek Harness
交互形态 终端原生,输入 claude 直接进入对话循环 浏览器 Web UI,本地起服务
启动流程 输入命令 → 选目录 → 即用 装 Node → 跑命令 → 开浏览器 → 填 API Key → 选 Agent 预设
界面形态 终端内一切交互 类 DeepSeek 网页版,左侧会话列表 + 右侧对话区
客户端 原生 CLI 无 Electron 客户端,仅 Web UI
可替换性 界面固定 UI 本身是 Cordis 插件,可替换为 TUI 等其他形态

使用注意事项

  • 端口 3080 被占用会启动失败,需先检查并清理残留进程
  • Web 版出厂关闭 Skill 功能(命令行版默认开启),需用 --patch 参数手动启用,否则不生效且不报错
  • 每次新会话需选择 Agent 预设(标准 / PTC / 极简 / 创造四种模式)

三、Cordis 架构:一切皆插件

核心设计

DSH 基于 Cordis 元框架构建。Cordis 只负责插件的挂载/卸载与依赖管理,所有 Agent 能力——模型、工具、技能、会话、沙箱、存储、循环、调度、UI——全部以独立插件形式存在。连 agent loop 本身都是可替换插件,不存在"为了改核心必须 fork"的特权层。

四种预设模式

模式 特点 适用场景
标准 完整工具集(文件编辑、shell、搜索、技能、规划、子代理、工作流) 日常编码
PTC (Programmatic Tool Calling) 模型生成 TypeScript 程序,一次编排多轮工具调用 批量操作,减少往返
极简 仅 shell + 文件编辑器 最小环境下跑模型基准测试
创造 检查运行时、在内存中试验 Cordis 插件、组合全新模式 插件开发、自进化探索

Trajectory 回放

Chat 视图展示润色后对话,Trajectory 展示原始事件级记录——模型调了什么工具、传了什么参数、返回了什么结果——可随时回放审查。这是 Claude Code 不具备的能力。


四、Cordis 的理论基础:时空可组合性

论文

《A Programming Paradigm for Spatiotemporal Composability》,北京大学与 DeepSeek 联合署名,作者 Yifan Shi、Wei Zhang、Tianyi Cui(崔添翼)。共 88 页。

核心问题:插件插上去拔不下来

表面上看,"插件化"是一个被反复提过的概念——VSCode 有扩展、Eclipse 有插件、Chrome 有扩展商店。但 Cordis 论文指出了一个几乎所有现有插件系统的通病:插件插上去就拔不下来。论文实测了 VSCode Marketplace 排名前 100 的扩展,其中 87 个包含可执行代码,一旦激活就无法在运行时单独卸载,禁用或删除后必须重启整个宿主进程。这意味着删掉一个插件的代价是所有已加载插件跟着一起重启。几乎所有插件架构都存在此类缺陷。

Cordis 要解决的核心问题是"时空可组合性"。时间维度上,组件卸载后要能自动撤销自身对系统造成的状态修改(副作用回收);空间维度上,当一个组件依赖的服务出现、消失或被替换时,系统能自动调整相关组件的依赖关系。数学根基来自类型论中的"效应"(effects)和"余效应"(co-effects)两个经典概念。Cordis 会追踪组件通过 Context 产生的副作用,卸载时自动执行恢复操作——不需要插件开发者自己写清理逻辑,框架层面帮你兜底。

这个问题的难度在于它不是纯工程问题,而是需要一个理论框架来形式化描述"副作用的生命周期"和"依赖关系的动态拓扑变化"。做一篇论文不难,难的是把理论落地成能跑四年的生产系统。

两个维度

  • 时间可组合性:组件卸载后,自动撤销自身对系统造成的状态修改(副作用回收)
  • 空间可组合性:组件依赖的服务出现、消失或被替换时,系统自动调整相关组件

数学根基

类型论中的效应 (Effects) 和余效应 (Co-effects) 两个经典概念。Cordis 追踪组件通过 Context 产生的副作用,卸载时自动执行恢复操作——不需要插件开发者自行编写清理逻辑。

生产验证

Cordis非实验室产物。已在 Koishi 聊天机器人框架上运行 4 年,超过 4000 个社区插件在生产环境验证。


五、为何此前没人落地,偏偏是 DeepSeek

此前没人做的原因

1. 商业动机不对齐。 OpenAI/Anthropic 做的是紧耦合成品——模型和框架都是自己的。全插件化意味着用户可替换掉自己的模型和工具链,商业上是自我拆台。

2. 投入产出比不明朗。 Cordis 要求在框架底层实现"插件热插拔 + 副作用自动回收 + 依赖动态拓扑管理",极其重的基础设施工程。论文 88 页、Koishi 验证 4 年——不是三个月能搞定的功能。

3. 需求紧迫性是最近才出现的。 “自进化 Agent"场景(Agent 自己生成工具、装进运行时、替换有问题的)在 2025 年才开始被认真讨论。在此之前,插件拔不下来的代价只是"重启一下”。而2026年需求端真正出现"Agent 需要运行时动态增删改组件"的明确信号,同时模型能力达到可以"自己写插件代码"的门槛。

4. 需要罕见的跨界能力。 Cordis 的理论基础是类型论中的效应和余效应——偏学术编程语言理论范畴,与 Agent 工程实践之间有巨大鸿沟。

为什么是 DeepSeek

人的因素(第一位)。 Cordis/Koishi 的作者加入了 DeepSeek。Koishi 框架已运行 4 年、4000 个社区插件验证过——有四年生产验证的成熟底座被移植到了 Agent 领域。

研究文化是放大器。 DeepSeek 团队特征:没有部门墙,168 人形成稳定合作;"兵团+小组"模式;Top 25 研发作者近四成来自北大;超半数跨界,79 人横跨 3 个以上方向。允许做聊天机器人框架出身的人把插件化理念带到基础模型公司并获得资源落地为新产品线。

竞争策略需要这一步。 DeepSeek 此前的竞争焦点在模型性能、开源权重、低价 API——都是模型层。行业竞争正向执行层延伸(Claude Code 是 Anthropic 的入口,Codex 是 OpenAI 的)。MIT 开源模型 + MIT 开源可自由改造的 Agent 框架 = 完整的私有化 Agent 方案,Claude Code 和 Codex 都给不了。

北大合作提供学术支撑。 Cordis 论文是 DeepSeek 与北大今年第七篇合作论文。类型论根基的研究需要学术合作渠道来孵化。

总结:四个稀缺条件的汇合 —— 跨界的人/团队 + 愿意长期投入的组织 + 自进化需求拉动 + 执行层建立护城河的商业动机。DeepSeek 恰好是这四个条件同时成立的交集点。


六、能否赶超 Claude Code

架构开放性:DSH 已领先

Claude Code 是模型与框架紧耦合的成品。DSH 全插件化,连 agent loop 可替换,模型可接入第三方。但开放架构的胜利靠生态而非架构本身。

模型能力:差距收窄但未抹平

Terminal Bench 2.1:V4-Pro 得 87.9。DeepSWE 从 12.8 跃升至 62.7。但"模型强"和"模型+框架组合强"是两回事。Claude Code 的优势在于框架与模型的深度协同优化(提示词、工具调用组织、上下文压缩都针对 Claude 特性调校)。

生态和心智份额:DSH 明显劣势

DSH 发布 1.5 小时 Star 破 2.4 万,但 Star 数不等于生产采用。Claude Code 已占据 Vibe Coding 默认选择位置。NPM 插件生态能否形成飞轮是最大不确定性。

私有化部署:DSH 结构性优势

DeepSeek 模型 MIT 开源、可适配国产 GPU + DSH MIT 开源框架 = 政企私有化唯一可行国产方案。Claude Code 完全无法参与此场景。

产品成熟度:差距显性

DSH 仍是 Developer Preview,有破坏性变更风险。无 Electron 客户端,仅 Web UI。学习成本不低,使用习惯差异大。

结论

  • 衡量"紧耦合编程助手产品的稳定体验" → 短期难说赶超,差距约一年以上工程迭代
  • 衡量"可自由组装、可接入任意模型、可私有化部署的 Agent 框架的架构先进性和生态潜力" → DSH 已在不同赛道上,赌的是"插件化 Agent 平台"范式会比"紧耦合编程助手"走得更远

飞轮能否启动取决于三件事:NPM 插件生态能否形成、框架稳定性能否快速收敛、DeepSeek 模型 Agent 能力能否持续逼近 Claude。


七、Cordis 与自进化 Agent:基础设施层就绪,智能层未解

Cordis 解决了什么(物理层 / 基础设施层)

1. 热插拔不丢状态。 组件卸载时自动回收副作用,其他组件运行状态不受影响。Agent 可在运行中增删改组件,不丢上下文、不丢会话。

2. 依赖关系自动协调。 组件出现、消失或被替换时,系统自动调整相关组件。Agent 不需要自己维护插件间依赖图。

3. 副作用可追溯、可回滚。 试错后可卸载并撤销到安装前的干净状态,给予 Agent"后悔药"。

Cordis 没解决什么(智能层)

1. 能力缺口检测。 Agent 怎么知道缺的不是已有工具的使用方式,而是一个根本不存在的能力?这是认知层面问题,Cordis 不碰。

2. 生成插件的代码质量与安全。 有 bug 的插件在激活期间可能删文件、污染内存、搞崩整个 Agent。Cordis 保证卸载时干净回收,但不保证运行期间不出事。

3. 进化效果评估。 一次更新改进了什么?提升能否迁移到未见任务?是否过拟合近期反馈?是否遗忘了旧能力?清华 SEAGym 正在回答这个问题。Cordis 提供了"改"的能力,但没有"改了后好不好"的评估框架。

4. 持久化。 目前 DSH 创造模式下动态生成的插件仅存在于内存中,重启即消失,不能自动沉淀为永久插件。

定位:自进化的"操作系统层"

将 Cordis 放入自进化研究版图:

  • External 路线(港大黄超分类):扩充工具库和技能生态。Cordis 落在此路线上,让"工具积累"可在运行时动态完成
  • Autogenesis Protocol / AGP(南洋理工 / 斯坦福 / 普林斯顿):资源基底层定义"什么能进化" + 自进化层定义"如何安全进化"(可追踪 / 可回滚 / 可审计)。Cordis 覆盖了"安全加载 / 卸载"部分,但未覆盖审计、版本管理、复现机制
  • ALTK-Evolve (IBM):将执行轨迹转化为可复用原则。解决"记忆"问题,与 Cordis 解决的"装 / 卸"完全正交

结论:Cordis 让自进化的基础设施层从"几乎不可能"变为"工程可行"。它是自进化 Agent 的操作系统——提供进程管理、内存回收、依赖调度的底层能力。但 Agent 能否真正"聪明地进化自己",取决于运行在它之上的模型能力和更高层的自进化协议。

内测用户 Jiayuan Zhang 称 DSH 具备"自进化软件的雏形"——“雏形"二字准确:基础设施就位,完整闭环未实现。X 用户宝玉的保留意见亦有道理:插件要么"用完即扔”,要么需要"设计、验证和维护",当前模型能力无法自主完成后者的全流程。Cordis 解决了"扔"的干净程度,但"设计、验证"的自动化仍需模型能力再上台阶。


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐