共计 4583 个字符,预计需要花费 12 分钟才能阅读完成。
8 月 13 日晚,DeepSeek 一口气发了两样东西:旗舰模型 V4 Pro,以及开源 Agent 框架 DeepSeek Harness(简称 DSH,v0.1 开发者预览版,MIT 协议)。模型的新闻抢了头条,但对做 AI Agent 的人来说,Harness 才是更有看头的那个——它就是 DeepSeek 内部用来评测自家编程 Agent 的那套运行时外壳,现在整个开源给你拆。
一、DeepSeek Harness 是什么?
先说清楚一个概念:Agent ≠ 模型。模型只是 ” 大脑 ”,真正让 AI 能读写文件、调用工具、管理上下文、失败重试、连续干几小时活的,是外面那层工程外壳——业界叫它 harness(挽具 / 支架)。
Claude Code 证明了这层东西值钱,而 DeepSeek 这次的选择是直接把它开源。DeepSeek Harness 是一个基于 Node.js / TypeScript 的 命令行 + Web UI 编程 Agent,核心设计只有一句话:
Everything is a Plugin —— 一切皆插件。
它的内核叫 Cordis(来自 Koishi 聊天机器人框架生态的微内核,设计思想见论文《A Programming Paradigm for Spatiotemporal Composability》)。在这个架构下:模型、工具、技能、会话、沙箱、存储、循环、调度器,甚至你看到的 Web UI 本身,全都是插件。
两个关键特性让它真正可用:
- 可逆副作用:插件注册时产生的所有副作用都会被追踪,卸载时自动回收。热插拔不用重启进程,不残留垃圾、不漏内存;
- 可被发现:仓库打上
dsh-plugin的 GitHub topic 就能进入社区目录——官方发布一天之内就收录了 288 个插件仓库。
二、四种内置模式
| 模式 | 说明 |
|---|---|
| 标准模式 | 全套编程 Agent:文件编辑、shell 执行、网页 / 文件搜索、技能(Skills)、规划、目标管理、子 Agent、工作流,全都有。 |
| Code(PTC)模式 | 工具通过 Code Mode SDK 暴露,模型直接写一段 TypeScript 程序来驱动工具——把原本要来回调十次的操作合并成一次执行,省 token、降延迟。 |
| 极简模式 | 只保留一个持久 bash + 一个文件编辑器。官方用途是评测:拆掉外壳花活,直接看模型的 ” 裸实力 ”。 |
| 创造模式 | 自己造新 ” 模式 ”——本质上就是写一份插件配置清单,另外三种模式其实也就是三份预设的配置。 |
三、快速上手:一行命令跑起来
前置条件只有一个:Node.js 18+。官方 npm 包会直接在你本机起一个 Web UI:
# 启动 Web UI(默认 http://127.0.0.1:3080)npx @deepseek-ai/dsh web
浏览器打开后:左侧是工作区列表(每个对应本地一个项目目录),中间是对话区,每一步工具调用都摊在时间线上,全程可见。想从源码跑也行:
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
模型接入方面,DSH 是 模型无关 的:官方默认接 DeepSeek(V4 Pro 同晚发布,Agent 基准大幅上涨且原生支持 OpenAI Responses API),但任何 OpenAI 兼容端点都能挂上去——包括你本地跑的 Qwen、DeepSeek-R1 之类的开源模型。
四、插件生态:一天 288 个仓库
社区插件已经形成了完整分类(来自 awesome-dsh-plugin 精选列表):
| 分类 | 代表插件 / 用途 |
|---|---|
| 模型与路由 | dsh-tier-router(强模型规划 + 便宜模型执行的双层路由)、llm-adaptive(按请求复杂度自动选模型 / 供应商) |
| 视觉多模态 | dsh-vision、dsh-vision-fallback——给纯文本的 DeepSeek 模型 ” 装上眼睛 ”,桥接任意 OpenAI 兼容视觉模型(有的版本走 Chrome CDP,零 API Key) |
| 记忆系统 | dsh-auto-memory(三层缓存友好记忆)、dsh-butler-memory(PostgreSQL 持久化 + Web 面板)、dsh-active-context-pruning(上下文主动裁剪) |
| Git / 代码评审 | dsh-revdiff、dsh-change-review——会话级 diff 审查,行级差异标注直接回传给 Agent |
| 工作流自动化 | chicheng-cron(侧边栏定时任务:按点跑 shell/Python/Node、技能或整段 Agent 任务)、dsh-plan-lattice(长任务的执行契约与证据门) |
| 安全治理 | dsh-gov(策略化工具门禁 allow/deny/ask + JSONL 审计日志 + token 配额)、dsh-plugin-gate(插件安装前的 ” 杀软式 ” 扫描) |
| UI / 体验 | 命令面板、推理强度滑杆、全局中文模式(dsh-chinese-mode,一键让回复和思考都切中文)、主题等 |
| 其他 | 浏览器 / 网页操作、语音音频、文档渲染、通知集成、远程 / 移动端、插件市场管理器等 |
官方社区里最值得先装的两个:
- dsh-plan-execute:规划走推理模型、执行走便宜模型,账单立省;
- dsh-vision:桥接任意 OpenAI 兼容视觉模型,给纯文本的 DeepSeek 装上眼睛。
五、全程可追溯:Trajectory 会话日志
DSH 把 模型看到的一切 ——系统提示词、推理过程、工具调用与结果、子 Agent 调度、上下文注入——全部写进一份 只增不改 的会话日志(Trajectory)。支持按来源逐条查询、恢复、分叉、搜索和回放。
这意味着调试从 ” 猜 ” 变成了 ” 回放 ”:出问题时不用复现,直接把当时的完整上下文调出来看。对做 Agent 工程的人来说,这可能是整个框架里最有生产价值的一个设计。
六、实践建议(重要)
- 做好变更准备:README 用全大写警告 “THERE WILL BE COMPATIBILITY-BREAKING CHANGES”——开发者预览期迭代极快,装第三方插件记得锁版本;
- 认真对待沙箱:插件能碰你的 shell 和文件系统。DSH 提供 sandbox-micro / sandbox-mxc / sandbox-nono 三档隔离方案,上生产前一定先选好隔离再放它跑;
- 评测用极简模式:去掉 harness 变量,比的才是模型本身而不是外壳;
- 配合 V4 Pro 使用:同晚发布的 V4 Pro 在 Agent 基准上暴涨且原生支持 OpenAI Responses API,是 DSH 的 ” 原厂搭档 ”。
七、资源链接
- GitHub(官方):deepseek-ai/deepseek-harness(MIT,⭐15.8 万 +)
- 官网:deepseek.com/harness
- 插件精选列表:awesome-dsh-plugin
- 社区目录:GitHub
dsh-plugintopic - 桌面端方案:deepseek-harness-desktop
- 一手实测《橙皮书》(完整系统提示词 + 129 行启动清单):alchaincyf/deepseek-harness-orange-book
- Discord 社区:discord.gg/Ycq5dCaS4
一句话总结:模型是引擎,Harness 是底盘。DeepSeek 把整套底盘开源了——以后做编程 Agent,不用只能站在 Claude Code 的肩膀上了。