开源两天 9.5 万 Star!DeepSeek Harness 到底是个啥?小白安装到实战一篇讲透
大家好,我是晓凡。
AI 圈又炸了。DeepSeek V4 Pro 正式版刚上线,万众瞩目的 DeepSeek Harness 紧接着开源。

GitHub 上线不到 2 天,Star 数冲破 9.5 万,直到晓凡写文章这会已经突破11.5万star了,AI 届的顶流名不虚传。
GitHub地址:https://github.com/deepseek-ai/deepseek-harness

很多小伙伴可能有点懵:Harness 到底是啥?跟我平时用的 DeepSeek 网页版、workbuddy、codex这些有啥区别?值不值得花时间装?
这篇文章,我从安装到实战,手把手带你玩转 DeepSeek Harness。小白可懂,建议收藏。
一、DeepSeek Harness 是什么?
先说一个核心公式,这是理解它的关键。DeepSeek 官方放了一条很重要的等式:
Agent = Model + Harness
模型,就是那颗「聪明的大脑」,负责思考和生成。
Harness,你可以理解成给大脑装上的「身体」。
Harness 这个词原意就是「马具」。如果把 AI 模型比作一匹马,Harness 就是那套马具,让你能驾驭这匹马跑得更快、更稳、乖乖完成任务。
模型负责思考和生成,Harness 负责把这些能力接入文件系统、终端、网页、工具链,让 AI 真正能在现实环境里干活。
你给 AI 写的项目规则文件、配置的各种工具、安排的任务拆分和执行顺序、设计的测试检查流程,这些统统都算 Harness。你平时用的 Claude Code、Codex、WorkBuddy 这些工具,本质都是 Harness,要跟模型搭配起来用才行。

之前 DeepSeek 只开源了模型这一半,Harness 一直没动静,这次终于补齐了。你可以把 DeepSeek Harness 理解成一个可以高度定制的 AI 工具,对标 Claude Code 和 Codex。但它的野心比这些工具更大——不只是一个 Agent,而是一套可配置、可重组的 Agent 运行环境。
二、 一切皆插件
这是 DeepSeek Harness 最醒目的设计主张。模型、工具、技能、会话、沙箱、UI,甚至 Agent 的运行循环本身,都是插件,都可以拔掉换成别的。

整个框架建立在 Cordis 微内核 之上。这个内核干的事情极其克制,只负责插件的加载、卸载和依赖管理,其他什么都不管。最牛的是,可以在 Agent 运行过程中随时更换插件,还能保证运行状态不崩。
如果你对哪个地方不满意,随时可以自己替换或者安装插件来扩展,不需要改框架源码。
三、怎么安装?1 分钟搞定
安装 DeepSeek Harness 真的非常简单,我们可以手动安装,也可以用我们常用的Ai Agent 安装。
1、 手动安装
① 确保已安装 Node.js
输入如下命令,如果出现版本号,说明Node.js 是安装成功的。我们最好安装 Node.js 22.x + 版本
node -v

没有的话去 Node 官网https://nodejs.org/zh-cn/download下载安装包,傻瓜式安装就行。

② 执行一行命令
打开你电脑上的终端,输入这行命令并执行:
npx @deepseek-ai/dsh web
2、全部交给Ai Agent
如果你看不懂命令行,直接把 “帮我安装 DeepSeek Harness https://www.deepseek.com/harness/ ” 这句话扔给你常用的 AI 工具,让它帮你装也行。
这里以workbuddy为例


稍等一会儿,终端会输出一个网址(通常是 http://127.0.0.1:3080),浏览器打开它就能进入 DeepSeek Harness 的 Web 界面。

3 填入 API Key
第一次使用时,需要填入 DeepSeek 的 API Key。
到 DeepSeek 开放平台 https://platform.deepseek.com/api_keys 创建一个 API Key,注意不要泄露,把得到的 Key 复制粘贴过来就行。


使用前记得往账户里充点钱。
API Key 输入成功后,就可以成功进入Web UI 界面

四、 小白快速入门
进入 Web 界面后,你会看到左边是对话历史,中间是任务区,可以选工作目录和运行模式。右边是对话框,左上角选择工作区域,右下角选择模型和推理强度。整个界面本身也是一个 UI 插件,你随时可以换掉。
① 先选工作区
DeepSeek Harness 必须先选择一个工作文件夹才能对话。在电脑上建好一个工作目录,然后让 DSH 打开它,这就是你的 Agent 能操作的项目文件范围。

② 三种权限

- Read Only:只能读不能改。只是想让它看看代码,选这个。
- Workspace Write:可以修改工作目录里的文件,超出范围会先问你。平时最常用。
- Full Access:护栏全拆,工作目录内外的文件都能改。别随手开,清楚它要做什么时再用。
③ 四种运行模式

这是 DeepSeek Harness 和其他 AI 工具最大的区别之一。四种模式的本质区别就是「当前会话加载了哪些工具插件」。
| 模式 | 能力范围 | 适合谁 |
|---|---|---|
| 标准模式 | 文件编辑、Shell、搜索、Skills、子 Agent、工作流 | 所有人,默认选它 |
| PTC 模式 | 标准模式全部 + 程序化工具调用 | 批量操作、自动化流程 |
| 极简模式 | 只有 Bash + 文件编辑器 | 模型基准测试 |
| 创造模式 | 标准模式 + 检查/试验/创建插件 | 想自己造插件的高级用户 |
🕳 小白建议:第一次使用,无脑选「标准模式」就行。绝大多数日常开发任务用它就够了,等熟悉了再探索其他模式。
④ 模型切换
这里我默认填入的的是DeepSeek API Key ,所以只能选择deepseek的大模型

我们可以到设置 这里配置更多厂商的大模型



五、实战案例:从补测试到开发浏览器插件
光说不练假把式。下面跑几个任务,看看 DeepSeek Harness 的真实能力。
案例 1:仓库理解能力 ✅
目标:测 Agent 读代码、定位结构、精确到行号的能力。
提示词:
分析当前工作区里的 sample-app 子目录项目:1) 总结项目结构和各模块职责;2) 指出程序入口文件;3) 找出 Calculator 类的定义位置(文件+行号)并列出它的全部方法;4) 列出 tests 目录下哪些测试用例调用了 Calculator。
实测过程:Agent 自主调用 Glob → Pwsh(列目录)→ Read(连续读 6 个文件)→ 给出分析。
结果:13 秒完成,输出包含项目结构树、入口文件 sampleapp/cli.py(main 在第 7 行)、Calculator 类定义位置(calculator.py 第 1 行)+ 全部 5 个方法行号表、6 个测试用例与所调用方法的映射表。行号全部准确,无幻觉。
评价:优秀。文件检索 + 长上下文理解 + 精确定位一气呵成,171 tok/s,缓存命中 63%。

案例 2:编码 + Shell 闭环 ✅
目标:测文件编辑、命令执行、自我验证闭环。
提示词:
用 Python 写一个命令行待办工具 todo.py,支持 add/list/done,数据存 JSON。写完自己运行测试:add 三条、list、done 一条、再 list,把每步输出展示给我。
实测过程:Agent 写出 todo.py → 主动跑 4 条命令验证 → 展示全部输出。追问加 delete 子命令并处理边界,Agent 改完自测。
结果:
todo.py真实写盘(2401 字节,代码规范)- add/list/done 全部输出正确
delete 99(不存在)→Task #99 not found, nothing to delete.(stderr,退出码 1,不崩溃)✅ 边界处理完美- 意外彩蛋:写
todos.json时被沙箱拦截 → Agent 自诊断「sandbox file access denial, retry with sandbox_permissions」→ 自动提权重试 → 触发人工审批 → 通过后继续。完整的沙箱拦截 → 自诊断 → 提权 → 审批链路。
评价:优秀。闭环自主、边界严谨,沙箱机制是亮点。


案例 3:计划与子代理 ✅
目标:测计划维护、子 Agent 委派(dsh 区别于普通聊天的重点)。
提示词:
把单文件 todo.py 重构成标准 Python 包:拆模块、加类型注解、补 pytest 测试、加 pyproject.toml。先制定计划再执行,用子代理分担工作,最后跑通全部测试。
实测过程:
- Agent 先出重构计划 + 6 项 Todo 清单 + 目录结构设计
- 并行派 2 个子代理:一个写
todo_cli/包源码、一个写 pytest 测试 - 主 Agent 同时自己装 pytest、写 pyproject.toml、审查子代理产出
- 跑 pytest:3 个非 tmp_path 用例先过,tmp_path 用例被沙箱拦(系统临时目录)→ 提权 → 25/25 全部通过
pip install -e .可编辑安装成功,todo命令入口可用
结果(磁盘实证):
todo_cli/ __init__.py __main__.py cli.py commands.py models.py storage.py (6 模块)
tests/ test_cli.py test_commands.py test_storage.py (3 测试文件,25 用例)
pyproject.toml README.md todo_cli.egg-info/ (pip 安装产物)
原 todo.py 字节级保留
独立跑 python -m pytest -q → 25 passed in 1.10s 确认。
评价:优秀。计划拆解 → 并行子代理 → 主线集成 → 测试验证,全链路跑通,是 dsh「一切皆插件」架构的集中体现。

案例 4:Web 检索能力 ⚠️
目标:测联网搜索 + 信息整合(顺便验幻觉)。
提示词:
联网搜索 DeepSeek 目前的模型和 API 定价,整理成 Markdown 对比表,附来源链接和获取日期,只引用真实官方信息,不要编造。
实测过程:Agent 用 web_search 搜了 30+ 次,还派了 2 个子代理并行深挖,找到了官方定价页 URL(api-docs.deepseek.com/quick_start/pricing)。但它的工具集只有 web_search、没有网页抓取(fetch),拿不到页面正文,只能靠搜索片段三角定位,数字零散无法收敛,16 分钟仍未出表,被手动停止。
评价:⚠️ 部分通过。能联网、能派子代理、能定位权威来源,但缺网页抓取工具导致过度检索、无法收敛——这是当前工具链的明显缺陷。
补充:官方定价核实(由测试者用 WebFetch 直接抓取官方文档):
| 模型 | 上下文 | 输入(缓存命中) | 输入(缓存未命中) | 输出 | 备注 |
|---|---|---|---|---|---|
| deepseek-v4-flash | 1M | 0.02 元/M | 1 元/M | 2 元/M | 现行价 |
| deepseek-v4-pro | 1M | 0.025 元/M | 3 元/M | 6 元/M | 现行价 |
2026-08-17 00:00 起改为峰谷定价:空闲时段为高峰时段一半(v4-flash 高峰输入 3.0 元、输出 9.0 元;v4-pro 高峰输入 9.0 元、输出 27.0 元)。
来源:https://api-docs.deepseek.com/zh-cn/quick_start/pricing | 获取日期 2026-08-16

案例 5:运行模式对比 ⚠️
目标:测标准 / 极简两种模式的差异。同一任务:统计工作区所有 .py 文件总行数和函数数量。
标准模式 ✅:
- 用 PowerShell(
Get-Content/Select-String)8 秒搞定 - 结果:14 个文件 / 702 行 / 59 个函数(实测正确)
- 思考里还自我校验了统计逻辑的边界
极简模式 ❌:
- 极简模式只有持久
bash+str_replace_editor两个工具 - bash 在 Windows 直接报错:
terminal inspection is unsupported on platform win32 - Agent 多次重试 bash 均失败,退而用
str_replace_editor逐文件读,还读错了目录(读到C:\tmp而非工作区),39 秒后给出错误结果
评价:⚠️ 标准模式 Windows 完美;极简模式在 Windows 上不可用(bash 工具不支持 win32)——这是重要兼容性限制,官方文档以 Linux 为主,Windows 用户需注意。


案例 6:Trajectory 可观测性 ✅
目标:测 dsh 招牌卖点——仅追加会话日志、按来源查看、分叉/恢复。
实测过程:
- 打开案例 1 会话的「轨迹」tab,呈现一张按来源(SOURCE)分类的事件流表格,每行可点击展开:
SYSTEM— Initial System Prompt(完整系统提示词可见)USER— 用户输入CONTEXT— 运行时上下文(含文件策略 workspace-write、工作区路径、审批策略)TOOL— glob / pwsh / read 等每次工具调用及结果THINK— 模型思维链
- 点回答上的「在新对话中分支」做 fork:新会话从该回答处分出
- 在分叉会话问「divide 方法在第几行、怎么处理除零」→ Agent 准确回答「
calculator.py第 22 行,if b == 0: raise ValueError("除数不能为零")」,证明分叉带走了完整上下文
评价:优秀。「模型看到的一切都有迹可循」名副其实,按来源筛选 + 分叉不污染原会话,可观测性是 dsh 最扎实的差异化能力。


总结
| # | 案例 | 测什么 | 结果 | 用时 | 评价 |
|---|---|---|---|---|---|
| 1 | 仓库理解 | 文件检索 + 精确定位 | ✅ 通过 | 13s / 3 步 | 优秀 |
| 2 | 编码 + Shell 闭环 | 写码 + 自测 + 边界处理 | ✅ 通过 | 29s + 1m24s | 优秀(沙箱亮眼) |
| 3 | 计划与子代理 | 任务拆解 + 并行子代理 | ✅ 通过 | ~5 min | 优秀 |
| 4 | Web 检索 | 联网搜索 + 信息整合 | ⚠️ 部分通过 | 16 min(被手动停止) | 工具链缺陷,不收敛 |
| 5 | 运行模式对比 | 标准 vs 极简 | ⚠️ 标准通过 / 极简失败 | 8s / 39s | 极简模式 Windows 不可用 |
| 6 | Trajectory 可观测性 | 事件流 + 分叉 | ✅ 通过 | — | 优秀,招牌卖点名副其实 |
一句话结论:标准模式在 Windows 上表现强劲——编码、计划、子代理、可观测性四项都达到一线 Agent 水平;主要短板在极简模式的 Windows 兼容性和 Web 研究的工具链(无网页抓取)。
六、 插件生态:一切皆插件
这是 DeepSeek Harness 和 Codex、Claude Code 最大的区别。模型、工具、技能、会话、沙箱、UI,甚至 Agent 的运行循环本身都是插件,都可以拔掉换成别的。

社区插件已超 300 个
在 DeepSeek Harness 官网中,点击「社区插件」,就可以看到所有 社区开发的插件 了。

其实就是 GitHub 上打了 dsh-plugin 这个主题标签的项目:

目前也有700多个插件可以使用,如果你觉得上面官方插件页面复杂,没有分类整理过。可以到https://github.com/awesome-dsh-plugin 这个开源项目看看.


安装一个社区插件非常简单,直接把插件开源地址提供给 AI:
例如:我们要安装DeepSeek Harness 桌面端这个 插件

我只需要进入 DeepSeek Harness 网页中,随便选一个工作目录,然后把插件开源地址提供给 AI,让它帮我装就好了。
帮我安装 https://github.com/anywhere-labs/deepseek-harness-desktop 这个插件


几个值得装的插件
- dsh-at-file:装完后直接在输入框 @ 就可以调用文件了,很方便。
- ModLens 视觉插件:把图片粘贴进去,帮模型把图片解析成结构化文字信息,包括 OCR 文本、页面布局、语义内容。补上了 DeepSeek 纯文本模型看不了图的短板。
- dsh-genui:允许模型在回复里直接渲染图表、表格、表单、Diff、Mermaid、交互面板等,很有用。
- DSH-better-sidebar:给 DSH 补上一套类似 VS Code 的工作台,文件管理、代码编辑、真实终端、Git、Diff、内嵌浏览器全塞进侧边栏。
- 皮肤类插件(整活向):鲸鱼娘皮肤、Excel 表格风(摸鱼神器)、TUI 终端风格、2005 年中文网站广告风……因为 DSH 本质是跑在浏览器里的 Web 应用,定制皮肤非常简单。
自己创造插件
光装别人的插件算什么,自己造一个才是真上头。
切到创造模式,跟 AI 说「我想做一个会话成本预警器」——不用管 manifest 怎么写、hook 怎么注册,AI 全包了。它会先扫一遍当前插件树,告诉你哪些能力已经有插件占了坑、哪些还是空白,然后直接开写。

然后给如下提示词:
帮我开发一个 dsh 插件,功能如下:
插件名:dsh-cost-guard
一句话定位:API 花费预警器,钱花超之前先拦你一把。
核心功能:
1. 实时监控当前会话的 token 消耗与估算费用(从 trajectory 事件流读取 token 计数,按模型单价换算金额)
2. 支持设置三档预警阈值(默认 ¥1 / ¥5 / ¥20,用户可自定义),每到一个档位:
- 在输入框上方弹出醒目的横幅提醒(带颜色区分:黄→橙→红)
- 播放一声提示音(可关闭)
- 记录到本次会话的「消费时间线」里
3. 侧边栏提供一个「消费仪表盘」面板,展示:
- 当前会话已花费(大字)
- 按模型拆分的费用占比饼图
- 最近 7 天的每日花费柱状图(数据持久化到 localStorage)
- 当前小时的花费速率(¥/h),如果速率异常高则标红
4. 每次新开对话时,如果上一次会话花费超过 ¥5,在对话顶部插一条温柔提醒:「上次对话花了 ¥X,今天预算还剩 ¥Y」
5. 支持设置「每日总预算」,超出后输入框变红边框 + 发送按钮上加确认气泡「已超出今日预算,确定继续?」
技术要求:
- 注册为 dsh plugin,声明 dsh.bundle manifest
- UI 部分用 Web Components,不依赖外部框架
- 图表用纯 SVG 手绘,不引入 Chart.js 等库
- 配置项(阈值、预算、开关)放在 dsh 设置面板的独立分区
- 消费历史持久化到 localStorage,键名 dsh-cost-guard-*
- 支持中英文双语
先检查当前插件树,确认没有同类插件冲突后再开始开发。开发完成后让我审批。
写完不急着装。dsh 会把代码变更摊在你面前让你过目,你说行才装。装完试两把,不满意让 AI 改,改完再审批,反复到你满意为止。
这是最终生成的效果

觉得能用了?一句「帮我发到 GitHub」,AI 就把仓库建好、代码推上去、挂上 dsh-plugin 的 topic。别人一行 dsh plugin add 就能装你写的东西。
从「我想要个插件」到「社区里有人用我的插件」,中间不用打开任何 IDE。
七、 费用与性价比
大家猜猜前面几个任务跑下来花了多少钱?
上面多个实战任务总花费:不到 8 块钱,因为缓存命中率基本都在 99% 以上


不过要提醒大家,DeepSeek 已经宣布 8 月 17 日起涨价,涨了好几倍。V4 Pro 缓存命中价格涨了 12 倍,高峰期输出价格来到了 27 元/百万 Token。
⚠️ 但即便涨价之后,跟 Claude、GPT 比起来还是便宜很多。同样 2.5 亿 Token 消耗量,GPT-5.6 Sol 按量计费约 186 美元(约 1260 元人民币),依然接近 DeepSeek 的十倍。
而且缓存命中的价格依然非常低。如果同样的用量按新价格算,考虑到缓存命中,实际花费也不会太高。依然是价格屠夫。
/// 写在最后
DeepSeek Harness 目前还是开发者预览版,有一些体验问题。比如任务卡住但页面还在计时、无法同时开多个会话等,这些都需要后续迭代修复。
但它的设计理念确实让人兴奋。「开源 + 一切皆插件」让 DeepSeek Harness 做到了极致的开放。模型、工具、提示词、上下文和 UI 都能通过插件调整,大家可以围绕自己的真实需求重新组装 Agent 的能力和工作方式。
也许用不了多久,每个人手里的 AI 编程工具都长得不一样
因为每个人都可以根据自己的需求自由组装,这是一件很酷的事情。这头黑鲸才刚刚下水,真正的故事可能才刚开始。
🕳 目前最大的槽点:如果发现 DSH 卡在某个任务上很久,先别傻等。打开终端看一眼,确认 dsh web 进程还在不在运行。页面时间一直增加,不一定代表任务还活着。另外浏览器里 Tab 太多时,直接新开一个 Tab 输入 http://127.0.0.1:3080/ 就能直达工作页。
我是晓凡,再小的帆也能远航。热衷于分享一些好玩的实用的干货内容。
如果你觉得今天这篇有收获,欢迎 点赞、在看、转发 三连,我们下篇见。
📚 往期推荐
- ▸ DeepSeek V4 Pro 正式版实测:国产大模型的新天花板?
- ▸ 一文看懂 Harness Engineering 到底是个啥
- ▸ AI 编程工具横评:Codex vs Claude Code vs DeepSeek Harness
原文地址: https://www.cveoy.top/t/topic/qHl7 著作权归作者所有。请勿转载和采集!