DeepSeek Harness 是支撑 DeepSeek 前沿模型分数的智能体运行时——位于模型之上的一层工具、记忆、子智能体编排与终止逻辑,把模型变成真正可用的智能体。2026 年 7 月 31 日,DeepSeek 用 Harness 极简模式跑出了 DeepSeek-V4-Flash 的智能体基准成绩,Harness 由此首次公开亮相;8 月 13 日代码以 MIT 许可开源,口号是"Everything is a Plugin"。想复现 DeepSeek 公布的基准数字,或者构建自己的 DeepSeek 编程智能体,这就是官方参考实现。
核心功能
- 插件化架构:工具、记忆、子智能体编排、终止逻辑全部是插件。口号"Everything is a Plugin",插件以版本化包的形式分发,可自由组合、替换、自行编写。
- 模型 + Harness = 智能体:核心理念是智能体等于模型加 Harness。Harness 负责终端、文件操作、网页访问与代码执行,让模型专注推理。
- 极简模式:DeepSeek 评测 V4-Flash 时使用的那套精简工具集(终端、文件 I/O、网页、代码执行)率先发布,先证明模型智能体能力,再逐步放出完整运行时。
- 子智能体编排:内置子智能体的创建、监督与结果回收机制,并带终止逻辑防止失控循环。
- 记忆与上下文管理:缓存友好的上下文处理,利用 DeepSeek 前缀缓存计费让长会话保持低价。
- TypeScript 原生:以 TypeScript 编写,通过
@deepseek-ai/dshnpm 包分发——npx @deepseek-ai/dsh web即可启动 Web UI。 - DeepSeek 原生经济性:围绕 DeepSeek 模型 1M token 上下文与缓存命中计费优化,同时也可对接其他模型供应商。
适用场景
谁应该使用这个工具?
- 智能体开发者:想用与 DeepSeek 官方评测同款 Harness(Terminal Bench 2.1 82.7 分、DeepSWE 54.4 分)构建智能体的开发者。
- DeepSeek 重度用户:在 V4-Flash、V4-Pro 上跑编程智能体的团队,想要第一方 Harness 而非第三方封装。
- 基准复现者:想独立验证 DeepSeek 智能体基准声明的研究人员与工程师。
- 开源贡献者:想参与一个进展极快、资金充足的开源智能体框架的开发者。
解决的问题
- 专有智能体的厂商锁定:MIT 许可,可 fork、可审计、可自托管,不同于 Claude Code 或 Codex。
- "开源模型不擅长工具调用"的迷思:DeepSeek 认为智能体表现差往往是 Harness 的问题而非模型的问题——这就是他们的参考实现。
- 基准不可复现:评测配置(极简模式、max 推理强度、top_p 0.95、temperature 1.0)已经公开,结果可以真正被检验。
定价方案
| 方案 | 价格 | 功能 |
|---|---|---|
| 开源版 | $0 | MIT 许可;免费使用、fork、自托管,仅需支付模型 API 费用。 |
底层模型价格(USD / 100 万 token,2026 年 8 月):
| 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|
| deepseek-v4-flash | $0.0028 | $0.14 | $0.28 |
| deepseek-v4-pro | $0.003625 | $0.435 | $0.87 |
优势对比
相比竞品的优势:
- 第一方 Harness:DeepSeek 自研运行时,经过前沿规模检验——对比第三方 Harness 只是简单封装 API。
- 价格优势显著:V4-Flash 每百万 token 输入 $0.14 / 输出 $0.28,智能体工作负载的成本只有 Claude Opus 或 GPT-5.5 的零头。
- MIT 开源:完全透明、可 fork,不同于 Anthropic、OpenAI 的专有智能体。
独特卖点:
- 2026 年 7 月 31 日 V4-Flash 智能体成绩背后的引擎:Terminal Bench 2.1(82.7)、NL2Repo(54.2)、Cybergym(76.7)、DeepSWE(54.4)、Toolathlon verified(70.3)。
- 开源数小时内 GitHub star 即突破 24,000。
- 由 DeepSeek 专职团队自 2026 年 3 月组建开发,完整产品预期演化为"DeepSeek Code"——DeepSeek 对 Claude Code 的回答。
用户评价
"'开源模型工具调用不行'几乎总是 Harness 的问题而非模型的问题——这个洞察完全正确。这就是我们一直在等的参考实现。" — Hacker News 讨论
"比前沿闭源智能体便宜 10-12 倍,智能体基准接近 Claude Opus。性价比就是故事本身。" — Reddit r/LocalLLaMA 评论
"终于有官方 Harness 可以复现 DeepSeek 的数字了。厂商自报的成绩变得可以检验。" — Hacker News 评论
快速开始
入门指南
- 克隆:
git clone https://github.com/deepseek-ai/deepseek-harness - 安装:按仓库 README 安装依赖(TypeScript、npm 生态)。
- 配置:填入 DeepSeek API Key(或任意供应商)并选择插件。
- 运行:
npx @deepseek-ai/dsh web启动 Web UI,或在项目目录中无头运行。
集成
无缝集成:
- DeepSeek API(V4-Flash、V4-Pro)与 Responses API
- Codex 工作流兼容
dsh-plugin插件生态- 通过插件接口接入 MCP 风格工具
常见问题
DeepSeek Harness 免费吗?
是的,Harness 本身 MIT 开源免费,只需通过 DeepSeek 平台支付模型 API 费用。
支持哪些模型?
主要为 DeepSeek V4-Flash 与 V4-Pro(1M token 上下文)设计,插件架构也允许接入其他供应商。
可以复现 DeepSeek 的基准成绩吗?
公开评测配置已文档化:Harness 极简模式、max 推理强度、top_p 0.95、temperature 1.0。截至 2026 年 8 月独立复现正在进行中。
与 Claude Code 相比如何?
Claude Code 是专有的;DeepSeek Harness 是 MIT 开源、可自托管,且所用模型每 token 价格约低 10 倍。完整版"DeepSeek Code"产品的功能对齐仍在演进中。
替代方案
如果 DeepSeek Harness 不适合,可以考虑这些替代品:
- Claude Code:Anthropic 专有编程智能体,是 DeepSeek 对标的交互体验标杆。
- Reasonix:第三方 DeepSeek 原生终端智能体,针对前缀缓存经济性调优。
- OpenAI Agents SDK:OpenAI 开源智能体框架,编排模型不同。
使用技巧
- 使用缓存友好的提示词:DeepSeek 缓存命中价格($0.0028 vs $0.14 / 百万输入 token)奖励稳定、追加式的上下文——让 Harness 会话长期运行。
- 从极简模式开始:先用与官方基准完全一致的配置,再加重型插件。
- 留意高峰定价:2026 年 8 月 16 日起 DeepSeek 引入峰谷定价(UTC 01:00–04:00 与 06:00–10:00 为高峰)——批量智能体任务安排到低谷时段。
总结
DeepSeek Harness 是产出 DeepSeek 前沿智能体成绩的开源运行时——插件化、MIT 许可、成本只有闭源智能体的零头。如果你在 DeepSeek 模型上构建智能体,或想复现乃至超越 V4-Flash 背后的数字,这就是应该出发的官方参考实现。
评论
还没有评论。成为第一个评论的人!
相关工具
Reasonix
reasonix.io
DeepSeek 原生的终端 AI 编程智能体。配置与插件驱动的框架,打包为单一静态 Go 二进制,围绕 DeepSeek 前缀缓存优化,长会话 token 成本极低。GitHub 32,000+ star。
OpenAI Agents SDK
openai.github.io/openai-agents-python
OpenAI 官方的 Python 与 TypeScript 生产级 AI 智能体框架。智能体、交接、护栏、会话与内置追踪——Swarm 的正式继任者。
FastClaw
fastclaw.ai
Go 编写的轻量 AI 智能体运行时与多智能体框架。作为'智能体工厂'创建、管理与运行带人格(SOUL.md)、记忆、技能和工具的智能体——单一二进制、任意 LLM、云就绪。OpenClaw 的流行替代品。
相关洞察
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
低代码平台的黄昏:为什么 Claude Agent SDK 会让 Dify 们成为历史
从大模型第一性原理深度剖析为什么 Claude Agent SDK 将取代 Dify。探讨为什么自然语言描述流程比图形化编排更符合人类原始行为模式,以及为什么这是 AI 时代的必然选择。