DeepSeek Harness logo

DeepSeek Harness

打开

DeepSeek 官方开源的智能体运行时框架。插件化的 TypeScript Harness('Everything is a Plugin'),是 DeepSeek V4-Flash 前沿智能体基准测试背后的引擎,MIT 许可,GitHub 24,000+ star。

分享:

DeepSeek Harness 是支撑 DeepSeek 前沿模型分数的智能体运行时——位于模型之上的一层工具、记忆、子智能体编排与终止逻辑,把模型变成真正可用的智能体。2026 年 7 月 31 日,DeepSeek 用 Harness 极简模式跑出了 DeepSeek-V4-Flash 的智能体基准成绩,Harness 由此首次公开亮相;8 月 13 日代码以 MIT 许可开源,口号是"Everything is a Plugin"。想复现 DeepSeek 公布的基准数字,或者构建自己的 DeepSeek 编程智能体,这就是官方参考实现。

核心功能

  • 插件化架构:工具、记忆、子智能体编排、终止逻辑全部是插件。口号"Everything is a Plugin",插件以版本化包的形式分发,可自由组合、替换、自行编写。
  • 模型 + Harness = 智能体:核心理念是智能体等于模型加 Harness。Harness 负责终端、文件操作、网页访问与代码执行,让模型专注推理。
  • 极简模式:DeepSeek 评测 V4-Flash 时使用的那套精简工具集(终端、文件 I/O、网页、代码执行)率先发布,先证明模型智能体能力,再逐步放出完整运行时。
  • 子智能体编排:内置子智能体的创建、监督与结果回收机制,并带终止逻辑防止失控循环。
  • 记忆与上下文管理:缓存友好的上下文处理,利用 DeepSeek 前缀缓存计费让长会话保持低价。
  • TypeScript 原生:以 TypeScript 编写,通过 @deepseek-ai/dsh npm 包分发——npx @deepseek-ai/dsh web 即可启动 Web UI。
  • DeepSeek 原生经济性:围绕 DeepSeek 模型 1M token 上下文与缓存命中计费优化,同时也可对接其他模型供应商。

适用场景

谁应该使用这个工具?

  • 智能体开发者:想用与 DeepSeek 官方评测同款 Harness(Terminal Bench 2.1 82.7 分、DeepSWE 54.4 分)构建智能体的开发者。
  • DeepSeek 重度用户:在 V4-Flash、V4-Pro 上跑编程智能体的团队,想要第一方 Harness 而非第三方封装。
  • 基准复现者:想独立验证 DeepSeek 智能体基准声明的研究人员与工程师。
  • 开源贡献者:想参与一个进展极快、资金充足的开源智能体框架的开发者。

解决的问题

  1. 专有智能体的厂商锁定:MIT 许可,可 fork、可审计、可自托管,不同于 Claude Code 或 Codex。
  2. "开源模型不擅长工具调用"的迷思:DeepSeek 认为智能体表现差往往是 Harness 的问题而非模型的问题——这就是他们的参考实现。
  3. 基准不可复现:评测配置(极简模式、max 推理强度、top_p 0.95、temperature 1.0)已经公开,结果可以真正被检验。

定价方案

方案 价格 功能
开源版 $0 MIT 许可;免费使用、fork、自托管,仅需支付模型 API 费用。

底层模型价格(USD / 100 万 token,2026 年 8 月):

模型 输入(缓存命中) 输入(缓存未命中) 输出
deepseek-v4-flash $0.0028 $0.14 $0.28
deepseek-v4-pro $0.003625 $0.435 $0.87

优势对比

相比竞品的优势

  1. 第一方 Harness:DeepSeek 自研运行时,经过前沿规模检验——对比第三方 Harness 只是简单封装 API。
  2. 价格优势显著:V4-Flash 每百万 token 输入 $0.14 / 输出 $0.28,智能体工作负载的成本只有 Claude Opus 或 GPT-5.5 的零头。
  3. MIT 开源:完全透明、可 fork,不同于 Anthropic、OpenAI 的专有智能体。

独特卖点

  • 2026 年 7 月 31 日 V4-Flash 智能体成绩背后的引擎:Terminal Bench 2.1(82.7)、NL2Repo(54.2)、Cybergym(76.7)、DeepSWE(54.4)、Toolathlon verified(70.3)。
  • 开源数小时内 GitHub star 即突破 24,000。
  • 由 DeepSeek 专职团队自 2026 年 3 月组建开发,完整产品预期演化为"DeepSeek Code"——DeepSeek 对 Claude Code 的回答。

用户评价

"'开源模型工具调用不行'几乎总是 Harness 的问题而非模型的问题——这个洞察完全正确。这就是我们一直在等的参考实现。" — Hacker News 讨论

"比前沿闭源智能体便宜 10-12 倍,智能体基准接近 Claude Opus。性价比就是故事本身。" — Reddit r/LocalLLaMA 评论

"终于有官方 Harness 可以复现 DeepSeek 的数字了。厂商自报的成绩变得可以检验。" — Hacker News 评论

快速开始

入门指南

  1. 克隆git clone https://github.com/deepseek-ai/deepseek-harness
  2. 安装:按仓库 README 安装依赖(TypeScript、npm 生态)。
  3. 配置:填入 DeepSeek API Key(或任意供应商)并选择插件。
  4. 运行npx @deepseek-ai/dsh web 启动 Web UI,或在项目目录中无头运行。

集成

无缝集成:

  • DeepSeek API(V4-Flash、V4-Pro)与 Responses API
  • Codex 工作流兼容
  • dsh-plugin 插件生态
  • 通过插件接口接入 MCP 风格工具

常见问题

DeepSeek Harness 免费吗?

是的,Harness 本身 MIT 开源免费,只需通过 DeepSeek 平台支付模型 API 费用。

支持哪些模型?

主要为 DeepSeek V4-Flash 与 V4-Pro(1M token 上下文)设计,插件架构也允许接入其他供应商。

可以复现 DeepSeek 的基准成绩吗?

公开评测配置已文档化:Harness 极简模式、max 推理强度、top_p 0.95、temperature 1.0。截至 2026 年 8 月独立复现正在进行中。

与 Claude Code 相比如何?

Claude Code 是专有的;DeepSeek Harness 是 MIT 开源、可自托管,且所用模型每 token 价格约低 10 倍。完整版"DeepSeek Code"产品的功能对齐仍在演进中。

替代方案

如果 DeepSeek Harness 不适合,可以考虑这些替代品:

  • Claude Code:Anthropic 专有编程智能体,是 DeepSeek 对标的交互体验标杆。
  • Reasonix:第三方 DeepSeek 原生终端智能体,针对前缀缓存经济性调优。
  • OpenAI Agents SDK:OpenAI 开源智能体框架,编排模型不同。

使用技巧

  1. 使用缓存友好的提示词:DeepSeek 缓存命中价格($0.0028 vs $0.14 / 百万输入 token)奖励稳定、追加式的上下文——让 Harness 会话长期运行。
  2. 从极简模式开始:先用与官方基准完全一致的配置,再加重型插件。
  3. 留意高峰定价:2026 年 8 月 16 日起 DeepSeek 引入峰谷定价(UTC 01:00–04:00 与 06:00–10:00 为高峰)——批量智能体任务安排到低谷时段。

总结

DeepSeek Harness 是产出 DeepSeek 前沿智能体成绩的开源运行时——插件化、MIT 许可、成本只有闭源智能体的零头。如果你在 DeepSeek 模型上构建智能体,或想复现乃至超越 V4-Flash 背后的数字,这就是应该出发的官方参考实现。

评论

还没有评论。成为第一个评论的人!