Strands Harness logo

Strands Harness

打开

AWS Strands Agents 团队开箱即用的通用 Agent harness:一次 import 就拿到调好默认值的 Agent,官方称同等准确率下比 Claude Code、Codex 省 28% token。

分享:
查看替代方案

Strands Harness

Strands Harness 是 Strands Agents 项目在 2026-09-21 发布的完整 Agent harness,PyPI 上的发布者是 AWS。它的出发点写在官方博客里:很多人希望自己的 Agent 能像 Claude Code 或 Codex 那样「一装上就能用」,可一旦自己写循环,就只剩自己了。Strands Harness 就是补这个 Gap 的产物,而且它刻意做成通用 Agent,不是编码 Agent。

它基于 Apache 2.0 开源,是一个可以装进自己进程里的库,而不是托管服务,模型可以随便挑。

开箱自带什么

不带任何参数 import 之后,你拿到的是一个已经调过默认值的 Agent:

  • 调优过的系统提示词。 先探索再动手、不可逆操作先确认、收尾前先验证。
  • 真家伙的工具集。 一个 shell,加上文件工具(readwriteedit)和联网能力。
  • 上下文管理。 任务变长时把体积大的工具结果挪到一边,并缓存请求中重复的部分来省时省钱。
  • 记忆与会话。 长期记忆跨运行保留,给一个 session id 就能接上之前的对话。
  • 任务委派。 开放式子任务交给内置的助手 Agent,多步工作用 checklist 跟踪。
  • Skills 与代码编排。 存在 Agent Skills 时会自动加载,模型可以在代码里编排自己的工具。

以上每一项都能收窄、替换或关掉,拿到的是一个不带包装层的标准 Strands Agent。想自己从零搭 harness,也能用底层的 Strands Harness SDK 复用同一套配置。

成本与准确率的说法

官方发布文称,在六个基准上使用同样的 Claude 或 GPT 模型时,Strands Harness 的成本比 Claude Code、Codex 等主流 harness 低 28%,而得分基本持平。用 Fable 5 跑 Terminal Bench 2.1 时,官方称成本比 Claude Code 低 77%,得分反而更高。同一篇文里,DeepSeek Harness 被评为整体最省 token,但准确率是这一组里最低的。

省钱的机制不是提示词技巧,而是上下文管理:工具结果超过约 1500 token 就截断,上下文窗口占用超过 85% 时触发压缩(compaction),万一还是溢出就在循环内做上下文恢复。基准测试是分布式跑在 EC2 上、用 Harbor 完成的,团队说后续会补一篇讲方法的论文。

以上数字全部来自厂商自己。harness 是对着 harness 测的,所以这些数字说明的是「脚手架要花多少钱」,不是底层模型有多强。

它在生态里的位置

Strands Harness 卡在中间层。像 Claude CodeCodex CLI 这样的编码 Agent 是你直接采用的产品;LangGraphOpenAI Agents SDK 这类框架是你要自己拼的库。Strands Harness 站在两者之间:默认值足够有主见,但每一个都能覆盖。

定价

Apache 2.0 开源免费,只需要付模型用量。默认走 Amazon Bedrock,所以有 AWS 账号是最顺的路径;Anthropic、OpenAI、Google、Ollama、LiteLLM 也都支持。

快速开始

Python:

# pip install strands-harness
from strands_harness import create_harness

agent = create_harness(model="anthropic/claude-opus-5")
agent("调研三个向量数据库,比较价格和限制,写进 comparison.md")

TypeScript:

// npm install @strands-agents/harness
import { createHarness } from "@strands-agents/harness";

const agent = await createHarness({ model: "openai/gpt-6-luna" });
await agent.invoke("总结这个仓库,并提交一个修复用的 PR。");

跑起来之后再逐项收紧默认值。第一次运行前不需要写任何配置,这正是它的卖点。

限制

  • 基准测试出自厂商。 28% 和 77% 都由做这个 harness 的团队在自己挑的六个基准上测得,目前还没有独立复现。
  • 版本号很早期。 截至 2026-09-24,Python 包还在 0.1.x,1.0 之前 API 有变动的空间。
  • 它不是编码 Agent。 它刻意做成通用型。如果你整天写代码,被它拿来对比的那几个编码 harness 仍然更专业。
  • 默认的上下文管理比较激进。 超过 1500 token 的工具结果会被截断,省钱的同时可能丢掉你真正需要的细节,请在自己的流量上实测,别直接信任默认值。

常见问题

Strands Harness 和 Strands Agents SDK 是同一个东西吗?

不是。SDK 是用来构建 Agent 的框架,Strands Harness 是基于该 SDK 预先组装好的 Agent,两者在同一个仓库里,分别对应 harness-pyharness-ts 包。

支持哪些模型?

Amazon Bedrock、Anthropic、OpenAI、Google、本地 Ollama,以及任何能通过 LiteLLM 访问的模型。默认是 Amazon Bedrock。

能部署到服务器上吗?

可以。它是库,跑在你的进程里,能放进自己的服务或 serverless 计算。

它能替换我现在的 Agent 吗?

只有当你今天在写自己的循环时才谈得上替换。如果你对现有编码 Agent 产品满意,Strands Harness 的价值在非编码任务上提供同样体验。

替代方案

总结

Strands Harness 押的是一个很合理的判断:多数 Agent 项目不需要原创的循环,只需要一个足够好的默认循环。一次 import、Apache 2.0 许可、加上能用数字讲清楚的上下文管理策略,是很扎实的起点。先用它起步,在自己的流量上量一遍,再覆盖不合适的地方。

评论

还没有评论。成为第一个评论的人!