Strands Harness logo

Strands Harness

開く

AWS の Strands Agents チームによる汎用エージェントハーネス。import ひとつで調整済みエージェントが手に入り、同社によれば Claude Code や Codex より 28% 低コスト。

共有:
代替ツールを見る

Strands Harness

Strands Harness は、Strands Agents プロジェクトが 2026-09-21 に発表した完成済みのエージェントハーネスです。PyPI での公開者は AWS です。出発点は公式ブログに書かれています。多くの開発者が自分のエージェントにも Claude Code や Codex のような「入れたら動く」体験を望む一方で、自分でループを書き始めた瞬間にその体験を失ってしまう。Strands Harness はその隙間を埋めるために作られ、しかもコーディングエージェントではなく汎用エージェントとして設計されています。

Apache 2.0 のオープンソースで、ホスト型サービスではなく自分のプロセスで動くライブラリであり、モデルは自由に選べます。

箱の中身

引数なしで import すると、ベンチマークで調整された既定値を持つエージェントが手に入ります。

  • 調整済みのシステムプロンプト。 まず調査し、次に行動し、不可逆な操作の前には確認し、終える前に検証する。
  • 本物のツール。 シェルに加えてファイル操作(readwriteedit)とウェブアクセス。
  • コンテキスト管理。 タスクが長くなるほど大きなツール結果を脇に退避し、再利用される部分をキャッシュして時間とコストを削ります。
  • メモリとセッション。 長期メモリは実行をまたいで残り、セッション ID を渡せば以前の会話を再開できます。
  • 委譲。 開かれたサブタスクは内蔵のヘルパーエージェントに渡され、多段の作業はチェックリストで追跡されます。
  • Skills とコード実行。 Agent Skills があれば読み込み、モデルは自分のツールをコードで編成できます。

これらはすべて狭めたり差し替えたり無効化でき、返ってくるのはラッパーのない標準的な Strands Agent です。ハーネスをゼロから組みたい場合も、基盤となる Strands Harness SDK で同じ設定を使えます。

コストと精度の主張

発表記事によれば、同じ Claude または GPT モデルを使った 6 つのベンチマークで、Strands Harness は Claude Code、Codex、その他の主要ハーネスより 28% 低コストで、スコアはほぼ同等だったとしています。Fable 5 を使った Terminal Bench 2.1 では、Claude Code より 77% 低コストでスコアは上回ったと報告されています。同じ記事の中で、DeepSeek Harness は全体で最もトークン効率が良い一方、精度はこのグループで最も低いとされています。

効く仕組みはプロンプトの工夫ではなくコンテキスト管理です。約 1,500 トークンを超えるツール結果は切り詰められ、コンテキストウィンドウの使用率が 85% を超えると要約(compaction)が走り、それでも溢れた場合はループ内でコンテキスト回復が動きます。ベンチマークは EC2 上の分散実行で、Harbor を使っています。手法については追って論文が出る予定です。

ここに挙げた数字はすべてベンダー自身によるものです。ハーネスはハーネスと比較されるので、これらの数字が示すのは「足場のコスト」であり、土台のモデルの実力ではありません。

どこに位置するか

Strands Harness はスタックの中間を狙っています。Claude CodeCodex CLI のようなコーディングエージェントは導入する製品で、LangGraphOpenAI Agents SDK は自分で組み立てるライブラリです。Strands Harness はその間で、強い既定値を持ちながら、すべてを上書きできる立場を取ります。

料金

Apache 2.0 のオープンソースで無料です。費用はモデル利用分のみ。既定のプロバイダーは Amazon Bedrock なので、AWS アカウントがあると最も素直に始められます。Anthropic、OpenAI、Google、Ollama、LiteLLM にも対応します。

クイックスタート

Python:

# pip install strands-harness
from strands_harness import create_harness

agent = create_harness(model="anthropic/claude-opus-5")
agent("ベクトルデータベースを 3 つ調査し、料金と制限を比較して comparison.md にまとめて")

TypeScript:

// npm install @strands-agents/harness
import { createHarness } from "@strands-agents/harness";

const agent = await createHarness({ model: "openai/gpt-6-luna" });
await agent.invoke("このリポジトリを要約し、修正の PR を出して。");

あとは自分のワークロードに合う既定値だけを残します。最初の実行前に書く設定は何もなく、そこが要点です。

制限

  • ベンチマークはベンダー自身によるもの。 28% と 77% はこのハーネスを作ったチームが自分で選んだ 6 つのベンチマークで測った数値で、第三者による再現はまだありません。
  • バージョンはごく初期。 2026-09-24 時点で Python パッケージは 0.1.x で、1.0 まで API が変わる余地があります。
  • コーディングエージェントではない。 意図的に汎用です。終日コードを書くなら、比較対象になっているコーディングハーネスのほうが今も専門的です。
  • 既定のコンテキスト管理は積極的。 1,500 トークンを超えるツール結果は切り詰められます。コストは下がりますが、必要だった詳細が落ちる可能性もあるため、既定値を信じず自分のトラフィックで調整してください。

よくある質問

Strands Harness と Strands Agents SDK は同じものですか?

いいえ。SDK はエージェントを構築するためのフレームワークで、Strands Harness はその SDK 上に組み上げられた完成品です。同じリポジトリ内で harness-pyharness-ts のパッケージとして提供されています。

どのモデルで動きますか?

Amazon Bedrock、Anthropic、OpenAI、Google、ローカルの Ollama、そして LiteLLM 経由で到達できるものすべてです。既定は Amazon Bedrock です。

ローカルではなくデプロイもできますか?

できます。ライブラリなので自分のプロセスのある場所で動き、自前のサービスやサーバーレス上でも動きます。

今使っているエージェントを置き換えますか?

自分でループを書いている場合だけ置き換えの対象になります。既存のコーディングエージェント製品に満足しているなら、Strands Harness の価値は非コーディング業務で同じ体験を得ることにあります。

代替案

  • DeepSeek Harness: Strands の比較で最もトークン効率が良く、精度は最も低いとされたハーネス。
  • OpenAI Agents SDK: ループを自分で組むためのベンダー SDK。
  • LangGraph: 明示的な状態機械が必要なワークフロー向けのグラフ型オーケストレーション。

まとめ

Strands Harness は、多くのエージェントプロジェクトに必要なのは独創的なループではなく、よくできた既定のループだという妥当な賭けをしています。import ひとつ、Apache 2.0 のライセンス、そして数字で説明できるコンテキスト管理。出発点として十分に強い組み合わせです。まずここから始め、自分のトラフィックで測り、合わない部分を上書きしてください。

コメント

まだコメントがありません。最初のコメントを投稿してください!