Strands Harness
Strands Harness は、Strands Agents プロジェクトが 2026-09-21 に発表した完成済みのエージェントハーネスです。PyPI での公開者は AWS です。出発点は公式ブログに書かれています。多くの開発者が自分のエージェントにも Claude Code や Codex のような「入れたら動く」体験を望む一方で、自分でループを書き始めた瞬間にその体験を失ってしまう。Strands Harness はその隙間を埋めるために作られ、しかもコーディングエージェントではなく汎用エージェントとして設計されています。
Apache 2.0 のオープンソースで、ホスト型サービスではなく自分のプロセスで動くライブラリであり、モデルは自由に選べます。
箱の中身
引数なしで import すると、ベンチマークで調整された既定値を持つエージェントが手に入ります。
- 調整済みのシステムプロンプト。 まず調査し、次に行動し、不可逆な操作の前には確認し、終える前に検証する。
- 本物のツール。 シェルに加えてファイル操作(
read、write、edit)とウェブアクセス。 - コンテキスト管理。 タスクが長くなるほど大きなツール結果を脇に退避し、再利用される部分をキャッシュして時間とコストを削ります。
- メモリとセッション。 長期メモリは実行をまたいで残り、セッション ID を渡せば以前の会話を再開できます。
- 委譲。 開かれたサブタスクは内蔵のヘルパーエージェントに渡され、多段の作業はチェックリストで追跡されます。
- Skills とコード実行。 Agent Skills があれば読み込み、モデルは自分のツールをコードで編成できます。
これらはすべて狭めたり差し替えたり無効化でき、返ってくるのはラッパーのない標準的な Strands Agent です。ハーネスをゼロから組みたい場合も、基盤となる Strands Harness SDK で同じ設定を使えます。
コストと精度の主張
発表記事によれば、同じ Claude または GPT モデルを使った 6 つのベンチマークで、Strands Harness は Claude Code、Codex、その他の主要ハーネスより 28% 低コストで、スコアはほぼ同等だったとしています。Fable 5 を使った Terminal Bench 2.1 では、Claude Code より 77% 低コストでスコアは上回ったと報告されています。同じ記事の中で、DeepSeek Harness は全体で最もトークン効率が良い一方、精度はこのグループで最も低いとされています。
効く仕組みはプロンプトの工夫ではなくコンテキスト管理です。約 1,500 トークンを超えるツール結果は切り詰められ、コンテキストウィンドウの使用率が 85% を超えると要約(compaction)が走り、それでも溢れた場合はループ内でコンテキスト回復が動きます。ベンチマークは EC2 上の分散実行で、Harbor を使っています。手法については追って論文が出る予定です。
ここに挙げた数字はすべてベンダー自身によるものです。ハーネスはハーネスと比較されるので、これらの数字が示すのは「足場のコスト」であり、土台のモデルの実力ではありません。
どこに位置するか
Strands Harness はスタックの中間を狙っています。Claude Code や Codex CLI のようなコーディングエージェントは導入する製品で、LangGraph や OpenAI Agents SDK は自分で組み立てるライブラリです。Strands Harness はその間で、強い既定値を持ちながら、すべてを上書きできる立場を取ります。
料金
Apache 2.0 のオープンソースで無料です。費用はモデル利用分のみ。既定のプロバイダーは Amazon Bedrock なので、AWS アカウントがあると最も素直に始められます。Anthropic、OpenAI、Google、Ollama、LiteLLM にも対応します。
クイックスタート
Python:
# pip install strands-harness
from strands_harness import create_harness
agent = create_harness(model="anthropic/claude-opus-5")
agent("ベクトルデータベースを 3 つ調査し、料金と制限を比較して comparison.md にまとめて")
TypeScript:
// npm install @strands-agents/harness
import { createHarness } from "@strands-agents/harness";
const agent = await createHarness({ model: "openai/gpt-6-luna" });
await agent.invoke("このリポジトリを要約し、修正の PR を出して。");
あとは自分のワークロードに合う既定値だけを残します。最初の実行前に書く設定は何もなく、そこが要点です。
制限
- ベンチマークはベンダー自身によるもの。 28% と 77% はこのハーネスを作ったチームが自分で選んだ 6 つのベンチマークで測った数値で、第三者による再現はまだありません。
- バージョンはごく初期。 2026-09-24 時点で Python パッケージは 0.1.x で、1.0 まで API が変わる余地があります。
- コーディングエージェントではない。 意図的に汎用です。終日コードを書くなら、比較対象になっているコーディングハーネスのほうが今も専門的です。
- 既定のコンテキスト管理は積極的。 1,500 トークンを超えるツール結果は切り詰められます。コストは下がりますが、必要だった詳細が落ちる可能性もあるため、既定値を信じず自分のトラフィックで調整してください。
よくある質問
Strands Harness と Strands Agents SDK は同じものですか?
いいえ。SDK はエージェントを構築するためのフレームワークで、Strands Harness はその SDK 上に組み上げられた完成品です。同じリポジトリ内で harness-py と harness-ts のパッケージとして提供されています。
どのモデルで動きますか?
Amazon Bedrock、Anthropic、OpenAI、Google、ローカルの Ollama、そして LiteLLM 経由で到達できるものすべてです。既定は Amazon Bedrock です。
ローカルではなくデプロイもできますか?
できます。ライブラリなので自分のプロセスのある場所で動き、自前のサービスやサーバーレス上でも動きます。
今使っているエージェントを置き換えますか?
自分でループを書いている場合だけ置き換えの対象になります。既存のコーディングエージェント製品に満足しているなら、Strands Harness の価値は非コーディング業務で同じ体験を得ることにあります。
代替案
- DeepSeek Harness: Strands の比較で最もトークン効率が良く、精度は最も低いとされたハーネス。
- OpenAI Agents SDK: ループを自分で組むためのベンダー SDK。
- LangGraph: 明示的な状態機械が必要なワークフロー向けのグラフ型オーケストレーション。
まとめ
Strands Harness は、多くのエージェントプロジェクトに必要なのは独創的なループではなく、よくできた既定のループだという妥当な賭けをしています。import ひとつ、Apache 2.0 のライセンス、そして数字で説明できるコンテキスト管理。出発点として十分に強い組み合わせです。まずここから始め、自分のトラフィックで測り、合わない部分を上書きしてください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。