Microsoft ThinkingBox
Microsoft ThinkingBox は、MITライセンスのサンドボックス兼ベンチマークです。AIエージェントが本番業務で信頼できるか、つまり「一度うまくいく」だけでなく、確実にやり遂げられるかを検証します。会話ログを読むのではなく、MCP互換のツール群に対してエージェントを実行し、システムの最終状態を実際に確認します。2026-08-19のMicrosoftコマンドラインブログと論文 arXiv:2608.19741 が発表の中心で、その結論は「発見と信頼性のギャップ」です。
主な機能
- ツールをMCPとして定義:「ツール=MCPサーバー」として定義し、模擬ユーザー・LLMエージェント・ツールの多段インタラクションを実行します。
- 実行可能な判定:最終状態・副作用・対話に対する複数の実行可能なアサーションで採点し、単一の回答だけでは評価しません。
- 1つのループで3用途:オフラインの学習データ生成、強化学習ループ、リーダーボード評価を同じサンドボックスで実現します。
- ステートフル業務向け:多段トランザクション、ポリシー条件付け更新、レコード参照、影響の大きい副作用などを想定。
- サンドボックスとベンチマークを分離:ハーネスとベンチマークを独立して更新できます。
使用シナリオ
このツールを使用すべき人は?
- エージェントチーム:データを変更し、気軽にやり直せない業務でモデルやランタイムを選定する場合。
- 強化学習エンジニア:安全で再現可能な環境で訓練データ生成や報酬ループを回したい場合。
- 評価担当者:トランスクリプトベースの採点を信用せず、実際にデータベースで何が変わったかを確認したい場合。
解決する問題
- 一度の成功は信頼性ではない:発表時のベンチマークでは、最強モデルがpass@1で65.36%でも、20回すべて成功するpass^20は25.25%でした。
- 静かな失敗:正常に見える終了や妥当なアクションで失敗する試行が多く、レスポンスレベルのシグナルでは見逃されます。
- 再現できる環境がない:ThinkingBoxは各試行にクリーンな隔離ベースラインを用意します。
料金プラン
| プラン | 価格 | 備考 |
|---|---|---|
| ThinkingBox(MIT) | $0 | オープンソース、セルフホスト可能。 |
| ThinkingBox-Bench | $0 | 5つの業務ドメインにわたる507タスク。 |
サンドボックス上で実行するモデル分だけを支払います。
優位性と独自の価値提案
- レポートではなくDBを確認:実行可能なアサーションで終了状態と副作用を検証。
- 厳密な反復試行:発表時に12のプロプライエタリ/オープンウェイトモデル、各タスク20回を実施。
- 1つの枠組みで3用途:オフラインデータ、RLループ、評価が同じ抽象化を共有。
はじめに
- microsoft/thinkingbox をクローン。
- 既存のMCPツールサーバーを選ぶか、独自に定義。
- 小さいタスクセットで実行してから、507タスクのベンチマークへ拡大。
- Microsoftコマンドラインブログを「発見と信頼性」結果の参考に。
よくある質問
実際のユーザーでのテストの代わりになりますか?
いいえ。隔離されたステートフル世界で安定したタスク完了を測るもので、実使用の補完です。
Microsoft製モデル専用ですか?
いいえ。モデル非依存で、発表結果でもプロプライエタリ/オープンウェイトモデルを対象にしています。
代替案
- Microsoft MXC:信頼できないコードやエージェントツールのためのOSレベル隔離。
- AgentOps:本番エージェントのランタイム可観測性。
- OpenSandbox:エージェント生成コードを実行する別のサンドボックス。
ヒントとベストプラクティス
- pass@1だけでなく、pass^20も合わせて報告します。
- ツールを書く前に、リポジトリのREADMEを既定ツールカタログとして確認します。
- 本番投入前に、自分のエージェントが20回中どのタスクを安定して通せるかを確認します。
まとめ
Microsoft ThinkingBox は、無料でモデル非依存のハーネスであり、チャットログではなく最終状態を見ることで「信頼性」を測定可能にします。リポジトリから始めて、繰り返し試行で自分のエージェントを検証してから業務データに任せましょう。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
Microsoft MXC
github.com/microsoft/mxc
Microsoft Execution Containers(MXC):Windows/Linux/macOSで使えるオープンなサンドボックスコード実行基盤。信頼できないモデル出力・プラグイン・エージェントツールを隔離実行する。
Cloudflare Computer
github.com/cloudflare/computer
Durable Object上のプレビューMITエージェントFS。再確認:GitHub 8,355 stars。本番不可。払うのはWorkers利用料であり、$0コンピュータSKUではない。
Daytona
www.daytona.io
Daytona は今、クローズドなサンドボックスクラウド。GitHub はアーカイブ済み。Starter $20、Plus $200、Scale $500。含む分のあとはコンピュート課金。
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。