Microsoft ThinkingBox logo

Microsoft ThinkingBox

開く

Microsoft製のオープンソースサンドボックス兼ベンチマーク。ステートフルな業務タスクをAIエージェントが安定して完了できるかを検証し、発見と信頼性のギャップを示す。

共有:

Microsoft ThinkingBox

Microsoft ThinkingBox は、MITライセンスのサンドボックス兼ベンチマークです。AIエージェントが本番業務で信頼できるか、つまり「一度うまくいく」だけでなく、確実にやり遂げられるかを検証します。会話ログを読むのではなく、MCP互換のツール群に対してエージェントを実行し、システムの最終状態を実際に確認します。2026-08-19のMicrosoftコマンドラインブログと論文 arXiv:2608.19741 が発表の中心で、その結論は「発見と信頼性のギャップ」です。

主な機能

  • ツールをMCPとして定義:「ツール=MCPサーバー」として定義し、模擬ユーザー・LLMエージェント・ツールの多段インタラクションを実行します。
  • 実行可能な判定:最終状態・副作用・対話に対する複数の実行可能なアサーションで採点し、単一の回答だけでは評価しません。
  • 1つのループで3用途:オフラインの学習データ生成、強化学習ループ、リーダーボード評価を同じサンドボックスで実現します。
  • ステートフル業務向け:多段トランザクション、ポリシー条件付け更新、レコード参照、影響の大きい副作用などを想定。
  • サンドボックスとベンチマークを分離:ハーネスとベンチマークを独立して更新できます。

使用シナリオ

このツールを使用すべき人は?

  • エージェントチーム:データを変更し、気軽にやり直せない業務でモデルやランタイムを選定する場合。
  • 強化学習エンジニア:安全で再現可能な環境で訓練データ生成や報酬ループを回したい場合。
  • 評価担当者:トランスクリプトベースの採点を信用せず、実際にデータベースで何が変わったかを確認したい場合。

解決する問題

  1. 一度の成功は信頼性ではない:発表時のベンチマークでは、最強モデルがpass@1で65.36%でも、20回すべて成功するpass^20は25.25%でした。
  2. 静かな失敗:正常に見える終了や妥当なアクションで失敗する試行が多く、レスポンスレベルのシグナルでは見逃されます。
  3. 再現できる環境がない:ThinkingBoxは各試行にクリーンな隔離ベースラインを用意します。

料金プラン

プラン 価格 備考
ThinkingBox(MIT) $0 オープンソース、セルフホスト可能。
ThinkingBox-Bench $0 5つの業務ドメインにわたる507タスク。

サンドボックス上で実行するモデル分だけを支払います。

優位性と独自の価値提案

  • レポートではなくDBを確認:実行可能なアサーションで終了状態と副作用を検証。
  • 厳密な反復試行:発表時に12のプロプライエタリ/オープンウェイトモデル、各タスク20回を実施。
  • 1つの枠組みで3用途:オフラインデータ、RLループ、評価が同じ抽象化を共有。

はじめに

  1. microsoft/thinkingbox をクローン。
  2. 既存のMCPツールサーバーを選ぶか、独自に定義。
  3. 小さいタスクセットで実行してから、507タスクのベンチマークへ拡大。
  4. Microsoftコマンドラインブログを「発見と信頼性」結果の参考に。

よくある質問

実際のユーザーでのテストの代わりになりますか?

いいえ。隔離されたステートフル世界で安定したタスク完了を測るもので、実使用の補完です。

Microsoft製モデル専用ですか?

いいえ。モデル非依存で、発表結果でもプロプライエタリ/オープンウェイトモデルを対象にしています。

代替案

  • Microsoft MXC:信頼できないコードやエージェントツールのためのOSレベル隔離。
  • AgentOps:本番エージェントのランタイム可観測性。
  • OpenSandbox:エージェント生成コードを実行する別のサンドボックス。

ヒントとベストプラクティス

  1. pass@1だけでなく、pass^20も合わせて報告します。
  2. ツールを書く前に、リポジトリのREADMEを既定ツールカタログとして確認します。
  3. 本番投入前に、自分のエージェントが20回中どのタスクを安定して通せるかを確認します。

まとめ

Microsoft ThinkingBox は、無料でモデル非依存のハーネスであり、チャットログではなく最終状態を見ることで「信頼性」を測定可能にします。リポジトリから始めて、繰り返し試行で自分のエージェントを検証してから業務データに任せましょう。

コメント

まだコメントがありません。最初のコメントを投稿してください!