Microsoft ThinkingBox
Microsoft ThinkingBox 是一个 MIT 许可的智能体沙箱与基准,用来检验一个 AI 智能体是否真的能扛住真实业务,而不是「碰巧成功一次」。它不依赖对话记录,而是让智能体在隔离的、兼容 MCP 的工具环境里运行,再去检查系统的最终状态。配套的论文为 arXiv:2608.19741,微软命令行博客于 2026-08-19 发布,核心结论是「发现—可靠性差距」。
核心功能
- 以工具即 MCP 的方式构建:把工具定义为 MCP server,再驱动「模拟用户 + LLM 智能体 + 工具」进行多轮交互。
- 可执行判定:通过最终状态、副作用与对话的多项可执行断言评分,而不是只看一个最终答案。
- 同一个循环三种用途:离线训练数据生成、强化学习训练循环、榜单评估都复用同一套沙箱。
- 面向有状态工作:覆盖多步事务、策略条件更新、记录查询、高影响副作用等企业级助手常见模式。
- 沙箱与基准解耦:可独立更新运行框架和基准包。
适用场景
谁应该使用这个工具?
- 智能体团队:为会改动数据、不能随意重来的业务场景选型模型或运行时。
- 强化学习工程师:需要安全、可复现的环境来生成训练数据或跑奖励循环。
- 评估者:不信任基于对话记录的评分,希望验证「数据库里到底改了什么」。
解决的问题
- 一次成功不等于可靠:发布基准里最强模型 pass@1 为 65.36%,但连续 20 次全部成功的 pass^20 只有 25.25%。
- 静默失败:很多失败尝试看似正常结束或动作有效,仅靠响应层面的信号无法发现。
- 没有可复现环境:ThinkingBox 为每次试验提供干净、隔离的基线。
定价方案
| 方案 | 价格 | 说明 |
|---|---|---|
| ThinkingBox(MIT) | $0 | 开源、可自托管。 |
| ThinkingBox-Bench | $0 | 覆盖五个业务域的 507 个任务。 |
你只需为在该沙箱上运行的模型付费。
优势对比
- 查的是数据库,不是报告:用可执行断言验证终止状态与副作用。
- 多次重复试验:发布时包含 12 个闭源与开源权重模型、每任务 20 次试验。
- 一个框架三种用法:离线数据、RL 循环与评估共用同一抽象。
快速开始
- 克隆 microsoft/thinkingbox。
- 选用现有 MCP 工具 server 或自行定义。
- 先在小的任务集上运行,再扩大到完整的 507 个任务基准。
- 以微软命令行博客为「发现—可靠性」结果的参考。
常见问题
它能替代用真实用户测试我的智能体吗?
不能。该基准在隔离的有状态世界中度量稳定的任务完成率,是对真实使用场景的补充。
只能测微软模型吗?
不是。它不绑定模型,发布结果即覆盖闭源与开源权重模型。
替代方案
- Microsoft MXC:面向不可信代码与智能体工具的操作系统级隔离。
- AgentOps:生产环境的智能体运行时可观测性。
- OpenSandbox:运行智能体生成代码的另一种沙箱。
使用技巧
- 报告 pass@1 的同时务必报告 pass^20,不要只看 pass@1。
- 编写工具前先把仓库 README 当作默认工具目录核对。
- 上线前先确认你自己的智能体在 20 次试验中能稳定通过哪些任务。
总结
Microsoft ThinkingBox 是一个免费、不绑定模型的运行框架,通过检查最终状态而非聊天日志,把「可靠性」变成可度量的量。从仓库开始,在重复试验中验证你自己的智能体,再放心交给业务数据。
评论
还没有评论。成为第一个评论的人!
相关工具
Microsoft MXC
github.com/microsoft/mxc
微软执行容器(MXC):跨平台的开源沙箱代码执行系统,用于安全运行不可信的模型输出、插件与智能体工具。
Cloudflare Computer
github.com/cloudflare/computer
Durable Object 上的预览版 MIT 智能体文件系统。复核:GitHub 8,355 stars。不能用于生产。付的是 Workers 用量,不是 $0 电脑 SKU。
Daytona
www.daytona.io
Daytona 现为闭源沙箱云。GitHub 已归档。Starter $20、Plus $200、Scale $500,含额之外另计计算。
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。