Microsoft ThinkingBox logo

Microsoft ThinkingBox

打开

微软开源的智能体沙箱与基准,用可执行断言验证 AI 智能体能否稳定完成有状态的业务任务,揭示「一次成功不等于可靠」。

分享:

Microsoft ThinkingBox

Microsoft ThinkingBox 是一个 MIT 许可的智能体沙箱与基准,用来检验一个 AI 智能体是否真的能扛住真实业务,而不是「碰巧成功一次」。它不依赖对话记录,而是让智能体在隔离的、兼容 MCP 的工具环境里运行,再去检查系统的最终状态。配套的论文为 arXiv:2608.19741,微软命令行博客于 2026-08-19 发布,核心结论是「发现—可靠性差距」。

核心功能

  • 以工具即 MCP 的方式构建:把工具定义为 MCP server,再驱动「模拟用户 + LLM 智能体 + 工具」进行多轮交互。
  • 可执行判定:通过最终状态、副作用与对话的多项可执行断言评分,而不是只看一个最终答案。
  • 同一个循环三种用途:离线训练数据生成、强化学习训练循环、榜单评估都复用同一套沙箱。
  • 面向有状态工作:覆盖多步事务、策略条件更新、记录查询、高影响副作用等企业级助手常见模式。
  • 沙箱与基准解耦:可独立更新运行框架和基准包。

适用场景

谁应该使用这个工具?

  • 智能体团队:为会改动数据、不能随意重来的业务场景选型模型或运行时。
  • 强化学习工程师:需要安全、可复现的环境来生成训练数据或跑奖励循环。
  • 评估者:不信任基于对话记录的评分,希望验证「数据库里到底改了什么」。

解决的问题

  1. 一次成功不等于可靠:发布基准里最强模型 pass@1 为 65.36%,但连续 20 次全部成功的 pass^20 只有 25.25%。
  2. 静默失败:很多失败尝试看似正常结束或动作有效,仅靠响应层面的信号无法发现。
  3. 没有可复现环境:ThinkingBox 为每次试验提供干净、隔离的基线。

定价方案

方案 价格 说明
ThinkingBox(MIT) $0 开源、可自托管。
ThinkingBox-Bench $0 覆盖五个业务域的 507 个任务。

你只需为在该沙箱上运行的模型付费。

优势对比

  • 查的是数据库,不是报告:用可执行断言验证终止状态与副作用。
  • 多次重复试验:发布时包含 12 个闭源与开源权重模型、每任务 20 次试验。
  • 一个框架三种用法:离线数据、RL 循环与评估共用同一抽象。

快速开始

  1. 克隆 microsoft/thinkingbox
  2. 选用现有 MCP 工具 server 或自行定义。
  3. 先在小的任务集上运行,再扩大到完整的 507 个任务基准。
  4. 微软命令行博客为「发现—可靠性」结果的参考。

常见问题

它能替代用真实用户测试我的智能体吗?

不能。该基准在隔离的有状态世界中度量稳定的任务完成率,是对真实使用场景的补充。

只能测微软模型吗?

不是。它不绑定模型,发布结果即覆盖闭源与开源权重模型。

替代方案

  • Microsoft MXC:面向不可信代码与智能体工具的操作系统级隔离。
  • AgentOps:生产环境的智能体运行时可观测性。
  • OpenSandbox:运行智能体生成代码的另一种沙箱。

使用技巧

  1. 报告 pass@1 的同时务必报告 pass^20,不要只看 pass@1。
  2. 编写工具前先把仓库 README 当作默认工具目录核对。
  3. 上线前先确认你自己的智能体在 20 次试验中能稳定通过哪些任务。

总结

Microsoft ThinkingBox 是一个免费、不绑定模型的运行框架,通过检查最终状态而非聊天日志,把「可靠性」变成可度量的量。从仓库开始,在重复试验中验证你自己的智能体,再放心交给业务数据。

评论

还没有评论。成为第一个评论的人!