magi 是一个开源终端编码智能体,围绕一个关键问题构建:一轮(turn)到底算不算真正完成?大多数智能体循环在模型停止调用工具的那一刻就结束本轮。这通常往两个方向都出错,产生跑到任务四分之三就停下的智能体,以及永远不会停的智能体。magi 把「结束」变成一件必须论证的事。当智能体声明自己完成了,由三位审计官组成的评审团各自阅读完整记录(真实运行了什么、真实退出码是什么、磁盘上真正改了什么),然后投出「完成 / 驳回 / 弃权」。只有当证据支撑结论时本轮才结束;否则反馈会变成下一条指令,智能体继续工作。
核心功能
- 评审团校验循环:三位默认审计官(名字取自 MAGI)用不同视角和搜索顺序审阅同一份记录。
- 基于证据的需求走查:每位成员把每条需求标记为 SATISFIED、UNSATISFIED 或 NO-EVIDENCE,用工具返回的逐字片段来判定,而不是智能体自己的叙述。
- 可回放的记录:捕获每一步,一个被审查的循环可以重放和理解,而不是靠假设。
- 可探索的智能体:magi 可同时运行并监督多个智能体,既能在终端也能在配套 Web 控制台里做。
- 单一二进制:用 Go 编写,无 CGO,无重运行时依赖。
适用场景
谁应该使用这个工具?
- 不相信「看着像完成了」的开发者:自己的智能体经常距离目标差一点就停,或者永远不停。
- 大规模自治智能体团队:半成品或失控的运行要花真金白银和时间。
- 研究与应用评估:评审团给「任务到底完成没有」一个结构化、可检查的答案。
- 想给智能体循环一个严谨终止条件的人:而不是靠启发式。
解决的问题
- 过早结束:智能体因为模型工具调用耗尽而中途停下。magi 要求在本轮结束前拿出证据。
- 永不结束的循环:因为没人要求它为停止辩护,智能体一直跑。magi 让「完成」成为一个明确的、被质疑的声明。
- 不可信的自报:模型说「我做了」不能证明任何事。magi 用记录下来的工具输出逐条落实需求。
定价方案
| 方案 | 价格 | 功能 |
|---|---|---|
| 开放源码 | $0 | 全部功能,Apache-2.0,自托管,单一 Go 二进制 |
优势对比
- 严谨的终止:是否完成由证据决定,而不是模型自己的停止信号。
- 三个独立视角:正确性、验证、完整性各自先走查一遍才允许投票,任何一个被漏掉的细节都不会被全员通过掩盖。
- 开放、可检查、可重放:记录是一等公民产物,你可以审计它。
独特卖点:这个「拒绝承认完成」的评审团,是对智能体循环结束问题给出的一个真正不同的答案,并且以 Apache-2.0 公开,你能看清楚它到底做了什么。
快速开始
入门指南
- 构建或下载 magi 二进制(Go 1.26+,无 CGO 单一二进制)。
- 在终端运行并交给它一个任务。
- 观察循环:智能体逐步行动,然后声明「council: complete」。
- 让审计官投票:记录被逐行对照需求走查。
- 接受或继续:如果评审团驳回完成,反馈变成下一条指令,智能体继续。
集成
集成以下环境:
- macOS 和 Linux 的终端
- 任何能由一个 Go 二进制驱动的模型/CLI
- 一个用于同时监视多个智能体的配套 Web 控制台
常见问题
magi 会取代模型吗?
不会。magi 是一个智能体包装器,改变的是你通过它驱动的任意模型的「完成声明」方式。
只适合高级智能体用户吗?
不必然,但在「错误地判定完成」代价高昂的场景里最有价值,例如自治运行或一次性基准测试。
免费吗?
是的。它基于 Apache-2.0 开源,完全运行在你自己的机器上。
替代方案
如果 magi 不合适,可以考虑这些替代品:
- Claude Code:日常开发更精致,但仍采用传统的隐式结束。
- Codex / Cursor:交互式编码很强,但不那么聚焦于证明完成。
- OpenHands:如果你想要完整智能体平台,而不是聚焦终止的包装器。
使用技巧
- 把需求写成显式行:审计官走查「任务要求的每一点一行」,模糊的请求会产生薄弱的检查。
- 把 NO-EVIDENCE 当成答案:缺少结果本身也是信息,不要用智能体的自报去填记录。
- 用控制台做监督:同时跑多个智能体时,评审团的一致性最省时间。
总结
magi 直击智能体循环里最常被忽略的部分:判断工作是否真正完成。它把「完成」变成一个被质疑、基于证据的决策,而不是一次静默停止,给智能体用户一个可信任、可检查的终止条件。
评论
还没有评论。成为第一个评论的人!
相关工具
Aider
aider.chat
开源终端结对编程工具。Apache-2.0,自带模型密钥。你付的是所连模型的 API 账单,不是 Aider 月费席位。
aiXcoder
www.aixcoder.com
国产 AI 编程助手,开源 Apache-2.0 的 7B 补全模型。官网无公开 SaaS 价目,云端席位按销售报价,勿再写 ¥99/月。
CLI-Anything
clianything.cc
HKUDS 开源注册表,把 GUI 应用、API 与 SaaS 工具变成智能体可调用的 CLI,适配 OpenClaw、Claude Code、Codex 与 Cursor。
相关洞察
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。