6 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
2026 年,谁的终端里没装几个 AI 编程工具?Claude Code、Codex CLI、opencode、pi、omp,最近连 DeepSeek 都亲自下场发了官方 harness——这些我全都装了,而且认真用了半年。
结论先说,就两条:
第一,工具没有好坏,只有合不合适;让一个工具干所有活,是最大的浪费。
第二,模型再强,干活也要有监督,而且最好是独立第三方。
下面按我的真实使用场景,把六款 CLI 逐个讲透:擅长什么、不擅长什么、什么时候该掏哪一把。
一张表看懂六款工具
| 工具 | 一句话定位 | 最擅长 | 明显短板 |
|---|---|---|---|
| Claude Code | 生态最成熟的终端编程 agent | 全局理解、复杂重构、主动性 | 贵、额度紧、风控严 |
| Codex CLI | 高推理强度的执行者 | 疑难调试、CR、批量任务、稳 | 慢、代码风格与抽象一般 |
| opencode | 模型无关的万能插座 | 换模型试水、省钱、TUI 手感 | 生态还在追赶 |
| pi | 极简 harness | 快、省、几乎零成本 | 能力天花板低 |
| omp | 全家桶 agent | 全面审查、advisor 实时监督、LSP/DAP/浏览器内置 | 相对重 |
| DeepSeek Harness | DeepSeek 官方 harness | 便宜、快、缓存命中价低到离谱 | 刚开源,还在快速迭代 |
逐个讲透:六款工具的优劣与使用场景
Claude Code:写代码的主力
我 90% 的正经开发任务都交给它。skills、subagents、hooks、/code-review 这套生态是六款里最成熟的,主动性也最强——给它一个目标,它能自己读代码、跑测试、改方案,从规划到实现一气呵成。做大范围重构(20+ 文件)时,它的全局理解力是断档的。
代价是贵。token 烧得快,额度经常让人焦虑,账号风控出了名的严,圈子里"被 CC 封号"的段子都能集结成册。所以我的原则是:重要任务给它,琐碎任务别用它。
Codex CLI:攻坚手兼铁面审查官
"人狠话不多"说的就是它。高推理强度模式下调试极强,Reddit 上有开发者报告"三个 bug 一次修完",我自己用下来也差不多——它不折腾,给指令就执行,执行完就验证。成本控制也好,同样的活它烧的 token 明显比 Claude 少。
它做 CR 也是一把好手——Reddit 上有个比喻很准:"Claude 会声称全部搞定了,Codex 会指出来这里那里还没修。" 让它审代码,它绝不留情面,问题清单列得明明白白。所以社区里"cc max 写代码,codex 审核代码"的组合才那么流行。
短板也有两个。一是慢,而且性格是"先做后问":需求模糊时它会边做边猜,需要你盯紧一点。二是代码品味一般——它解决问题很扎实,但写出来的代码风格和抽象层次不太行,命名、分层、可读性这些"软实力"明显不如 Claude。所以我的用法是:让它干活、让它审,但别让它定架构。适合疑难 bug、批量任务、需要沙箱的高风险操作,不适合需要反复对齐需求的探索性开发,也不适合对代码风格有洁癖的场景。
opencode:万能插座
它是 SST 团队做的开源 agent(MIT),最大的牌是模型无关——75+ 提供商随便挂,GLM、MiniMax、DeepSeek、Claude、GPT 想换就换,还能白嫖免费模型。TUI 手感是公认的三款主流里最好的,token 消耗也比 Claude Code 省。
我的用法:换模型试水、多模型对比、预算敏感的批量活。它不会替你锁定任何一家厂商,这种自由度用久了会上瘾。
pi:极简主义
pi 是 Mario Zechner 做的极简 harness:四个核心工具、系统提示词只有约 1k token、15+ 提供商。它不追求能力上限,追求的是快和省——几秒出结果,几乎零成本。
所以我的定位很明确:最省事的 CR 工具。单文件、小改动、几分钟的 diff,直接让 pi 扫一遍风格、潜在 bug 和安全问题。快和省本身就是优势——成本低到你愿意"每次改动都审"。
omp:全家桶
omp(Oh My Pi)是 pi 的"全家桶"fork:hash-anchored edits、原生 LSP 重构、DAP 调试、浏览器自动化、子代理,60+ 提供商,把 IDE 该有的能力全塞进了终端。
我的定位:复杂 PR 的 CR 工具。改动面大的 PR,它真的能读代码、跑测试、看效果再下结论,审查质量比 pi 高一个档次,成本和速度又比高端模型划算——相对平衡的选择。
它还自带实时 CR:--advisor 运行时,挂一个 review 模型(比如 openai-codex/gpt-5.5)当顾问,它会实时盯着主 agent 的每一轮操作,发现问题直接注入 inline 备注(concern / aside / blocker 三档),主 agent 看到备注当场纠正,或解释为什么不改。审查不是事后补做,而是边写边审——这是 omp 最独特的一张牌。
DeepSeek Harness:便宜量大的审查机器
dsh 是 DeepSeek 官方 agent harness(2026 年 8 月 13 日刚开源,MIT,"Everything is a Plugin"),支持 web / headless / tui 三种 profile,我机器上跑的是 0.1.0-rc.6。配 V4 Flash 用:1M 上下文、速度极快、缓存命中时输入价只要 $0.0028/M——是未命中价 $0.14/M 的 1/50。
这是它最离谱的地方:成本低到可以当"免费 CR 苦力"。配合它天然的缓存友好设计(长会话保持稳定上下文,命中率更容易拉高),高频、大批量的审查随便跑,几十轮下来 token 费用几乎可以忽略。
这套打法不是我发明的
我研究这套分工的时候发现,圈子里的共识早就长这样了:
Reddit r/ClaudeCode 有个说法被反复引用——"Claude 更愿意越界犯错,Codex 更愿意偷懒犯错"。所以有人专门用 Claude 做规划、Codex 做实现,再让两者互相审查,结论是"两个都该用"。X 上 Theo 给过一模一样的建议:API 写完后用 claude -p 让 Opus 出第二意见,能显著提升 OpenAI 模型写出来的代码质量。
中文社区玩得更野。V2EX 老哥的经典组合拳:"最终一定是双持,交叉 review,最好一个主力一个入门";有人把 Claude Code 用 CC Switch 路由到 DeepSeek,做基础编程任务省钱又快,"最后拿到 codex 上检查整合";还有人报告 Claude Code + DeepSeek V4 Pro 的缓存命中率高达 99%。掘金上有篇三工具实测,日常画面是"左边 Cursor 写代码,右边终端开着 Claude 当顾问,后台 Codex 在审查昨天的 PR"——一主二辅,我认为这就是 2026 年最务实的工作流。
今年年初那场闹剧也推了一把:Anthropic 一度封杀第三方工具调用 Claude,DHH 直接开喷"把开发者锁死在 Claude Code 里的偏执尝试"。不管谁对谁错,这件事让一个共识更清楚了——不要把"写"和"审"绑在同一个模型上。
我的 CR 三级审查
落实到我的日常工作,审查分三档,成本递增:
第一级:pi —— 最简检查,最快最省。 小改动、单文件、几分钟的 diff,pi 几秒出报告。查风格、查潜在 bug、查安全隐患,够用且几乎零成本。
第二级:omp —— 复杂 PR,相对平衡。 改动面大的 PR 交给 omp,它能读代码、跑测试、看效果再下结论,审查能力和成本之间最均衡;需要边写边审的场景还能开 --advisor 实时模式,让另一个模型逐轮盯着主 agent。
第三级:DeepSeek Harness + V4 Flash —— 高频、大批量、极低成本。 批量审查、全量扫描、每周的代码巡检,直接 dsh 上,跑多少轮都不心疼。
杀手锏:让 Claude / Codex 写完,用 dsh 审
这是我这半年用下来效果最好的一个组合:让 Claude Code 或 Codex 写代码,然后让它们执行 dsh 命令,由 DeepSeek Harness 跑一轮独立 CR。(顺便说一句,omp 的 --advisor 也是同一个思路的内置版——挂一个 review 模型实时盯着主 agent 的每一轮,写审一体。)
为什么效果好?三点:
- 独立第三方。 写代码的模型和审代码的模型不是同一个。自己写自己审,等于让作者当自己的裁判——错误往往藏在模型不擅长的区域,而它恰好不擅长检查自己。换一个模型来审,错误模式完全不同,盲区正好互补。
- 缓存命中率高,成本低到可以忽略。 DeepSeek 的 KV 缓存按前缀匹配,长会话上下文稳定,命中率轻松拉到 95%+(V2EX 有人报 99%)。$0.0028/M 的价格,审几十轮也不心疼。
- 速度就是生产力。 V4 Flash 快,一条
dsh命令几十秒出报告。审查从"偶尔做一次"变成"每次提交都做"——频率本身就是质量。
为什么"独立第三方监督"真的有用
- 自我审查有盲区。 一个模型生成的代码,它自己"看起来都对",这是最危险的部分。
- 交叉验证能抓漏。 两个模型犯的错误不重叠,A 漏掉的问题 B 大概率会指出来。
- 成本门槛归零。 独立审查以前很贵,要再付一份高端模型的钱;V4 Flash 的价格让"每次提交都审"成为默认动作。
- 社区已经在这么干。 Theo 的
claude -p第二意见、Reddit 的双模型互审、"别锁死单一供应商"的共识——独立第三方不是我的发明,是 2026 年圈子的共同答案。
实操建议
今天就能做的: 给写代码的 agent 立一条规矩——收工前让它执行 dsh(或任何别的模型)审一遍再交付。
本周可以做的: 把 CR 分级定下来:小改动 pi、大 PR omp、高频批量 dsh;写代码固定用 Claude Code / Codex / Qoder / Cursor 之一。
长期养成的习惯: 固定"写代码 X + 审代码 Y,X ≠ Y"的组合。哪个模型强不重要,重要的是有人看着。
最后说一句
工具没有最好,只有最合适。2026 年的正确姿势不是"选一个赢家",而是搭一个矩阵:让每个工具做它最擅长的事,再用一个便宜、快速、独立的第三方兜住质量。
模型再强,干活也要有监督——而且最好是独立第三方。
评论
还没有评论。成为第一个评论的人!
相关工具
相关文章
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。
如何审查 AI 生成的代码?Claude Code 作者的 3 个实战经验
AI 写代码很快,但你真的敢直接用吗?Claude Code 作者 Boris 分享了 3 个经过验证的代码审查技巧,帮你在效率和质量之间找到平衡点。
Cursor vs GitHub Copilot: 2026 完整对比
深入对比 Cursor 和 GitHub Copilot。通过详细的功能分析、定价和实际测试,发现哪个 AI 编程助手最适合你的工作流程。