GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 的智能指数上,Claude Fable 5.1(max effort 档)拿到 66 分,GPT-6 Astra 61 分。编程智能体指数(Coding Agent Index)里,Fable 5.1 跑在 Claude Code 里是 70,Astra 跑在 Codex 里是 67。人类终极考试(HLE)和智能体科学任务,Fable 依然领先。
按这几张榜,「Astra 追上 Fable 了」这句话不成立。五分之差不算大,但方向很清楚:这一代 Astra 仍是追赶者,不是反超者。
分数没变,账单变了
真正变了的是账单。用同一套测试任务算完成成本,Astra 均摊下来约 $1.67,Fable 5.1 约 $3.70——不到对方一半。两家挂牌价其实一样,每百万 token 输入 $10、输出 $50,分毫不差,你在任何一家的定价页上都看不出区别。
差距不在标价,在用量。同一套测试里,Astra 花掉的 token 大约是 GPT-5.6 Sol 的三分之一,是 Claude Opus 5(xhigh 档)的五分之一。同样一道题,Astra 想得更短,答得更省。省的是过程,不是单价——这也是为什么两边标价一样、账单却能差出一倍多。对按量付费的团队,这直接体现在月度账单上,而不是需要等到下一次采购谈判才看得见。
缓存是那个例外
这里有个反例,别被「Astra 更便宜」这句话带偏。Fable 5.1 的缓存读取价是每百万 token $0.25,Astra 是 $1.00,贵了四倍。如果你的 agent 循环大量复用上下文——检索管线反复带同一批文档、长对话反复带同一批工具定义和系统提示——缓存命中率一高,Fable 5.1 算下来可能反而更省,即便它单次任务的完成成本更高。谁更便宜取决于负载,不是通杀。
限流比 Astra 早了半年
再看时间线。Anthropic 从今年 3 月就开始收紧 Claude 的用量:工作日高峰(太平洋时间 5 点到 11 点)的 5 小时用量上限被下调,3 月 31 日官方也承认用户比预期更快撞到上限。/limit-reset 这个功能拖到 9 月 3 日才上线。9 月 14 日,Claude Code 周度用量此前临时上调的 50%,会降回永久性的 25%——对大多数付费用户来说,算下来比今天还要少大约 17% 的额度。GPT-6 Astra 是 9 月 4 日发布的。
顺序摆在这儿:收紧比 Astra 早了差不多六个月,/limit-reset 甚至是紧贴着 Astra 发布日期上线的,容易让人把两件事看成一件事。但因果不是这么排的。这几周你觉得 Claude 变紧了,这个感觉是真的,但它跟 Astra 没关系,时间对不上。
我的读法是,这两件事表面不相关,底下是同一个约束在两头露头:推理成本。GPT-6 Astra 把成本优势做成了产品卖点——同一份工作,靠 token 效率把价格打下来,让买家看见。Anthropic 把成本压力做成了限流——用量上限、周度配额,是配给,不是对 Astra 的反应。竞争的轴从「谁更聪明」挪到了「同一件事谁做得更便宜」,两家都在跟这道题较劲,只是一个在秀效率给外部看,一个在给内部配给容量。
说清楚我不知道什么:Anthropic 有没有说过收紧的原因是算力紧张,我没看到这样的官方表态,公开的只是限额下调的节点和幅度。把「配给」当成因,还是当成另一件事的果,我没有第一手证据能替你拍板,这一段是我的读法,不是核实过的事实链条。
一个开发者的旁证
一个值得记的旁证:Theo(t3.gg)早期测试 Astra 后的结论是,Claude Code 给 OpenAI 自家模型当宿主,效果比 Codex 自己的壳更好;他也说 Astra 的「Ultra」推理档位有明显问题。这是他的测评意见,不是官方数据,我照原样转述,不替他加权威性。另有开发者反映 Claude Code 近期会兜圈子、前后矛盾、丢上下文——同样是一手报告,我没有验证过基准,摆在这里仅供参考,不当作结论使用。
怎么选,看你的负载
Claude Fable 5.1 没被超过:两张榜都还在它手里,缓存读取也比对方便宜四倍。但 Astra 把「完成一个任务要花多少钱」变成了新的入场券。如果你的工作负载是短平快的一次性任务、上下文很少复用,按 Artificial Analysis 这份成本表,Astra 目前更划算。如果你的负载是长循环、agent 反复调用同一批工具和文档,先量一下自己场景里的缓存命中率,再拿 $0.25 和 $1.00 这两个数去算,别直接照抄表里的均摊成本——那份成本表算的是单次任务,不是你的循环。
「Claude 变紧了」和「Astra 变便宜了」都是真的,只是它们不是同一句话的两半。前者是从 3 月就开始的配给,后者是刚交出来的效率答卷,只是最新一轮限流公告和 Astra 发布挤在了同一个 9 月,才让人误以为是一件事的两面。
评论
还没有评论。成为第一个评论的人!
相关工具
GPT-6 Astra
openai.com/index/gpt-6-astra
OpenAI 旗舰 GPT-6 Astra:105 万 token 上下文,电脑操作与编程达新高,API 每 1M token $10/$50。
Claude Academy
academy.claude.com
Anthropic 官方免费学习平台:300+ 课程覆盖 Claude.ai、Cowork、Claude Code、Tag 与 Platform API,并配有 AI Fluency 素养体系。
MCP Framework
mcp-framework.com
用来写 MCP 服务器的 TypeScript 套件。
相关文章

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。
Cursor vs GitHub Copilot: 2026 完整对比
深入对比 Cursor 和 GitHub Copilot。通过详细的功能分析、定价和实际测试,发现哪个 AI 编程助手最适合你的工作流程。