Claude Opus 5 logo

Claude Opus 5

打开

Anthropic 前沿 Opus 级模型,1M token 上下文与可调思考强度,以 Opus 4.8 的价格带来接近 Fable 5 的智能水平,适合智能体与长周期编码任务。

分享:

Claude Opus 5 于 2026 年 7 月 24 日发布,是 Anthropic 目前最强的 Opus 级模型,也是严肃工程场景下的主力之选。它配备 1M token 上下文窗口、默认开启的思考模式,以及从 low 到 max 共五档"努力程度"设置,让开发者可以在 token 消耗与智能水平之间自由权衡。定价与 Opus 4.8 持平(每百万 token 输入 $5 / 输出 $25),但在编码、智能体与知识工作基准上已达到接近贵得多的 Claude Fable 5 的水平。

核心功能

  • 可调思考强度:五档设置(low、medium、high、xhigh、max),默认开启思考;实际使用中 xhigh 往往用更少的输出 token 达到与 max 相当甚至更好的效果。
  • 1M token 上下文:默认即最大窗口,长上下文内指令遵循、工具调用与推理表现稳定。
  • 128K 最大输出:足以支撑长智能体对话与多文件代码生成。
  • Fast 模式:研究预览功能,约 2.5 倍速输出,价格为基准价 2 倍($10/$50 每百万 token),目前仅限 Claude API。
  • 误拒大幅减少:相比早期 Claude 版本,误报安全干预减少约 85%。
  • 广泛可用:Claude API、Pro/Max/Team/Enterprise,以及 Amazon Bedrock、Google Cloud、Microsoft Foundry。

基准亮点

  • Artificial Analysis 智能指数:max 档 61 分,与 Claude Fable 5(60)基本持平,超过 GPT-5.6 Sol(59)与 Kimi K3(57)。
  • Frontier-Bench v0.1:全面领先其他模型,以更低单任务成本达到 Opus 4.8 两倍以上的成绩。
  • CursorBench 3.2:以一半的单任务成本达到 Fable 5 峰值成绩的 99.5%。
  • ARC-AGI 3:在全新推理问题上得分是次优模型的 3 倍。
  • IMO 2026:零样本、自包含证明满分 42/42。
  • GDPval-AA v2 / AA-Briefcase:智能体知识工作新榜首(1861 Elo),领先 Fable 5 与 GPT-5.6 Sol 100 分以上。

适用场景

  • 自主编码智能体:Claude Code、Cursor 中需要自我验证与长时间工程循环的工作流。
  • 深度知识工作:研究、文档综合与专业交付物,模型会自行检查成果。
  • 计算机操作:OSWorld 2.0 与 Zapier AutomationBench 领先,适合端到端自动化。

已知取舍

硬任务上速度偏慢(最难的智能体任务需要 25-36 分钟),且新分词器会把同样代码切成多约 30-47% 的 token,长会话若不使用提示缓存会明显推高成本。部分开发者还发现"max 努力陷阱":一味拉满反而会过度思考、重写已正确的代码,xhigh 往往更划算。面对不确定的事实,模型仍可能自信地编造答案,独立评测显示其未知事实下的幻觉率偏高,重要结论仍需人工核实。

快速开始

通过 Claude API 调用 claude-opus-5,或在 Claude 应用、Cursor、Claude Code 中选择该模型。日常交互建议从 medium 或 xhigh 起步,把 max 留给高风险的自主任务。

替代方案

  • Claude Fable 5:不差钱时的最强选择。
  • GPT-5.6 Sol:OpenAI 更易用的日常主力,推理风格不同。
  • Kimi K3:开源权重 2.8T 模型,智能体成绩接近,API 价格低得多。

总结

Claude Opus 5 是 Claude 产品线中性价比最高的一档:接近前沿的智能,工作马车型的价格。只要你在 Claude 生态里做智能体或严肃编码,又不愿为 Fable 5 买单,它就是你该先试的模型。

评论

还没有评论。成为第一个评论的人!