AREX-2 logo

AREX-2

打开

北京智源研究院 27B 开源权重智能体模型:在编码、机器学习工程与深度研究任务中迭代改进方案,支持 262K 上下文。

分享:
查看替代方案

AREX-2

AREX-2 是北京智源人工智能研究院发布的 27B 参数智能体模型,2026-09-29 在 Hugging Face 开放权重。模型卡片把它描述为长时程智能体模型:在多次测试时推理轮次中学习改进方案,典型循环是提出、度量、反思和修订。它基于兼容 Qwen3.8 的稠密多模态底座,使用 Apache-2.0,支持 262,144 token 上下文。训练聚焦带有可验证反馈的机器学习和算法编程任务,学到的自我改进行为也会迁移到深度研究。

关键特性

  • 长时程自我改进:把额外的测试时轮次用于精炼方案,而不是把迭代当成纯成本。
  • 反馈驱动反思:读取分数、日志、错误和时间信息来决定下一步修改。
  • 跨领域迁移:编码和机器学习训练也能改善深度研究表现,不需要新增搜索轨迹。
  • 27B 稠密多模态架构:文本和图像输入,支持 262,144 token 上下文。
  • 开放许可与权重:Apache-2.0 权重直接在 Hugging Face 下载。

适用场景

谁应该使用这个工具?

  • 研究者:适合研究长时程智能体循环和自我改进。
  • 机器学习工程师:27B 规模可以在单台工作站上承载,与更大的智能体相比部署成本更低。
  • 深度研究集成者:需要文本加图像输入、长上下文和迭代推理的团队。

解决的问题

  1. 长任务地平线:许多模型在轮次增加后质量下降;AREX-2 被训练成持续有效改进。
  2. 可验证的编码和 机器学习工作:可以把日志、分数和错误当作反馈信号。
  3. 大型闭源智能体的成本:27B 开源权重可以自托管,避免部分场景的 API token 成本。

定价方案

方案 价格 功能
开源权重 软件 $0 Hugging Face 上的 Apache-2.0 checkpoint;计算和托管费用自理。

优势对比

相比竞品:27B 远小于前沿 API 智能体,但项目定位专门针对长时程迭代和深度研究,而不是通用聊天。

独特卖点:模型卡在自有评估协议中报告了 Frontier-CS、MLE-Lite、BrowseComp、GAIA 和 DeepSearchQA 上的较强结果。这些是项目自报数字,应视为厂商声明,而不是独立评测。

快速开始

  1. 安装支持 Qwen3.8 的最新 Transformers。
  2. 用 AutoModelForMultimodalLM 和 AutoProcessor 以 bfloat16 加载 BAAI/AREX-2。
  3. 输入提示,要求先提出方案并解释如何多轮改进。
  4. 由于 27B bfloat16 需要明显显存,请准备 GPU 或多卡环境。

集成

  • Hugging Face 获取权重。
  • Python Transformers 推理。
  • Qwen3.8 兼容 tokenizer 和 processor。

常见问题

AREX-2 开源吗?

权重在 Hugging Face 上是 Apache-2.0,项目同时链接了公开 GitHub。

上下文多大?

模型卡片写的是 262,144 token。

支持图像输入吗?

支持。卡片把它列为稠密的 Qwen3.8 兼容多模态模型。

基准数字独立吗?

不独立。模型卡表格是项目自己的评测,应视为一手声明。

替代方案

如果 AREX-2 不合适,可以看这些:

  • Qwen3.8-Max:更大规模、多模态输入的开源权重旗舰。
  • DeepSeek-V4-Flash:如果本地编码任务更需要经过广泛验证的轻量模型家族。
  • MiniMax H3:当你需要其他生产级规模、能力更广的模型时考虑。

使用技巧

  1. 在能提供定量反馈的任务上测试,AREX-2 的优势是迭代精炼。
  2. 仔细规划显存:27B bfloat16 需要相当大的显存。
  3. 把模型卡评测当作方向性证据,在选型前运行你自己的基准。

总结

AREX-2 是一个聚焦于「多轮改进方案」的开源权重模型。它面向研究型团队,希望在没有闭源前沿服务的情况下获得长上下文智能体推理。投入生产前请确认当前推理要求和基准协议。

评论

还没有评论。成为第一个评论的人!