AREX-2
AREX-2 是北京智源人工智能研究院发布的 27B 参数智能体模型,2026-09-29 在 Hugging Face 开放权重。模型卡片把它描述为长时程智能体模型:在多次测试时推理轮次中学习改进方案,典型循环是提出、度量、反思和修订。它基于兼容 Qwen3.8 的稠密多模态底座,使用 Apache-2.0,支持 262,144 token 上下文。训练聚焦带有可验证反馈的机器学习和算法编程任务,学到的自我改进行为也会迁移到深度研究。
关键特性
- 长时程自我改进:把额外的测试时轮次用于精炼方案,而不是把迭代当成纯成本。
- 反馈驱动反思:读取分数、日志、错误和时间信息来决定下一步修改。
- 跨领域迁移:编码和机器学习训练也能改善深度研究表现,不需要新增搜索轨迹。
- 27B 稠密多模态架构:文本和图像输入,支持 262,144 token 上下文。
- 开放许可与权重:Apache-2.0 权重直接在 Hugging Face 下载。
适用场景
谁应该使用这个工具?
- 研究者:适合研究长时程智能体循环和自我改进。
- 机器学习工程师:27B 规模可以在单台工作站上承载,与更大的智能体相比部署成本更低。
- 深度研究集成者:需要文本加图像输入、长上下文和迭代推理的团队。
解决的问题
- 长任务地平线:许多模型在轮次增加后质量下降;AREX-2 被训练成持续有效改进。
- 可验证的编码和 机器学习工作:可以把日志、分数和错误当作反馈信号。
- 大型闭源智能体的成本:27B 开源权重可以自托管,避免部分场景的 API token 成本。
定价方案
| 方案 | 价格 | 功能 |
|---|---|---|
| 开源权重 | 软件 $0 | Hugging Face 上的 Apache-2.0 checkpoint;计算和托管费用自理。 |
优势对比
相比竞品:27B 远小于前沿 API 智能体,但项目定位专门针对长时程迭代和深度研究,而不是通用聊天。
独特卖点:模型卡在自有评估协议中报告了 Frontier-CS、MLE-Lite、BrowseComp、GAIA 和 DeepSearchQA 上的较强结果。这些是项目自报数字,应视为厂商声明,而不是独立评测。
快速开始
- 安装支持 Qwen3.8 的最新 Transformers。
- 用
AutoModelForMultimodalLM和AutoProcessor以 bfloat16 加载BAAI/AREX-2。 - 输入提示,要求先提出方案并解释如何多轮改进。
- 由于 27B bfloat16 需要明显显存,请准备 GPU 或多卡环境。
集成
- Hugging Face 获取权重。
- Python Transformers 推理。
- Qwen3.8 兼容 tokenizer 和 processor。
常见问题
AREX-2 开源吗?
权重在 Hugging Face 上是 Apache-2.0,项目同时链接了公开 GitHub。
上下文多大?
模型卡片写的是 262,144 token。
支持图像输入吗?
支持。卡片把它列为稠密的 Qwen3.8 兼容多模态模型。
基准数字独立吗?
不独立。模型卡表格是项目自己的评测,应视为一手声明。
替代方案
如果 AREX-2 不合适,可以看这些:
- Qwen3.8-Max:更大规模、多模态输入的开源权重旗舰。
- DeepSeek-V4-Flash:如果本地编码任务更需要经过广泛验证的轻量模型家族。
- MiniMax H3:当你需要其他生产级规模、能力更广的模型时考虑。
使用技巧
- 在能提供定量反馈的任务上测试,AREX-2 的优势是迭代精炼。
- 仔细规划显存:27B bfloat16 需要相当大的显存。
- 把模型卡评测当作方向性证据,在选型前运行你自己的基准。
总结
AREX-2 是一个聚焦于「多轮改进方案」的开源权重模型。它面向研究型团队,希望在没有闭源前沿服务的情况下获得长上下文智能体推理。投入生产前请确认当前推理要求和基准协议。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。