AREX-2 logo

AREX-2

開く

BAAI の 27B オープンウェイト エージェントモデル。コーディング・ML エンジニアリング・ディープリサーチで提案・測定・反省・改訂を繰り返す、262K コンテキスト。

共有:
代替ツールを見る

AREX-2

AREX-2 は、北京智源人工知能研究院(BAAI)が 2026-09-29 に Hugging Face で公開した 27B パラメータのエージェントモデルです。長期的なエージェントモデルとして、テスト時に複数ラウンドで解決策を改善することを学習しており、典型的なループは「提案・測定・反省・改訂」です。Qwen3.8 互換の dense マルチモーダル基盤で、Apache-2.0、コンテキスト 262,144 トークンです。検証可能なフィードバックを持つ機械学習とアルゴリズムプログラミングタスク向けに訓練され、ディープリサーチにも転移します。

主な機能

  • 長期的自己改善: 追加のテスト時ラウンドを解決策の洗練に使います。
  • フィードバック駆動の反省: スコア、ログ、エラー、時間情報を読んで次に何を変えるか判断します。
  • 領域間転移: コーディングと機械学習の訓練が、新しい検索軌跡なしにディープリサーチを改善します。
  • 27B dense マルチモーダル: テキストと画像入力、262,144 トークンのコンテキスト。
  • オープンライセンスとウェイト: Hugging Face で Apache-2.0 のウェイトを直接取得できます。

使用シナリオ

このツールを使用すべき人は?

  • 研究者: 長期的エージェントループと自己改善の研究に有用なオープンウェイト。
  • ML エンジニア: 大規模エージェントより小さく、単一ワークステーションでも扱いやすい 27B モデル。
  • ディープリサーチ統合者: テキスト+画像入力、長いコンテキスト、反復推論が必要なチーム。

解決する問題

  1. 長いタスク展望: ラウンド数が増えると性能が落ちやすいモデルが多い中、AREX-2 は生産的な洗練を維持するよう訓練されています。
  2. 検証可能なコーディング・ML 作業: ログ、スコア、エラーをフィードバック信号として扱えます。
  3. 大きな閉域エージェントのコスト: 27B オープンウェイトはセルフホストでき、一部ワークロードの API コストを避けられます。

料金プラン

プラン 価格 機能
オープンウェイト ソフトウェア $0 Hugging Face の Apache-2.0 チェックポイント。計算とホスティングは自己負担。

優位性と独自の価値提案

競合と比較した優位性: 27B はフロンティア API よりはるかに小さく、汎用チャットではなく長期的反復とディープリサーチ向けに位置づけられています。

際立つポイント: 公開モデルカードは Frontier-CS、MLE-Lite、BrowseComp、GAIA、DeepSearchQA で強い結果を報告しています。これらはプロジェクト自身の評価であり、独立監査ではありません。

はじめに

  1. Qwen3.8 に対応した最新の Transformers をインストールします。
  2. AutoModelForMultimodalLM と AutoProcessor で BAAI/AREX-2 を bfloat16 で読み込みます。
  3. 解決策案と複数ラウンドの改善方法を説明させるプロンプトを送ります。
  4. 27B bfloat16 には十分な VRAM が必要なので、GPU またはマルチ GPU を用意します。

統合

  • Hugging Face のウェイト。
  • Python Transformers での推論。
  • Qwen3.8 互換トークナイザーとプロセッサー。

よくある質問

AREX-2 はオープンソースですか?

ウェイトは Hugging Face で Apache-2.0、プロジェクトは公開 GitHub ページをリンクしています。

コンテキスト長は?

モデルカードによると 262,144 トークンです。

画像入力はできますか?

できます。Qwen3.8 互換の dense マルチモーダルモデルとされています。

ベンチマークは独立ですか?

いいえ。モデルカードの表はプロジェクト自身の評価であり、第一当事者の主張として扱うべきです。

代替案

AREX-2 が適さない場合、以下を検討してください:

  • Qwen3.8-Max: より大きいオープンウェイト旗艦でマルチモーダル入力と広い利用性。
  • DeepSeek-V4-Flash: ローカルコーディングで検証済みの検証が多い軽量モデル。
  • MiniMax H3: 別の生産グレード規模、より広い能力を持つモデルが必要な場合。

ヒントとベストプラクティス

  1. 定量的フィードバックを与えられるタスクでテストします。AREX-2 の強みは反復的洗練です。
  2. VRAM を慎重に見積もります。27B bfloat16 はかなりの GPU メモリが必要です。
  3. モデルカードの評価は方向性の証拠とし、導入前に自作ベンチマークを実行します。

まとめ

AREX-2 は、複数ラウンドで解決策を改善するという特定の行動に焦点を当てたコンパクトなオープンウェイトモデルです。閉域フロンティアに支払わず長いコンテキストのエージェント推論を持つ研究志向チームに向きます。本番投入前に現在の推論要件とベンチマーク手順を確認してください。

コメント

まだコメントがありません。最初のコメントを投稿してください!