Spark-X2.5-4B logo

Spark-X2.5-4B

開く

XHToken の効率的な 4B オープンウェイトモデル。ハイブリッド滑り窓注意機構でネイティブ 1M コンテキストを実現。コーディング・エージェント性能が高く、Apache 2.0、多言語。

共有:
代替ツールを見る

Spark-X2.5-4B は、XHToken(SparkLLM / TokenSpark チーム)によるコンパクトなオープンウェイト汎用言語モデルで、2026 年 8 月 31 日に Apache 2.0 で Hugging Face に公開されました。4B と 1.7B のペア構成のうちの 4B 主力です。売りは効率性で、全注意機構と滑り窓注意機構を組み合わせたハイブリッド設計により、長コンテキストモデルにありがちな計算コストを抑えつつ、ネイティブ 1M トークンのコンテキスト窓を実現します。実際にローカルで動かせるエージェント向けモデルを探す人には注目に値します。

より大きな稠密オープンウェイトの Qwen3.8-27B、中国系オープンウェイトの高速モデル GLM-5.3-Flash、組み合わせるオープンソースエージェント OpenCode と比較してください。

モデル仕様

仕様 Spark-X2.5-4B
総パラメータ 約 4B
シリーズ Spark-X2.5-4B、Spark-X2.5-1.7B
アーキテクチャ ハイブリッド注意(ブロック毎に 1 つ全注意+3 つ滑り窓注意)
コンテキスト窓 最大 1M トークン(ネイティブ)
言語 中英+200 以上の言語
ライセンス Apache 2.0
ベースモデル XHToken/Spark-X2.5-4B-Base

主な機能

  • ネイティブ 1M コンテキスト:KV キャッシュを抑えたハイブリッド注意設計で、長文・ツール多用の会話にも追従。
  • エージェント対応:Codex・Claude Code・OpenClaw・Hermes と深く統合し、同規模モデルの中でコーディング・エージェント・推論タスクで良好な結果。
  • 広いデプロイ面:NVIDIA・Huawei・Hygon・HOUMO.AI 等のハードウェアに対応。vLLM・SGLang・llama.cpp・MLX と互換、Ollama・LM Studio で手軽に起動。
  • オープンで微調整可能:Apache 2.0 と LLaMA-Factory 対応で、自己ホスト・カスタマイズ・商用利用が可能。
  • 効率重視の学習:Huawei Ascend クラスタで学習し、大規模 RL と MOPD 後学習で推論・コーディング・指示従順性を強化。

使用シナリオ

このツールを使用すべき人は?

  • ローカルファーストの開発者:コンシューマ GPU や Apple Silicon Mac で MLX により実行可能。
  • エージェントビルダー:ツール呼び出しと長いコンテキストに追従できる、小型で高速なモデル。
  • 多言語チーム:大規模オープンモデルをデプロイせずに多言語をカバー。

解決する問題

  1. 長コンテキストのコスト:注意のハイブリッド設計が、コンテキスト圧縮を強いられるメモリ・レイテンシの負荷を削減。
  2. 自己ホスティングの制約:コンパクトなサイズと広いフレームワーク対応で、控えめなハードウェアでも実用的。
  3. 商用デプロイ:Apache 2.0 がカスタムビルド公開のライセンス障壁を除去。

料金

Spark-X2.5-4B は Apache 2.0 で無料オープンソース。費用は自分で動かすハードウェアまたはクラウド推論のみ。執筆時点で XHToken の公式ホスト API 価格は未発表です。

はじめに

  1. ウェイトを取得:Hugging Face から XHToken/Spark-X2.5-4B(または 1.7B)を取得。
  2. ローカル実行:llama.cpp・MLX・vLLM で読み込むか、Ollama・LM Studio でワンクリック起動。
  3. エージェントに接続:Codex・Claude Code・OpenClaw・Hermes をローカルエンドポイントへ向ける。
  4. 必要なら微調整:LLaMA-Factory で自分の領域に適応。

よくある質問

推論モデルですか?

推論・コーディング・指示従順性を強調し、強化学習でチューニング。ただし Anthropic 式の常時思考を謳うものではありません。

商用利用できますか?

はい、Apache 2.0 がその権利を認めています。

1M コンテキストをどう扱いますか?

全 1M トークンに全注意コストを払うのではなく、全注意層と滑り窓層を交互に使い、計算とメモリを制御可能にしています。

代替案

  • Qwen3.8-27B:より容量の大きい 27B Apache 2.0 モデル。
  • GLM-5.3-Flash:Zhipu の無料/高速モデル。
  • OpenCode:ローカルモデルと組めるオープンソースエージェントランタイム。

ヒントとベストプラクティス

  1. ハードウェアに合わせてサイズ選び:小さい GPU なら 1.7B から、より強力な処理が必要なら 4B へ。
  2. ハイブリッドコンテキストを活用:長いセッションや多段のツール呼び出しが最も効果を発揮する場面。
  3. 公開前にライセンス確認:微調整とホスティング計画が Apache 2.0 の範囲内か確認。

まとめ

Spark-X2.5-4B は、長コンテキストのコスト問題をハイブリッド注意設計で解決し、コーディング・エージェント性能に優れ、Apache 2.0 で自由に使える、作り込みの良いコンパクトなオープンウェイトモデルです。ローカルでエージェント対応・低コスト・商用可のモデルを求める人には有力な候補です。

コメント

まだコメントがありません。最初のコメントを投稿してください!