Spark-X2.5-4B は、XHToken(SparkLLM / TokenSpark チーム)によるコンパクトなオープンウェイト汎用言語モデルで、2026 年 8 月 31 日に Apache 2.0 で Hugging Face に公開されました。4B と 1.7B のペア構成のうちの 4B 主力です。売りは効率性で、全注意機構と滑り窓注意機構を組み合わせたハイブリッド設計により、長コンテキストモデルにありがちな計算コストを抑えつつ、ネイティブ 1M トークンのコンテキスト窓を実現します。実際にローカルで動かせるエージェント向けモデルを探す人には注目に値します。
より大きな稠密オープンウェイトの Qwen3.8-27B、中国系オープンウェイトの高速モデル GLM-5.3-Flash、組み合わせるオープンソースエージェント OpenCode と比較してください。
モデル仕様
| 仕様 | Spark-X2.5-4B |
|---|---|
| 総パラメータ | 約 4B |
| シリーズ | Spark-X2.5-4B、Spark-X2.5-1.7B |
| アーキテクチャ | ハイブリッド注意(ブロック毎に 1 つ全注意+3 つ滑り窓注意) |
| コンテキスト窓 | 最大 1M トークン(ネイティブ) |
| 言語 | 中英+200 以上の言語 |
| ライセンス | Apache 2.0 |
| ベースモデル | XHToken/Spark-X2.5-4B-Base |
主な機能
- ネイティブ 1M コンテキスト:KV キャッシュを抑えたハイブリッド注意設計で、長文・ツール多用の会話にも追従。
- エージェント対応:Codex・Claude Code・OpenClaw・Hermes と深く統合し、同規模モデルの中でコーディング・エージェント・推論タスクで良好な結果。
- 広いデプロイ面:NVIDIA・Huawei・Hygon・HOUMO.AI 等のハードウェアに対応。vLLM・SGLang・llama.cpp・MLX と互換、Ollama・LM Studio で手軽に起動。
- オープンで微調整可能:Apache 2.0 と LLaMA-Factory 対応で、自己ホスト・カスタマイズ・商用利用が可能。
- 効率重視の学習:Huawei Ascend クラスタで学習し、大規模 RL と MOPD 後学習で推論・コーディング・指示従順性を強化。
使用シナリオ
このツールを使用すべき人は?
- ローカルファーストの開発者:コンシューマ GPU や Apple Silicon Mac で MLX により実行可能。
- エージェントビルダー:ツール呼び出しと長いコンテキストに追従できる、小型で高速なモデル。
- 多言語チーム:大規模オープンモデルをデプロイせずに多言語をカバー。
解決する問題
- 長コンテキストのコスト:注意のハイブリッド設計が、コンテキスト圧縮を強いられるメモリ・レイテンシの負荷を削減。
- 自己ホスティングの制約:コンパクトなサイズと広いフレームワーク対応で、控えめなハードウェアでも実用的。
- 商用デプロイ:Apache 2.0 がカスタムビルド公開のライセンス障壁を除去。
料金
Spark-X2.5-4B は Apache 2.0 で無料オープンソース。費用は自分で動かすハードウェアまたはクラウド推論のみ。執筆時点で XHToken の公式ホスト API 価格は未発表です。
はじめに
- ウェイトを取得:Hugging Face から
XHToken/Spark-X2.5-4B(または 1.7B)を取得。 - ローカル実行:llama.cpp・MLX・vLLM で読み込むか、Ollama・LM Studio でワンクリック起動。
- エージェントに接続:Codex・Claude Code・OpenClaw・Hermes をローカルエンドポイントへ向ける。
- 必要なら微調整:LLaMA-Factory で自分の領域に適応。
よくある質問
推論モデルですか?
推論・コーディング・指示従順性を強調し、強化学習でチューニング。ただし Anthropic 式の常時思考を謳うものではありません。
商用利用できますか?
はい、Apache 2.0 がその権利を認めています。
1M コンテキストをどう扱いますか?
全 1M トークンに全注意コストを払うのではなく、全注意層と滑り窓層を交互に使い、計算とメモリを制御可能にしています。
代替案
- Qwen3.8-27B:より容量の大きい 27B Apache 2.0 モデル。
- GLM-5.3-Flash:Zhipu の無料/高速モデル。
- OpenCode:ローカルモデルと組めるオープンソースエージェントランタイム。
ヒントとベストプラクティス
- ハードウェアに合わせてサイズ選び:小さい GPU なら 1.7B から、より強力な処理が必要なら 4B へ。
- ハイブリッドコンテキストを活用:長いセッションや多段のツール呼び出しが最も効果を発揮する場面。
- 公開前にライセンス確認:微調整とホスティング計画が Apache 2.0 の範囲内か確認。
まとめ
Spark-X2.5-4B は、長コンテキストのコスト問題をハイブリッド注意設計で解決し、コーディング・エージェント性能に優れ、Apache 2.0 で自由に使える、作り込みの良いコンパクトなオープンウェイトモデルです。ローカルでエージェント対応・低コスト・商用可のモデルを求める人には有力な候補です。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek のフラッグシップ 1.6T MoE モデル。活性化パラメータ 49B、1M トークンのコンテキスト、MIT ライセンスのオープンウェイトを備え、世界トップのコーディングスコアをクローズドモデルのごく一部の価格で実現。
Ling-3.0-flash
huggingface.co/inclusionAI/Ling-3.0-flash
inclusionAI の MIT ハイブリッド線形 MoE。総パラメータ 124B、活性化 5.1B。2026-08-21 に Hugging Face で再確認。
NVIDIA Nemotron 3.5 Lightning 30B A3B
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b
NVIDIA の効率的なオープンウェイトモデル。総パラメータ 30B で活性化はわずか 3B。MoE ハイブリッド構成、最大 1M トークンのコンテキスト、単一 GPU 展開でローカル推論とポストトレーニング研究に対応。
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。