Spark-X2.5-4B 是 XHToken(SparkLLM / TokenSpark 团队)推出的一款精简开源权重通用语言模型,2026 年 8 月 31 日以 Apache 2.0 协议上架 Hugging Face。它是「4B + 1.7B」这一对中的 4B 主力。卖点在于效率:混合注意力设计把全注意力与滑窗注意力结合,实现了原生 1M 上下文窗口,却不用付出长上下文模型通常的高昂计算成本。对于想要真正能在本地跑起来、又对 Agent 友好的模型的人来说,值得仔细看看。
可对比 Qwen3.8-27B(/items/models/qwen3-8-27b)作为更大的稠密开源选项,GLM-5.3-Flash(/items/models/glm-5-3-flash)作为中文开源快速模型,或 OpenCode(/items/dev-tools/opencode)作为搭配的开源 Agent 框架。
模型规格
| 规格 | Spark-X2.5-4B |
|---|---|
| 总参数 | 约 4B |
| 同系列 | Spark-X2.5-4B、Spark-X2.5-1.7B |
| 架构 | 混合注意力(每块 1 全注意力 + 3 滑窗注意力) |
| 上下文窗口 | 最高 1M tokens(原生) |
| 语言 | 中英 + 200 多种语言 |
| 协议 | Apache 2.0 |
| 基础模型 | XHToken/Spark-X2.5-4B-Base |
核心功能
- 原生 1M 上下文:因为混合注意力设计,KV 缓存保持较小,却仍能跟随长文本、重工具调用。
- 面向 Agent:模型深度集成了 Codex、Claude Code、OpenClaw、Hermes 等主流 Agent 框架,在相近体量模型里编码、Agent、推理任务表现出色。
- 广泛部署面:可跑在 NVIDIA、华为、Hygon、HOUMO.AI 等硬件上;兼容 vLLM、SGLang、llama.cpp、MLX,也可经 Ollama 与 LM Studio 快速启动。
- 开放可微调:Apache 2.0 + LLaMA-Factory 支持,可自托管、定制并商用。
- 面向效率的训练:在华为昇腾集群上训练,采用大规模 RL 与 MOPD 后训练,强化推理、编码与指令跟随。
适用场景
谁应该使用这个工具?
- 本地优先的开发者:4B 模型可在消费级 GPU 或 Apple Silicon Mac 上通过 MLX 运行。
- Agent 构建者:一个又小又快、却仍能跟随工具调用与长上下文的模型。
- 多语种团队:无需部署大体量开源模型即可覆盖多语言。
解决的问题
- 长上下文成本:混合注意力设计减少通常迫使团队裁剪上下文的记忆与延迟开销。
- 自托管限制:体量紧凑 + 广泛框架支持,让它在中等硬件上也实用。
- 商用部署:Apache 2.0 消除了自构建上线的许可摩擦。
定价
Spark-X2.5-4B 在 Apache 2.0 下免费开源。你只需承担自行运行的硬件或云推理成本;截至本文,XHToken 未公布官方托管 API 定价。
快速开始
- 下载权重:从 Hugging Face 拉取
XHToken/Spark-X2.5-4B(或更小的 1.7B)。 - 本地运行:用 llama.cpp、MLX 或 vLLM 加载,或通过 Ollama、LM Studio 一键启动。
- 接入 Agent 框架:把 Codex、Claude Code、OpenClaw 或 Hermes 指向你的本地端点。
- 按需微调:用 LLaMA-Factory 适配到你的领域。
常见问题
它是推理模型吗?
它强调推理、编码与指令跟随能力,并用强化学习调校,但并未宣称具有 Anthropic 式常开思考。
能商用吗?
可以,Apache 2.0 已授予该权利。
它如何处理 1M 上下文?
它不会在全部 1M token 上都付出全注意力成本,而是交替使用全注意力与滑窗层,让计算与内存变得可控。
替代方案
- Qwen3.8-27B(/items/models/qwen3-8-27b):更大的 27B Apache 2.0 模型,容量更高。
- GLM-5.3-Flash(/items/models/glm-5-3-flash):智谱的免费/快速模型。
- OpenCode(/items/dev-tools/opencode):可搭配本地模型的开源 Agent 运行时。
使用技巧
- 按硬件选体量:小 GPU 上先从 1.7B 开始,需要更强能力再上 4B。
- 善用混合上下文:长会话与多轮工具调用正是注意力混合发挥优势之处。
- 上线前核对许可:确认你的微调与托管方案处于 Apache 2.0 范围内。
总结
Spark-X2.5-4B 是一个工程扎实、体量紧凑的开源权重模型,用混合注意力设计解决了长上下文成本问题,在编码与 Agent 上表现出色,并在 Apache 2.0 下保持自由使用。对于想要一个本地、Agent 就绪、运行便宜且合规可上线的模型的人来说,它是很强的候选。
评论
还没有评论。成为第一个评论的人!
相关工具
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。
Ling-3.0-flash
huggingface.co/inclusionAI/Ling-3.0-flash
inclusionAI 的 MIT 混合线性 MoE:总参 124B,激活 5.1B。2026-08-21 在 Hugging Face 复核。
NVIDIA Nemotron 3.5 Lightning 30B A3B
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b
NVIDIA 高效开源权重模型,30B 总参数仅激活 3B,MoE 混合架构,最长 1M token 上下文,单卡部署,适合本地推理、编码与后训练研究。
相关洞察

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。