Spark-X2.5-4B 是 XHToken(SparkLLM / TokenSpark 团队)推出的一款精简开源权重通用语言模型,2026 年 8 月 31 日以 Apache 2.0 协议上架 Hugging Face。它是「4B + 1.7B」这一对中的 4B 主力。卖点在于效率:混合注意力设计把全注意力与滑窗注意力结合,实现了原生 1M 上下文窗口,却不用付出长上下文模型通常的高昂计算成本。对于想要真正能在本地跑起来、又对 Agent 友好的模型的人来说,值得仔细看看。
可对比 Qwen3.8-27B(/items/models/qwen3-8-27b)作为更大的稠密开源选项,GLM-5.3-Flash(/items/models/glm-5-3-flash)作为中文开源快速模型,或 OpenCode(/items/dev-tools/opencode)作为搭配的开源 Agent 框架。
模型规格
| 规格 | Spark-X2.5-4B |
|---|---|
| 总参数 | 约 4B |
| 同系列 | Spark-X2.5-4B、Spark-X2.5-1.7B |
| 架构 | 混合注意力(每块 1 全注意力 + 3 滑窗注意力) |
| 上下文窗口 | 最高 1M tokens(原生) |
| 语言 | 中英 + 200 多种语言 |
| 协议 | Apache 2.0 |
| 基础模型 | XHToken/Spark-X2.5-4B-Base |
核心功能
- 原生 1M 上下文:因为混合注意力设计,KV 缓存保持较小,却仍能跟随长文本、重工具调用。
- 面向 Agent:模型深度集成了 Codex、Claude Code、OpenClaw、Hermes 等主流 Agent 框架,在相近体量模型里编码、Agent、推理任务表现出色。
- 广泛部署面:可跑在 NVIDIA、华为、Hygon、HOUMO.AI 等硬件上;兼容 vLLM、SGLang、llama.cpp、MLX,也可经 Ollama 与 LM Studio 快速启动。
- 开放可微调:Apache 2.0 + LLaMA-Factory 支持,可自托管、定制并商用。
- 面向效率的训练:在华为昇腾集群上训练,采用大规模 RL 与 MOPD 后训练,强化推理、编码与指令跟随。
适用场景
谁应该使用这个工具?
- 本地优先的开发者:4B 模型可在消费级 GPU 或 Apple Silicon Mac 上通过 MLX 运行。
- Agent 构建者:一个又小又快、却仍能跟随工具调用与长上下文的模型。
- 多语种团队:无需部署大体量开源模型即可覆盖多语言。
解决的问题
- 长上下文成本:混合注意力设计减少通常迫使团队裁剪上下文的记忆与延迟开销。
- 自托管限制:体量紧凑 + 广泛框架支持,让它在中等硬件上也实用。
- 商用部署:Apache 2.0 消除了自构建上线的许可摩擦。
定价
Spark-X2.5-4B 在 Apache 2.0 下免费开源。你只需承担自行运行的硬件或云推理成本;截至本文,XHToken 未公布官方托管 API 定价。
快速开始
- 下载权重:从 Hugging Face 拉取
XHToken/Spark-X2.5-4B(或更小的 1.7B)。 - 本地运行:用 llama.cpp、MLX 或 vLLM 加载,或通过 Ollama、LM Studio 一键启动。
- 接入 Agent 框架:把 Codex、Claude Code、OpenClaw 或 Hermes 指向你的本地端点。
- 按需微调:用 LLaMA-Factory 适配到你的领域。
常见问题
它是推理模型吗?
它强调推理、编码与指令跟随能力,并用强化学习调校,但并未宣称具有 Anthropic 式常开思考。
能商用吗?
可以,Apache 2.0 已授予该权利。
它如何处理 1M 上下文?
它不会在全部 1M token 上都付出全注意力成本,而是交替使用全注意力与滑窗层,让计算与内存变得可控。
替代方案
- Qwen3.8-27B(/items/models/qwen3-8-27b):更大的 27B Apache 2.0 模型,容量更高。
- GLM-5.3-Flash(/items/models/glm-5-3-flash):智谱的免费/快速模型。
- OpenCode(/items/dev-tools/opencode):可搭配本地模型的开源 Agent 运行时。
使用技巧
- 按硬件选体量:小 GPU 上先从 1.7B 开始,需要更强能力再上 4B。
- 善用混合上下文:长会话与多轮工具调用正是注意力混合发挥优势之处。
- 上线前核对许可:确认你的微调与托管方案处于 Apache 2.0 范围内。
总结
Spark-X2.5-4B 是一个工程扎实、体量紧凑的开源权重模型,用混合注意力设计解决了长上下文成本问题,在编码与 Agent 上表现出色,并在 Apache 2.0 下保持自由使用。对于想要一个本地、Agent 就绪、运行便宜且合规可上线的模型的人来说,它是很强的候选。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。