Spark-X2.5-4B logo

Spark-X2.5-4B

打开

XHToken 出品的精简开源权重模型:混合滑窗注意力实现原生 1M 上下文,编码与 Agent 表现出色,Apache 2.0 协议,多语种。

分享:
查看替代方案

Spark-X2.5-4B 是 XHToken(SparkLLM / TokenSpark 团队)推出的一款精简开源权重通用语言模型,2026 年 8 月 31 日以 Apache 2.0 协议上架 Hugging Face。它是「4B + 1.7B」这一对中的 4B 主力。卖点在于效率:混合注意力设计把全注意力与滑窗注意力结合,实现了原生 1M 上下文窗口,却不用付出长上下文模型通常的高昂计算成本。对于想要真正能在本地跑起来、又对 Agent 友好的模型的人来说,值得仔细看看。

可对比 Qwen3.8-27B(/items/models/qwen3-8-27b)作为更大的稠密开源选项,GLM-5.3-Flash(/items/models/glm-5-3-flash)作为中文开源快速模型,或 OpenCode(/items/dev-tools/opencode)作为搭配的开源 Agent 框架。

模型规格

规格 Spark-X2.5-4B
总参数 约 4B
同系列 Spark-X2.5-4B、Spark-X2.5-1.7B
架构 混合注意力(每块 1 全注意力 + 3 滑窗注意力)
上下文窗口 最高 1M tokens(原生)
语言 中英 + 200 多种语言
协议 Apache 2.0
基础模型 XHToken/Spark-X2.5-4B-Base

核心功能

  • 原生 1M 上下文:因为混合注意力设计,KV 缓存保持较小,却仍能跟随长文本、重工具调用。
  • 面向 Agent:模型深度集成了 Codex、Claude Code、OpenClaw、Hermes 等主流 Agent 框架,在相近体量模型里编码、Agent、推理任务表现出色。
  • 广泛部署面:可跑在 NVIDIA、华为、Hygon、HOUMO.AI 等硬件上;兼容 vLLM、SGLang、llama.cpp、MLX,也可经 Ollama 与 LM Studio 快速启动。
  • 开放可微调:Apache 2.0 + LLaMA-Factory 支持,可自托管、定制并商用。
  • 面向效率的训练:在华为昇腾集群上训练,采用大规模 RL 与 MOPD 后训练,强化推理、编码与指令跟随。

适用场景

谁应该使用这个工具?

  • 本地优先的开发者:4B 模型可在消费级 GPU 或 Apple Silicon Mac 上通过 MLX 运行。
  • Agent 构建者:一个又小又快、却仍能跟随工具调用与长上下文的模型。
  • 多语种团队:无需部署大体量开源模型即可覆盖多语言。

解决的问题

  1. 长上下文成本:混合注意力设计减少通常迫使团队裁剪上下文的记忆与延迟开销。
  2. 自托管限制:体量紧凑 + 广泛框架支持,让它在中等硬件上也实用。
  3. 商用部署:Apache 2.0 消除了自构建上线的许可摩擦。

定价

Spark-X2.5-4B 在 Apache 2.0 下免费开源。你只需承担自行运行的硬件或云推理成本;截至本文,XHToken 未公布官方托管 API 定价。

快速开始

  1. 下载权重:从 Hugging Face 拉取 XHToken/Spark-X2.5-4B(或更小的 1.7B)。
  2. 本地运行:用 llama.cpp、MLX 或 vLLM 加载,或通过 Ollama、LM Studio 一键启动。
  3. 接入 Agent 框架:把 Codex、Claude Code、OpenClaw 或 Hermes 指向你的本地端点。
  4. 按需微调:用 LLaMA-Factory 适配到你的领域。

常见问题

它是推理模型吗?

它强调推理、编码与指令跟随能力,并用强化学习调校,但并未宣称具有 Anthropic 式常开思考。

能商用吗?

可以,Apache 2.0 已授予该权利。

它如何处理 1M 上下文?

它不会在全部 1M token 上都付出全注意力成本,而是交替使用全注意力与滑窗层,让计算与内存变得可控。

替代方案

  • Qwen3.8-27B(/items/models/qwen3-8-27b):更大的 27B Apache 2.0 模型,容量更高。
  • GLM-5.3-Flash(/items/models/glm-5-3-flash):智谱的免费/快速模型。
  • OpenCode(/items/dev-tools/opencode):可搭配本地模型的开源 Agent 运行时。

使用技巧

  1. 按硬件选体量:小 GPU 上先从 1.7B 开始,需要更强能力再上 4B。
  2. 善用混合上下文:长会话与多轮工具调用正是注意力混合发挥优势之处。
  3. 上线前核对许可:确认你的微调与托管方案处于 Apache 2.0 范围内。

总结

Spark-X2.5-4B 是一个工程扎实、体量紧凑的开源权重模型,用混合注意力设计解决了长上下文成本问题,在编码与 Agent 上表现出色,并在 Apache 2.0 下保持自由使用。对于想要一个本地、Agent 就绪、运行便宜且合规可上线的模型的人来说,它是很强的候选。

评论

还没有评论。成为第一个评论的人!