KAT-Coder V2.5 logo

KAT-Coder V2.5

打开

Kwaipilot 开源智能体编程模型:35B MoE、每 token 激活 3B,基于 Qwen3.6 基座,Apache 2.0 协议,原生 262K 上下文,PinchBench 工具调用榜首。

分享:

KAT-Coder V2.5 是快手开发者工具团队 Kwaipilot 推出的开源权重智能体编程模型。Dev 版本于 2026 年 7 月 23 日登陆 Hugging Face,基于 Qwen3.6-35B-A3B MoE 基座(总参数 35B、每 token 仅激活 3B),权重以 Apache 2.0 协议开放。在统一的 Claude Code 评测框架下,它在 PinchBench 上取得最佳智能体工具调用成绩,并在 SWE-Bench Pro 与 KAT Code Bench 上排名第二,仅次于前沿的 Opus 4.8,领先 GLM-5 系列与 Kimi-K2.6。目前该检查点已获得约 582 个点赞与 2.3 万次下载。

模型规格

规格 KAT-Coder V2.5(Dev)
架构 MoE,总参数 35B / 每 token 激活 3B
基座模型 Qwen3.6-35B-A3B(Qwen 3.5/3.6 MoE 系列)
上下文 原生 262,144 tokens
开源协议 Apache 2.0
发布日期 2026 年 7 月 23 日,Hugging Face
模态 仅文本,Dev 权重不含视觉组件
后训练 SFT(12.7 万条样本)+ 强化学习:非对称 actor-critic PPO 与事后增强价值估计

核心功能

  • 智能体工具调用:在真实可执行的代码仓库中自主行动,用 fail-to-pass / pass-to-pass 测试验证,而非静态打分。
  • 仓库级工程能力:AutoBuilder 把真实仓库重建成训练任务,让模型学会项目级改动,而非单文件片段。
  • 可验证的强化学习:KwaiClawEnv 合成工具使用轨迹,事后增强价值估计让 PPO 训练回路更稳定。
  • OpenAI 兼容部署:通过 SGLang、vLLM 或 Hugging Face Transformers server 提供兼容接口,现有智能体客户端可直接接入。
  • 超长上下文:原生 262K tokens,覆盖大型 monorepo 与长会话智能体场景。

适用场景

  • 自主编程智能体:模型自己跑测试、读报错、反复迭代的多步修复任务。
  • 私有化部署助手:不能把源码发给闭源 API 的团队,也能获得接近前沿的智能体编程能力。
  • 学术研究基线:Apache 2.0 权重加 arXiv 技术报告(2607.05471),适合智能体强化学习研究。
  • 成本敏感的线上服务:每 token 仅激活 3B 参数,推理成本远低于稠密前沿模型。

定价方案

Dev 权重基于 Apache 2.0 免费获取,只需为自己的算力付费;bartowski 与 mudler 的社区 GGUF 量化进一步降低了门槛。托管商用 API 由 Kwaipilot 的 StreamLake 平台提供,按用量计费,详见 streamlake.com/product/kat-coder

与竞品对比

  1. 对比 GLM-5 与 Kimi-K2.6:在同一评测框架下,SWE-Bench Pro 与 KAT Code Bench 双双胜出,PinchBench 工具调用全面领先。
  2. 对比 Claude Code 闭源模型:只有 Opus 4.8 分数更高,但 KAT-Coder 的开放权重与自托管自由度属于完全不同的类别。
  3. 效率优势:每 token 激活 3B,仅为 GLM-5 级别模型激活量的零头,规模化部署时差距显著。

快速上手

使用 vLLM 0.19.0+。Dev 仅含文本权重,必须加 --language-model-only

vllm serve Kwaipilot/KAT-Coder-V2.5-Dev --language-model-only

或使用 SGLang 0.5.10+:

python -m sglang.launch_server \
  --model-path Kwaipilot/KAT-Coder-V2.5-Dev \
  --tp-size 8 --reasoning-parser qwen3

两者均暴露 OpenAI 兼容 API,请保持 qwen3 reasoning parser 开启。

常见问题

支持视觉输入吗?

不支持。基座支持图文输入,但 Dev 版本只发布语言模型权重。

可以商用吗?

可以。Apache 2.0 协议允许商用、修改与再分发。

与 Claude Code 的模型相比如何?

SWE-Bench Pro 与 KAT Code Bench 上仅次于 Opus 4.8,PinchBench 智能体工具调用为开源权重第一。

替代方案

  • Qwen3 8-27B:KAT-Coder 所基于的 Qwen3 家族生态。
  • GLM-5.3:智谱旗舰编程模型,智能体基准表现同样强劲。
  • Claude Code:定义该模型所追赶的前沿的闭源产品。

使用技巧

  1. 保持 reasoning parser 开启:SGLang 下不加 --reasoning-parser qwen3,推理过程会混入答案。
  2. 在自己的框架里复测:迁移前用真实的 fail-to-pass 测试集回放验证。
  3. 先用 GGUF 量化评估:在小显存 GPU 上先试跑,再决定是否部署 8 卡张量并行服务。

总结

KAT-Coder V2.5 是本季最强的开源权重智能体编程模型:35B MoE 每 token 仅激活 3B,在真实仓库中用可验证强化学习训练,统一 Claude Code 框架下仅次于 Opus 4.8。如果你需要接近前沿的智能体编程能力,同时又要 Apache 2.0 的自由,这就是该下载的那个权重文件。

评论

还没有评论。成为第一个评论的人!