KAT-Coder V2.5 是快手开发者工具团队 Kwaipilot 推出的开源权重智能体编程模型。Dev 版本于 2026 年 7 月 23 日登陆 Hugging Face,基于 Qwen3.6-35B-A3B MoE 基座(总参数 35B、每 token 仅激活 3B),权重以 Apache 2.0 协议开放。在统一的 Claude Code 评测框架下,它在 PinchBench 上取得最佳智能体工具调用成绩,并在 SWE-Bench Pro 与 KAT Code Bench 上排名第二,仅次于前沿的 Opus 4.8,领先 GLM-5 系列与 Kimi-K2.6。目前该检查点已获得约 582 个点赞与 2.3 万次下载。
模型规格
| 规格 | KAT-Coder V2.5(Dev) |
|---|---|
| 架构 | MoE,总参数 35B / 每 token 激活 3B |
| 基座模型 | Qwen3.6-35B-A3B(Qwen 3.5/3.6 MoE 系列) |
| 上下文 | 原生 262,144 tokens |
| 开源协议 | Apache 2.0 |
| 发布日期 | 2026 年 7 月 23 日,Hugging Face |
| 模态 | 仅文本,Dev 权重不含视觉组件 |
| 后训练 | SFT(12.7 万条样本)+ 强化学习:非对称 actor-critic PPO 与事后增强价值估计 |
核心功能
- 智能体工具调用:在真实可执行的代码仓库中自主行动,用 fail-to-pass / pass-to-pass 测试验证,而非静态打分。
- 仓库级工程能力:AutoBuilder 把真实仓库重建成训练任务,让模型学会项目级改动,而非单文件片段。
- 可验证的强化学习:KwaiClawEnv 合成工具使用轨迹,事后增强价值估计让 PPO 训练回路更稳定。
- OpenAI 兼容部署:通过 SGLang、vLLM 或 Hugging Face Transformers server 提供兼容接口,现有智能体客户端可直接接入。
- 超长上下文:原生 262K tokens,覆盖大型 monorepo 与长会话智能体场景。
适用场景
- 自主编程智能体:模型自己跑测试、读报错、反复迭代的多步修复任务。
- 私有化部署助手:不能把源码发给闭源 API 的团队,也能获得接近前沿的智能体编程能力。
- 学术研究基线:Apache 2.0 权重加 arXiv 技术报告(2607.05471),适合智能体强化学习研究。
- 成本敏感的线上服务:每 token 仅激活 3B 参数,推理成本远低于稠密前沿模型。
定价方案
Dev 权重基于 Apache 2.0 免费获取,只需为自己的算力付费;bartowski 与 mudler 的社区 GGUF 量化进一步降低了门槛。托管商用 API 由 Kwaipilot 的 StreamLake 平台提供,按用量计费,详见 streamlake.com/product/kat-coder。
与竞品对比
- 对比 GLM-5 与 Kimi-K2.6:在同一评测框架下,SWE-Bench Pro 与 KAT Code Bench 双双胜出,PinchBench 工具调用全面领先。
- 对比 Claude Code 闭源模型:只有 Opus 4.8 分数更高,但 KAT-Coder 的开放权重与自托管自由度属于完全不同的类别。
- 效率优势:每 token 激活 3B,仅为 GLM-5 级别模型激活量的零头,规模化部署时差距显著。
快速上手
使用 vLLM 0.19.0+。Dev 仅含文本权重,必须加 --language-model-only:
vllm serve Kwaipilot/KAT-Coder-V2.5-Dev --language-model-only
或使用 SGLang 0.5.10+:
python -m sglang.launch_server \
--model-path Kwaipilot/KAT-Coder-V2.5-Dev \
--tp-size 8 --reasoning-parser qwen3
两者均暴露 OpenAI 兼容 API,请保持 qwen3 reasoning parser 开启。
常见问题
支持视觉输入吗?
不支持。基座支持图文输入,但 Dev 版本只发布语言模型权重。
可以商用吗?
可以。Apache 2.0 协议允许商用、修改与再分发。
与 Claude Code 的模型相比如何?
SWE-Bench Pro 与 KAT Code Bench 上仅次于 Opus 4.8,PinchBench 智能体工具调用为开源权重第一。
替代方案
- Qwen3 8-27B:KAT-Coder 所基于的 Qwen3 家族生态。
- GLM-5.3:智谱旗舰编程模型,智能体基准表现同样强劲。
- Claude Code:定义该模型所追赶的前沿的闭源产品。
使用技巧
- 保持 reasoning parser 开启:SGLang 下不加
--reasoning-parser qwen3,推理过程会混入答案。 - 在自己的框架里复测:迁移前用真实的 fail-to-pass 测试集回放验证。
- 先用 GGUF 量化评估:在小显存 GPU 上先试跑,再决定是否部署 8 卡张量并行服务。
总结
KAT-Coder V2.5 是本季最强的开源权重智能体编程模型:35B MoE 每 token 仅激活 3B,在真实仓库中用可验证强化学习训练,统一 Claude Code 框架下仅次于 Opus 4.8。如果你需要接近前沿的智能体编程能力,同时又要 Apache 2.0 的自由,这就是该下载的那个权重文件。
评论
还没有评论。成为第一个评论的人!
相关工具
Laguna S 2.1
poolside.ai
Poolside 开源权重编程模型:118B 总参 / 8B 激活 MoE、100 万 token 上下文、原生交错推理、OpenMDW-1.1 协议,专为智能体编程与长程任务打造。
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。
NVIDIA Nemotron 3.5 Lightning 30B A3B
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b
NVIDIA 高效开源权重模型,30B 总参数仅激活 3B,MoE 混合架构,最长 1M token 上下文,单卡部署,适合本地推理、编码与后训练研究。
相关洞察
6 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。
Cursor vs GitHub Copilot: 2026 完整对比
深入对比 Cursor 和 GitHub Copilot。通过详细的功能分析、定价和实际测试,发现哪个 AI 编程助手最适合你的工作流程。