Kimi K3 于 2026 年 7 月 14 日发布,是月之暗面(Moonshot AI)的旗舰开源权重模型,也是全球首个开源 3T 级模型。它拥有 2.8 万亿总参数(激活 104B)、原生视觉能力与 1M token 上下文窗口,把前沿级的智能体与编码能力带到了可下载的权重中。完整权重于 7 月 27 日上架 Hugging Face,迅速成为当年下载量最高的开源模型之一。
模型规格
| 规格 | Kimi K3 |
|---|---|
| 总参数 | 2.8T(MoE) |
| 激活参数 | 104B(896 个专家中激活 16 个 + 2 个共享专家) |
| 架构 | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| 上下文长度 | 1,048,576 token |
| 模态 | 文本、图像、视频理解(MoonViT-V2,401M 视觉编码器) |
| 协议 | Kimi K3 License(开源权重,含规模相关商用条款) |
| 精度 | MXFP4 权重 / MXFP8 激活,量化感知训练 |
核心特点
- 前沿开源权重:2.8T 模型人人可下载、部署、微调,首个突破 3T 级的开源模型。
- 常开思考模式:支持 low、high、max 三档推理强度(默认 max),无法完全关闭思考。
- 原生多模态:文本、图像、视频统一建模,文档解析与 UI 生成表现突出。
- 高效推理:MXFP4/MXFP8 量化感知训练,配合贡献给 vLLM 社区的 prefix cache 实现,1M 长上下文推理成本可控。
基准亮点
- Terminal-Bench 2.1:88.3,与最强封闭模型基本持平。
- BrowseComp:91.2(上下文压缩策略),超过 Claude Fable 5 的 88.0。
- MCPMark-Verified:94.5,对比组中智能体工具调用得分最高。
- SWE-Marathon:42.0,领先 Fable 5、GPT-5.6 Sol 与 GLM-5.2。
- Artificial Analysis 智能指数:57,位列第三,仅次于 Claude Opus 5(61)与 Fable 5(60),高于 Claude Opus 4.8(56)。
定价
Kimi API 上 Kimi K3 为每百万 token 输入 $3.00(缓存命中 $0.30)、输出 $15.00,自动启用前缀缓存。它也包含在 Kimi 的月度订阅套餐中,可在 Kimi.com、Kimi Work、Kimi Code 使用。
授权注意事项
Kimi K3 License 对研究者、初创公司与内部使用相当宽松,但年营收超过 2000 万美元且经营"模型即服务"业务的公司必须与月之暗面另行签订商用协议;月活超 1 亿或月营收超 2000 万美元的大规模部署必须在界面显著展示"Kimi K3"标识。
快速开始
从 Hugging Face 的 MoonshotAI/Kimi-K3 仓库下载权重,或通过 Kimi API 使用 reasoning_effort 参数(low/high/max)调用。本地推理建议搭配 vLLM 或 SGLang,权重约 1.5 TB,适合集群或高端工作站,而非单张消费级显卡。
替代方案
- Claude Opus 5:封闭前沿模型,智能体性能相当,定价 $5/$25 每百万 token。
- GLM-5.2:另一款开源权重领先模型,编码能力出色。
- DeepSeek V4:更轻量、协议更宽松的开源选择。
总结
Kimi K3 证明了开源权重完全可以在智能体与编码任务上逼近封闭前沿。对于有基础设施承载 1.5 TB 权重的团队,它是目前可用的最强开源模型,API 成本远低于同级别封闭模型。
评论
还没有评论。成为第一个评论的人!
相关工具
Qwen3.8-2.4T-A95B
qwen.ai
阿里巴巴旗舰 2.4T MoE 模型,激活参数 95B,1M token 上下文,原生多模态输入,PaperBench 与 OSWorld 全球登顶,史上最大的 Qwen 模型。
Gemma 4 26B A4B
ai.google.dev/gemma
Google DeepMind 开源权重模型,25.2B 总参数 MoE 架构每 token 仅激活 3.8B,256K 上下文,支持图文多模态输入,Apache 2.0 商用友好协议。
Claude Sonnet 4.5
docs.claude.com/en/docs/about-claude/models/overview
Anthropic 上一档 Sonnet 快照:20 万上下文,每百万 token $3/$15。文档现主推更新的 Claude 4.6 与 Claude 5。
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。