Kimi K3 は 2026 年 7 月 14 日に発表された Moonshot AI のフラッグシップ・オープンウェイトモデルであり、世界初のオープン 3T 級モデルです。総パラメータ 2.8T(活性化 104B)、ネイティブな視覚能力、1M トークンのコンテキストを備え、フロンティア級のエージェント・コーディング性能をダウンロード可能なウェイトとして提供します。完全ウェイトは 7 月 27 日に Hugging Face で公開され、瞬く間にその年のトップクラスのダウンロード数を記録しました。
モデル仕様
| 仕様 | Kimi K3 |
|---|---|
| 総パラメータ | 2.8T(MoE) |
| 活性化パラメータ | 104B(896 エキスパート中 16 個 + 共有 2 個) |
| アーキテクチャ | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| コンテキスト長 | 1,048,576 トークン |
| モダリティ | テキスト・画像・動画理解(MoonViT-V2、401M エンコーダ) |
| ライセンス | Kimi K3 License(規模に応じた商用条件付きオープンウェイト) |
| 精度 | MXFP4 ウェイト / MXFP8 アクティベーション(量子化認識トレーニング) |
主な特徴
- フロンティアのオープンウェイト:2.8T モデルを誰でもダウンロード・デプロイ・ファインチューニング可能。オープンモデルとして初めて 3T 級を突破。
- 常時思考モード:low / high / max の 3 段階(デフォルト max)。思考を完全にオフにはできない。
- ネイティブ多モーダル:テキスト・画像・動画を単一モデルで処理。文書解析と UI 生成が得意。
- 効率的な推論:MXFP4/MXFP8 の量子化認識トレーニングと、vLLM コミュニティに貢献したプレフィックスキャッシュ実装により、1M トークン推論のコストを抑制。
ベンチマークのハイライト
- Terminal-Bench 2.1:88.3。最強のクローズドモデルとほぼ互角。
- BrowseComp:91.2(コンテキスト圧縮戦略)。Claude Fable 5 の 88.0 を上回る。
- MCPMark-Verified:94.5。比較対象中でエージェントのツール使用スコアが最高。
- SWE-Marathon:42.0。Fable 5・GPT-5.6 Sol・GLM-5.2 を抑えてトップ。
- Artificial Analysis インテリジェンス指数:57 で第 3 位。Claude Opus 5(61)と Fable 5(60)に次ぎ、Claude Opus 4.8(56)より上位。
料金
Kimi API の Kimi K3 は、入力 100 万トークンあたり $3.00(キャッシュヒット時 $0.30)、出力 $15.00。プレフィックスキャッシュは自動で有効です。月額サブスクリプションにも含まれ、Kimi.com・Kimi Work・Kimi Code からも利用できます。
ライセンスの注意点
Kimi K3 License は研究者・スタートアップ・社内利用には寛容ですが、年商 2,000 万ドル超で「モデル・アズ・ア・サービス」を運営する企業は Moonshot AI と別途商用契約が必要です。また月間アクティブユーザー 1 億超または月商 2,000 万ドル超の大規模展開では、UI に「Kimi K3」を明示表示する義務があります。
はじめに
Hugging Face の MoonshotAI/Kimi-K3 リポジトリからウェイトを入手するか、Kimi API で reasoning_effort(low/high/max)を指定して利用します。ローカル推論は vLLM または SGLang に対応。ウェイトは約 1.5 TB あるため、クラスターかハイエンドワークステーション向けで、コンシューマー GPU 単体には向きません。
代替案
- Claude Opus 5:同等のエージェント性能を持つクローズドモデル($5/$25 パーMTok)。
- GLM-5.2:コーディングに強いもう一つのオープンウェイト最先端モデル。
- DeepSeek V4:より軽量でライセンスが寛容なオープンウェイト選択肢。
まとめ
Kimi K3 は、オープンウェイトでもエージェント・コーディング分野でクローズド最先端に肉薄できることを証明しました。1.5 TB のウェイトを運用できるインフラを持つチームにとって、現時点で最も高性能なオープンモデルであり、同級のクローズドモデルより API コストははるかに安価です。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
Claude Opus 5
www.anthropic.com/claude/opus
Anthropic の最上位 Opus モデル。1M トークンのコンテキストと調整可能な思考強度を備え、Opus 4.8 と同じ価格で Fable 5 に迫る性能を発揮。エージェントと長期コーディング向け。
NVIDIA Nemotron 3.5 Lightning 30B A3B
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b
NVIDIA の効率的なオープンウェイトモデル。総パラメータ 30B で活性化はわずか 3B。MoE ハイブリッド構成、最大 1M トークンのコンテキスト、単一 GPU 展開でローカル推論とポストトレーニング研究に対応。
DeepSeek V4
www.deepseek.com
DeepSeek V4 は、DeepSeek のフラッグシップ AI モデルの次世代版であり、V3 の成功を基盤に、推論能力、マルチモーダル理解、エージェントベースのインタラクションの向上が期待されています。
関連インサイト
Obsidian を OpenClaw に接続したら、意思決定まで手伝い始めた
Obsidian がただのノート置き場ではなく OpenClaw とつながったとき、情報整理、文脈接続、判断材料の整理、そして実際の意思決定支援まで始まった。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。
ローコードプラットフォームの黄昏:なぜClaude Agent SDKがDifyを歴史にするのか
大規模言語モデルの第一原理から、なぜClaude Agent SDKがDifyを置き換えるのかを深く分析。自然言語でプロセスを記述することが人間の原始的な行動パターンにより合致している理由、そしてなぜこれがAI時代の必然的な選択なのかを探る。