2.8 万亿参数 · 开放权重 · MoonEP/FlashKDA/AgentEnv · 许可证解读 · 中美 AI 争端
7 月 27 日晚,月之暗面(Moonshot AI)正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施——这是全球首个被完整开放的 3 万亿参数级别模型,距 API 首发仅 11 天。若你正纠结「开源」与「开放权重」的语义差异、许可证商业门槛,或 K3 与 GPT-5.6 Sol / Claude Fable 5 如何选型,本文将用时间线、架构创新、基准对比、六步 Runbook 与许可证两道门槛给出可执行结论。数据截止:2026-07-28
7 月 27 日晚 23 点左右,月之暗面在 Hugging Face 上线约 1.56TB 权重文件,半小时内登顶趋势榜第一。这次发布距离 7 月 16 日 Kimi K3 在 kimi.com 与 API 端首发,只过去了 11 天。
7 月 16 日(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首发,模型权重尚未公开。官方技术博客标题为《Kimi K3: Open Frontier Intelligence》。
7 月 17 日:行业密集分析架构,新华社报道称其为「目前全球参数最大的开源模型」。
7 月 22–23 日:中美「模型蒸馏」争端升级。白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic Fable 模型进行「大规模、隐蔽的工业化蒸馏」;美国财政部长 Scott Bessent 表示将考虑制裁及「实体清单」限制。
7 月 27 日晚:正式发布 K3 完整权重、技术报告,并开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。
7 月 28 日:中国商务部公开回应,指责美方搞「AI 霸权主义」并威胁反制;国内媒体跟进报道开源细节。
面对 K3 开放权重,技术团队常陷入五重盲区:
「开源」语义混淆:官方从未使用 open source,一直称 open weight——训练数据与完整训练代码未公开。
许可证商业门槛:K3 新增 Model-as-a-Service 年收入 2000 万美元门槛,与 K2 时代的 Modified MIT 不同。
自部署硬件幻想:2.8T 参数需 64 卡以上超节点,消费级硬件几乎不可能运行。
基准数据可信度:厂商自报与第三方复测差异大,须交叉引用 Vals AI、Artificial Analysis 等独立评测。
成本 vs 能力权衡:K3 是开源阵营能力天花板,但每任务约 $0.95,高于 GLM-5.2 的 $0.47。
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE) |
| 专家配置 | 896 个路由专家,每 token 激活 16 个(另有共享专家) |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token |
| 多模态能力 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方称 open weight,非 open source) |
传统 Gated DeltaNet 使用标量级遗忘门,KDA 改为逐通道门控:每个特征维度拥有独立衰减率,某些特征长期保留、另一些快速遗忘。采用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,大幅降低长序列 KV Cache 开销。K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合,支撑 100 万 token 上下文的核心原因正在于此。
传统残差连接逐层均匀累加,深层易稀释早期信息。AttnRes 改为选择性、依据输入动态聚合前面所有层输出——每层仅新增一个 RMSNorm 和一个伪查询向量,参数开销可忽略,却带来约 25% 训练效率提升,代价不到 2%。
Per-Head Muon 让每个注意力头独立优化,收敛路径更自适应。MoE 层 896 选 16(稀疏度约 1.8%),配合 Quantile Balancing 均衡策略与 MoonEP 通信库,从数学上证明每个计算节点冗余专家数的理论上界。
Kimi K3 重构了深度学习沿用多年的注意力、残差连接与优化器三大组件——这是它区别于「简单堆参数」的关键。
完整权重已开放,但绝大多数团队仍应通过 API 或第三方平台调用。以下为从零接入的六步 Runbook:
确认使用场景与合规边界:阅读自定义许可证,若运营 Model-as-a-Service 且 12 个月收入超 2000 万美元,须与月之暗面另行签署商业协议;月活超 1 亿或月收入超 2000 万美元须显著展示「Kimi K3」字样。
获取 API Key:在 platform.moonshot.ai 创建项目,确认账户余额与速率限制。
配置 OpenAI 兼容 SDK:设置 base_url=https://api.moonshot.ai/v1,模型 ID 为 kimi-k3(见下方代码)。
OpenRouter 接入(可选):模型 ID moonshotai/kimi-k3,目前已有 7 家服务商上线,定价大多与官方一致。
优化缓存命中率:Mooncake 分离式推理架构在编程类工作负载上缓存命中率可达 90% 以上,实际输入成本更接近 $0.30/M 而非 $3 表头价。
自部署可行性评估:若确需本地推理,官方建议 64 卡及以上超节点;个人开发者应放弃自托管幻想,走 API 或 OpenRouter。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "分析这段代码..."}]
)
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 高性能通信库 | 临时复制过载专家保证每节点均等 token 数;证明冗余专家数理论上界 |
| FlashKDA | 基于 CUTLASS 的 KDA 高性能算子 | H20 上 prefill 较 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端 |
| AgentEnv | 与 KVCache.ai 联合开发的 Agent 沙箱 | 基于 Firecracker microVM;checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍 |
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指数(max 推理档):Kimi K3 约 57 分,全球第 3、开源模型第 1,仅次于 Claude Fable 5(60)与 GPT-5.6 Sol(59)。每任务成本约 $0.95,比 Fable 5($2.4)便宜约 60%,但高于 GLM-5.2($0.47)。K3 目前在 Arena.ai Frontend Code Arena 榜单排名第一。
| Token 类型 | 价格(每百万 token) |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
许可证两道商业门槛:(1)Model-as-a-Service 业务连续 12 个月累计收入超 2000 万美元须另行签署商业协议;(2)月活超 1 亿或月收入超 2000 万美元须在产品界面显著展示「Kimi K3」。对绝大多数中小团队不构成障碍,但若计划与月之暗面直接竞争模型服务,第一道门槛是法务红线。
Kimi K3 的开源节点卡在世界人工智能大会(WAIC 2026)窗口期,叠加升级中的中美「模型蒸馏」争端。月之暗面选择公开权重、技术报告与三项 Infra,某种程度上是用完整工程细节自证技术路径独立性。三天后,阿里巴巴(投资方之一)发布 24 万亿参数的 Qwen3.8-Max-Preview,国产大模型竞争正式进入「3T 俱乐部」阶段。
简单说:K3 是开源阵营里能力天花板最高的选项,而不是性价比最高的选项。
纯 API 调用可接入 K3 推理,但 iOS 签名链、Xcode 本地构建、Metal 推理与 7×24 CI 长跑仍依赖实体 macOS 节点——虚拟机有性能损耗与 EULA 风险,笔记本也难以稳定常驻 Agent。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,VpsMesh 的 Mac Mini 云端租赁通常是更优解:实体 Apple Silicon、root 权限与可预测月租,可与 Kimi K3 API 形成「云端推理 + 本地构建」互补架构。详见 7 月 16 日 Kimi K3 深度评测与 OpenRouter 7 月排行榜。
参考资料:Moonshot AI 官方博客 · Hugging Face · GitHub moonshotai/FlashKDA · Vals AI SWE-bench · Artificial Analysis · VentureBeat · Simon Willison 博客。发布前请以官方最新数据为准。
严格来说不是。它属于「开放权重(open weight)」模型:训练完成的权重文件、技术报告和部分 Infra 工具是公开的,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的「开源」定义。月之暗面官方材料从未使用 open source 一词。
可以,绝大多数商业场景不受限制。但如果你运营的是「模型即服务」业务且年收入超过 2000 万美元,或产品月活超过 1 亿/月收入超过 2000 万美元,需要额外满足许可证中的特定条款。
官方建议部署在 64 卡及以上的超节点集群。个人和大部分企业用户更现实的方式是通过官方 API 或 OpenRouter 等第三方平台调用。配套 7×24 构建环境见 Mac Mini M4 租赁定价。
在开源模型阵营中综合能力最强,Artificial Analysis 智能指数全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于同为开源的 GLM-5.2,属于「开源阵营天花板最高、但非性价比最优」的选择。
K3 参数规模是 K2.5 的约 3 倍,架构上新增了 Attention Residuals 和 Per-Head Muon,上下文窗口和多模态能力也大幅提升;许可证方面 K3 新增了 Model-as-a-Service 收入门槛,商业限制比 K2 系列更细化。更多背景见 帮助中心。