月之暗面兑现了 Kimi K3 发布时最重要的承诺。这家北京实验室在 2026 年 7 月 16 日推出模型,宣布完整权重会在 7 月 27 日前发布,随后如期公开权重,并一同发布了 47 页技术报告和一份自定义许可证。[1][2][3][4] 这段时序让“开放”脱离发布话术,成为外界可以逐项检查的产物。
这份产物的体量依然惊人。截至 7 月 30 日,官方 Hugging Face 仓库包含 96 个 safetensors 分片,总计 1.56 TB。月之暗面将其描述为一个总参数量 2.8 万亿、每个 token 激活 *1040 亿参数*的混合专家模型,原生支持视觉,上下文窗口达到 1,048,576 tokens。[2][3] 稀疏激活减少了每个 token 执行的算术运算,却不会让其余专家权重从存储或服务拓扑中消失。
从这里看本次发布,脉络最清楚。Kimi K3 对外部检查开放得格外充分,也格外明确地写出了真正用好它所需的机房条件。月之暗面建议使用配备 64 个或更多加速器的超节点部署。[1] 这次发布扩大了前沿规模权重的可获取范围,也把另一项区别推到台前:模型下载权与经济可行的运行方式,是两道不同的门槛。
与 Kimi K2 相比发生了什么变化
Kimi K3 对 K2 的改动,远远超过上下文标签的加长。对照月之暗面最初的 K2 模型卡,新模型把总参数量从 1 万亿提高到 2.8 万亿,激活参数从 320 亿提高到 1040 亿,层数从 61 层提高到 93 层,路由专家从 384 个增至 896 个。每个 token 选择的路由专家由 8 个增至 16 个,共享专家也从 1 个增至 2 个。[2][5]
上下文处理路径的变化更大。最初的 K2 在整个主干中使用多头潜在注意力(Multi-head Latent Attention),标称上下文长度为 128K;K3 则以三层 Kimi Delta Attention(KDA)接一层 Gated MLA的节奏交替堆叠,并在末端再加入一层全局注意力,最终共有 69 层 KDA 和 24 层 Gated MLA。[2][5] 技术报告显示,预训练从 8K 上下文起步,随后扩展至 64K,并在冷却阶段依次推进到 256K 和 100 万 token。[2]
KDA 通过递归状态传递信息,其状态规模不会像传统完整 key-value cache 那样随 token 逐个增长;周期性出现的 MLA 层则保留全局 token 间交互。这是一种应对长上下文的混合方案:多数层采用递归路径,再定期恢复成本更高的全局视野。[2] 月之暗面宣称的相较 K2,扩展效率提升 2.5×来自整套组合,包括注意力、深度路由、稀疏专家、训练方法和基础设施,不能单独归功于其中某项技巧。[1][2]
第二项架构变化发生在模型深度方向,与序列方向上的变化不同。Attention Residuals(注意力残差)允许一个 block 有选择地取回嵌入层与较早 block 的表征,不再完全依赖均匀累加的残差链。用直白的技术语言描述,K3 试图在时间与深度两个方向上选择需要继续传递的信息。Stable LatentMoE 在宽度方向承担相应工作,让每个 token 只经过 896 个专家中的一小部分。[2]
这些确是实质性的技术变化。质量、延迟、内存和稳定性之间的取舍,仍有待外部团队按自身工作负载复现;现有说法出自厂商。
1.56 TB 仓库本身就是部署说明
月之暗面把路由专家权重量化为 MXFP4,激活值采用 MXFP8,注意力投影、共享专家、路由器及其他若干部件则保留更高精度。团队让量化感知训练贯穿监督微调和强化学习,从训练阶段就纳入量化,没有等高精度模型完工后再做转换。[2][3] 这有助于解释一个 2.8 万亿参数模型为何能以 1.56 TB 发布;若保留高精度形态,所需空间会达到这一体量的数倍。
分布式部署难题仍在。若把权重文件平均分到 64 个加速器上,在计入运行时缓冲区、激活值、缓存、框架开销、冗余放置和分布不均以前,每台设备的原始算术下限约为 24.4 GB。这个数字只是下限提醒,距离容量规划还差运行态开销这一整层。部署者若把“104B active”看成传统 104B 模型检查点,就会低估真实部署量。路由器选择任何专家时,相应权重都须保持可达。
超节点建议正是从这项要求而来。极端稀疏只有在高带宽链路能把 token 送往专家、通信又不至于成为瓶颈时才会产生收益。月之暗面的报告描述了均衡的专家执行、静态计算形状、零拷贝通信、状态感知型前缀缓存,以及基于预算的准入控制,以处理从不足 2K 到 100 万 token 的请求流量。[2] 因此,K3 同时是一项模型发布和分布式系统发布。
托管服务上线后很快迎来压力测试。据美联社报道,发布数日内,需求逼近月之暗面的容量上限,公司一度暂停新订阅,把服务资源优先留给现有客户。[6] 这一事件无法衡量权重质量,却清楚显示:即便模型产物已经公开,服务容量仍是一项独立产品。
许可证在达到规模门槛前相当宽松
Kimi K3 License 广泛授权用户使用、复制、修改、分发、再许可、销售、部署和微调软件与权重。[4] 对研究人员、企业内部用户、较小的产品团队和众多下游开发团队而言,这已经是一次实质性开放。
这是一份附带条件的自定义宽松许可证。经营“Model as a Service”业务的被许可方,如果其与关联方在任意连续 12 个月内的合计收入超过 $20 million(2,000 万美元),须在商业使用前与月之暗面另行达成协议。另一项条款规定,使用 K3 的商业产品或服务一旦超过 100 million(1 亿)月活跃用户或每月 $20 million(2,000 万美元)收入,就须显著展示“Kimi K3”名称。内部使用,以及经由月之暗面官方产品或认证推理合作伙伴接入的情形,均属于这两项规模条款的豁免范围。[4]
这些门槛显露出背后的商业设计。月之暗面开放研究、检查、修改和大范围部署,同时保留与大型模型服务商谈判的筹码,并要求超大规模产品标注来源。若只把这次发布称为“免费”,条款设计会被遮蔽;若直接称其“封闭”,同样无法解释已经授予的广泛权利。这是一项自定义的开放权重安排,部署方的商业模式和规模会改变其所负义务。
这份报告也没有让训练达到最严格意义上的可复现状态。它用少见的篇幅详细记录架构、课程安排、后训练、基础设施和评测,却未公开完整预训练语料库、每一项训练产物,或一套能让外部实验室从头复建 K3 的执行方案。[2] 公共权重允许审计和衍生开发,却无法重现生产这些权重的整座工厂。
基准表需要写明 harness 标签
相较许多发布文章,月之暗面对评测适用范围交代得更明确。K3 的结果采用最高推理强度,temperature 设为 1.0。代码任务比较横跨 Kimi Code、Claude Code 和 Codex,没有使用一套统一 harness。其 SWE-Marathon 分支在最终 v1.1 发布前针对 NVIDIA H20 硬件重新校准,Claude Fable 5 则在其中 35% 的任务上出现回退行为。PostTrainBench 对多个模型使用 H20,也未沿用官方的 H100 设置。[1][2]
披露清楚后,这些数字才有参考价值,但各组数字仍无法直接互换。在月之暗面的 Terminal-Bench 2.1 表中,K3 得分 88.3,接近 88.8 分的 GPT-5.6 Sol 和 88.0 分的 Claude Fable 5。FrontierSWE 上,K3 得分 81.2,低于 Fable 的 86.6,高于 Sol 的 71.3。月之暗面的报告还显示,截至 7 月 23 日,K3 在 WebDev Arena 排名第一,在 Text Arena 仅列第八,在较新的 Agent Arena 排名第四。[2] 美联社在发布后也独立报道了它在前端代码任务上的领先表现。[6]
合乎证据范围的结论,应比“K3 胜出”更窄。从现有结果看,模型在前沿代码和 agent 任务中处于竞争行列,尤其是在长轨迹、工具和视觉反馈发挥作用的任务中。确切次序会随任务、harness、推理强度、回退行为、硬件和日期变化。团队评估这些权重时,应先固定这六项条件,再把排行榜结果写入采购主张。
这次发布接下来需要证明什么
Kimi K3 已经越过一道门槛:月之暗面如约发布了权重、报告、配置和许可证。下一批证据应来自月之暗面以外的运营团队。
首先,独立部署报告需要越过“模型成功启动”这一最低标准,公布加速器数量、拓扑、吞吐量、首 token 时间、尾延迟、功耗和有效上下文长度。其次,重跑基准时应让各模型使用相同的 agent harness 和推理预算。第三,外界还需要看到 KDA 与 MXFP4 在少数优化运行时和加速器之外得到支持。最后,大型商业采用者会显示,许可证门槛究竟会带来更多认证托管、直接谈判,还是让采用者转向条款更简洁的替代模型。
这次发布的分量,来自清楚可见的约束条件。Kimi K3 的权重已经公开,“开放”对应着可下载产物;同样,前沿模型完成下载之后,仍要经过工程部署,才会接近常规基础设施。它是一个 1.56 TB 的公共产物、一份自定义商业契约,也是一套建议配备 64 个加速器的系统。月之暗面已经开放模型。接下来的艰巨工作,落到必须运营它的人手中。
来源
- Moonshot AI,《Kimi K3: Open Frontier Intelligence》(2026 年 7 月 16 日)——官方发布时序、架构概览、部署建议、API 定价、基准设置及权重发布承诺。
- Kimi Team,《Kimi K3: Open Frontier Intelligence》,arXiv:2607.24653(2026 年 7 月 27 日提交)——完整技术报告,涵盖架构、训练课程、后训练、系统设计、评测配置、第三方结果和局限。
- Moonshot AI,
moonshotai/Kimi-K3官方 Hugging Face 仓库(快照检查于 2026 年 7 月 30 日)——96 个权重分片、仓库存储、配置、100 万 token 设置、模型卡及可下载产物。 - Moonshot AI,《Kimi K3 License》(2026 年)——授权范围、Model as a Service 营收门槛、大型产品署名要求、内部使用例外及认证合作伙伴例外。
- Moonshot AI,
Kimi-K2官方仓库——最初的 K2 架构基线,包括总参数与激活参数、层数、专家、注意力机制和上下文长度。 - Chan Ho-him,美联社,《China’s new AI model halts new subscriptions as demand swamps capacity》(2026 年 7 月 20 日)——独立的上线报道,也是 Ng Han Guan 拍摄 WAIC Kimi K3 展台照片的来源页面。