Kimi K3 架构概览与笔记

查看原文 HN 讨论

文章摘要

Sebastian Raschka(《Build a Large Language Model From Scratch》作者、LLM 架构科普领域公认的解释者)在 Kimi K3 开放权重模型发布次日,就放出了一张完整的架构示意图和一组观察笔记。这篇短文不是论文精读,而是把 K3 放进近年开放权重模型的演化谱系里,指出哪些是新东西、哪些是既有趋势的延续。

他的第一个判断是:K3 本质上是去年发布的 Kimi Linear 的放大生产版本,参数规模从 48B 一路扩到 2.8T——这使它成为目前体量最大的开放权重模型。图看起来复杂,但绝大部分组件在 Kimi Linear 里已经存在。

相对 Kimi Linear,唯一的新组件是 LatentMoE。它与 Nemotron 3 Ultra 里的同名结构思路一致:像多头潜注意力(MLA)压缩 KV 那样,对体量庞大的线性层做下投影压缩。Raschka 因为图已经太挤,把它从示意图里省略了。

他归纳出 K3 的整体主线与 Nemotron 3、DeepSeek V4 一致:几乎所有改动都指向推理效率。常规 MoE 换成 LatentMoE,常规注意力换成多头潜注意力加 Kimi Delta Attention(KDA),一整排组件都是”把原件替换成效率调优版”。

唯一一个不属于效率优化的改动是注意力残差(attention residuals)。它与 DeepSeek V4 用 mHC(流形约束超连接)改良残差路径的目标相同,但机制不同:mHC 是把残差路径”加宽”,而注意力残差是把残差跨层连接起来,连接本身用注意力分数当作重要性/贡献权重。技术报告称它能稳定地小幅改善验证损失和下游表现,代价是训练成本增加约 4%、推理成本增加约 2%。

最令人意外的一点是位置编码:K3 彻底删掉了所有 RoPE 层,全模型使用 NoPE(无位置嵌入)。这与近期主流趋势相反——业界的普遍做法是局部注意力(如滑动窗口)保留 RoPE、全局层用 NoPE。此前也有全 NoPE 的架构,但据 Raschka 所知,K3 是第一个前沿级别的全 NoPE 模型(这一点同样继承自 Kimi Linear)。此外 K3 还原生支持多模态。他对这次发布的总体评价是”非常棒”。

HN 评论精华