Kimi K3 架构概览与笔记
文章摘要
Sebastian Raschka(《Build a Large Language Model From Scratch》作者、LLM 架构科普领域公认的解释者)在 Kimi K3 开放权重模型发布次日,就放出了一张完整的架构示意图和一组观察笔记。这篇短文不是论文精读,而是把 K3 放进近年开放权重模型的演化谱系里,指出哪些是新东西、哪些是既有趋势的延续。
他的第一个判断是:K3 本质上是去年发布的 Kimi Linear 的放大生产版本,参数规模从 48B 一路扩到 2.8T——这使它成为目前体量最大的开放权重模型。图看起来复杂,但绝大部分组件在 Kimi Linear 里已经存在。
相对 Kimi Linear,唯一的新组件是 LatentMoE。它与 Nemotron 3 Ultra 里的同名结构思路一致:像多头潜注意力(MLA)压缩 KV 那样,对体量庞大的线性层做下投影压缩。Raschka 因为图已经太挤,把它从示意图里省略了。
他归纳出 K3 的整体主线与 Nemotron 3、DeepSeek V4 一致:几乎所有改动都指向推理效率。常规 MoE 换成 LatentMoE,常规注意力换成多头潜注意力加 Kimi Delta Attention(KDA),一整排组件都是”把原件替换成效率调优版”。
唯一一个不属于效率优化的改动是注意力残差(attention residuals)。它与 DeepSeek V4 用 mHC(流形约束超连接)改良残差路径的目标相同,但机制不同:mHC 是把残差路径”加宽”,而注意力残差是把残差跨层连接起来,连接本身用注意力分数当作重要性/贡献权重。技术报告称它能稳定地小幅改善验证损失和下游表现,代价是训练成本增加约 4%、推理成本增加约 2%。
最令人意外的一点是位置编码:K3 彻底删掉了所有 RoPE 层,全模型使用 NoPE(无位置嵌入)。这与近期主流趋势相反——业界的普遍做法是局部注意力(如滑动窗口)保留 RoPE、全局层用 NoPE。此前也有全 NoPE 的架构,但据 Raschka 所知,K3 是第一个前沿级别的全 NoPE 模型(这一点同样继承自 Kimi Linear)。此外 K3 还原生支持多模态。他对这次发布的总体评价是”非常棒”。
HN 评论精华
-
gokohl(首条高赞)抓住了 NoPE 这个点:别家都在局部层保留 RoPE 对冲风险,Kimi 却全线取消,感觉是线性注意力(Kimi Delta)在悄悄承担位置编码的工作,所以才敢这么做。他好奇这个设计在前沿规模上能不能撑住。有意思的是,这条评论下面一串人(cubefox、Bolwin、nextaccountic)在辨认它是不是 LLM 写的,逐词挑”quietly”“at frontier scale”“破折号”当作证据——是 HN 当下的典型反应。
-
thunderbird120 给出了整个讨论里最扎实的技术解释:KDA 虽然名字里有 Attention,但它根本不是常规意义上的注意力,而更像一个能在训练时高效并行化的 RNN,是对 Gated DeltaNet 的小幅修改,隐状态相当于一块可编辑的小型注意力记忆。正因为它是 RNN 式的,天然带有”X 在 Y 之前”的顺序概念,而 Transformer 默认把输入当作无序集合,所以才需要额外告诉它位置。K3 里每个注意力层前有 3 个 KDA 层、第一个注意力层前也有 3 个,所以每个 token 位置在进入第一个真正的注意力层之前就已经学到了自己在序列中的位置。他补充说 RoPE 其实有一定破坏性,能省掉它非常划算,并类比 Gemma-4 的 5:1 滑动窗口结构:那里只有 SWA 层带 RoPE、全局层用 NoPE,因为 SWA 是真注意力所以需要位置嵌入,而 KDA 不是,所以不需要。
-
Ilaurens 代表了很多人的困惑:完全没有位置编码,怎么可能不变成一锅”token 汤”?一串回复补齐了答案:itkovian_ 指出因果掩码本身就让模型能学出隐式位置编码,”Transformer 块是置换不变的”这个说法并不成立;cma 直接引用论文原话——K3 通过 KDA 的循环门控与衰减机制隐式编码位置信息;dwohnitmok 补充说解码器-only 的因果 Transformer 确实不严格需要位置嵌入(但非因果的编码器一定需要),并给出直觉:某个注意力头持续往残差流的同一处累加,随 token 增多而累积,就等价于一种索引。yhocd 提了个有趣的花絮:RoPE 的主要作者苏剑林目前就在月之暗面(Kimi)工作。
-
samuelknight 指出这套架构的实际副作用:KV cache 在服务商侧是按固定的 1024 token 块递增实现的,而不是简单缓存到最近的输入位置,导致每次推理最多可能多出 1023 个未命中的输入 token。wren6991 解释这和在本地跑 Qwen3.5/3.6 系列一样,需要为循环状态存检查点;云服务商为多并发省事,往往直接吃下这 1k 的最坏情况预填充开销。
-
mickael-kerjean 提了个元问题:这些架构从公开文档里到底有多可复现,会不会像 PDF/DWG/PSD 那样”看着是开放规范,真去实现才发现关键细节没写”?calebkaiser 的回答代表共识:照着论文实现模型架构通常可行,缺的多是超参数这类靠社区试错补齐的东西;但复现训练过程基本不可能——没有原始数据集和训练流水线,成本也高到离谱。marcyb5st 进一步指出即使固定随机种子,分布式训练中权重更新到达的时机不同,最终权重也必然有差异。这条线索引出了本帖第二大争论:”开放权重不等于开源”。nl 认为这个说法是彻底的误解,因为有权重加文档就足以微调;esperent、spider-mario、monocasa 则反驳:这就像说”开放目标文件等于开源”,而且开源的价值不止于可复现,还有可审查性——检测模型后门是 NP 难问题。
-
另一条支线是地缘政治味的:constantlm 说这证明了 Kimi 并非西方实验室口中”蒸馏攻击”的产物,人家是在引入新颖方法。anon373839 反唇相讥地问那 Anthropic 对数百万创作者做的算什么”蒸馏攻击”。ozgung 从术语角度纠偏:蒸馏本来指用大教师模型训练小学生模型以完整模仿其行为,用在这里是误用。FinchNova12 则试图保持中立:新方法和存在蒸馏这两件事并不互斥。
-
实际使用体验分歧明显。rglover 说 K3 已经成了他的日常主力,和 Opus 4.7/4.8 的可比性令人吃惊;ATMLOTTOBEER 直接把 200 美元/月的 Claude 换成了 100 美元/月的月之暗面订阅,还能看到思考轨迹、不会被频繁降级。但 dools 泼了冷水:他是 K2.5/2.6 的重度用户,最近觉得 Kimi 明显变笨,怀疑对方在算力压力下做了量化——K3 会搞砸工具调用、陷入无尽思考链,”月之暗面那边有点不对劲”。gboss 则报告在 Cursor 上 K3 反而比 Opus 5 更贵;igravious 顺势泼冷水:”K3 和 GLM 5.2 比 Claude/GPT 便宜得多这个说法是不成立的,DeepSeek V4 Pro 才是真便宜。消息来源:我的银行余额。”