Kimi-K3 登陆 HuggingFace

查看原文 HN 讨论

文章摘要

月之暗面(Moonshot AI)在 HuggingFace 上放出了 Kimi K3 的开放权重。按照模型卡的描述,这是一个原生多模态的 agentic 模型,也是他们至今最强的模型:2.8T 总参数、激活参数 104B,构建在 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)之上,具备原生视觉能力和 100 万 token 的上下文窗口。模型卡称它是「世界上第一个开放的 3T 级模型」。

架构细节。 混合专家(MoE)架构,93 层(其中 1 层 dense),注意力层由 69 层 KDA 加 24 层 Gated MLA 组成,注意力隐藏维度 7168、96 个注意力头。MoE 部分用了他们称为 Stable LatentMoE 的框架把稀疏度推得很高:896 个专家里每个 token 只激活 16 个,另有 2 个共享专家,latent MoE 维度 3584、每专家隐藏维度 3072——官方说这带来了相对 Kimi K2 约 2.5 倍的整体扩展效率提升。词表 160K,激活函数 SiTU-GLU,视觉编码器是 401M 参数的 MoonViT-V2。量化是这次的一个关键点:从 SFT 阶段起就做量化感知训练,权重用 MXFP4、激活用 MXFP8,以获得更广的硬件兼容性。

能力定位。 模型卡强调三块:长周期编程(在极少人类监督下维持长时间工程会话、在庞大代码库中导航、编排终端工具,从 GPU kernel 优化、编译器开发到带视觉回环的游戏开发、CAD 乃至芯片设计);agentic 知识工作(端到端产出带交互式可视化、组件和仪表盘的深度研究,以及动效设计和视频编辑);以及原生多模态与长上下文。

评测结果。 模型卡给了一张非常长的对照表,对手是 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5 和 GLM-5.2。挑一些代表性的数字:推理与知识方面,GPQA Diamond 93.5(GPT-5.6 Sol 94.1 最高)、AA-LCR 74.7(全场最高)、HLE-Full 43.5/56.0(明显落后于 Claude Fable 5 的 53.3/63.0)。编程方面,Terminal-Bench 2.1 拿到 88.3(与前两名 88.0/88.8 几乎并列)、ProgramBench 77.8(最高)、SWE-Marathon 42.0(最高,远超 GPT-5.5 的 14.0 和 GLM-5.2 的 13.0);但 DeepSWE 67.5 和 FrontierSWE 81.2 都落后于对手的最好成绩。Agentic 方面表现最亮眼:BrowseComp 91.2、DeepSearchQA 95.0、ResearchRubrics 76.2、MCPMark-Verified 94.5、AutomationBench 30.8、τ³-Banking 33.4、Harvey Lab-AA 94.6、CorpFin v2 71.6 都是全场第一;而 GDPval-AA v2(Elo 1686)、AA-Briefcase(Elo 1548)、JobBench、OfficeQA Pro、OSWorld 2.0、Legal Research Bench 等则不及 Claude Fable 5。视觉方面,WorldVQA ForceAnswer 51.0 领先于 GPT-5.6 Sol 的 41.8。

值得称道的是模型卡对评测口径的披露相当细致:明确列出每个 benchmark 用的是哪套 harness(Kimi Code、Claude Code、Codex 或 mini-SWE-agent),哪些分数是从第三方榜单(Artificial Analysis、Vals AI、DeepSWE leaderboard、FrontierSWE 等)引用的,SWE-Marathon 用的是按 H20 重新校准的分支,PostTrainBench 用 H20 而非官方的 H100,甚至坦承 Claude Fable 5 在他们的评测中有 35% 的任务命中了 fallback、可能拉低了其成绩,以及在内部的 Kimi Code Bench 2.0 上各家模型的拒答/fallback 比例。BrowseComp 用了 300K token 触发的上下文压缩策略;如果用完整的 1M 上下文且不做上下文管理,分数是 90.4。

部署与使用。 推荐的推理引擎是 vLLM、SGLang 和 TokenSpeed,各自都有对应的 recipe/cookbook;API 在 platform.kimi.ai 上提供,兼容 OpenAI/Anthropic 格式。使用上有两个重要约束:Kimi K3 始终开启思考,会返回 reasoning_content,思考强度通过顶层的 reasoning_effort 字段控制(low/high/max,默认 max);而且它是在「保留思考历史」模式下训练的——多轮对话和工具调用时必须把 API 返回的完整 assistant 消息原样传回 messages,包括 reasoning_contenttool_calls,而不只是 content。官方推荐的 agent 框架是 Kimi Code CLI。代码仓库和模型权重都采用 Kimi K3 License 发布。

HN 评论精华

这条讨论的走向很有意思:几乎没有人在谈模型能力本身,绝大部分火力集中在「谁能跑得起」「token 会便宜到什么程度」,以及地缘政治。(另外,帖子是在权重正式发布前挂出来的,页面上有个倒计时,于是最热闹的几条讨论串之一居然是在争论日期格式。)

这么大的模型,经济账怎么算

个人和小团队跑不动,这是本帖最普遍的情绪

蒸馏与瘦身:呼声很高

地缘政治与开放权重的意义