Kimi-K3 登陆 HuggingFace
文章摘要
月之暗面(Moonshot AI)在 HuggingFace 上放出了 Kimi K3 的开放权重。按照模型卡的描述,这是一个原生多模态的 agentic 模型,也是他们至今最强的模型:2.8T 总参数、激活参数 104B,构建在 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)之上,具备原生视觉能力和 100 万 token 的上下文窗口。模型卡称它是「世界上第一个开放的 3T 级模型」。
架构细节。 混合专家(MoE)架构,93 层(其中 1 层 dense),注意力层由 69 层 KDA 加 24 层 Gated MLA 组成,注意力隐藏维度 7168、96 个注意力头。MoE 部分用了他们称为 Stable LatentMoE 的框架把稀疏度推得很高:896 个专家里每个 token 只激活 16 个,另有 2 个共享专家,latent MoE 维度 3584、每专家隐藏维度 3072——官方说这带来了相对 Kimi K2 约 2.5 倍的整体扩展效率提升。词表 160K,激活函数 SiTU-GLU,视觉编码器是 401M 参数的 MoonViT-V2。量化是这次的一个关键点:从 SFT 阶段起就做量化感知训练,权重用 MXFP4、激活用 MXFP8,以获得更广的硬件兼容性。
能力定位。 模型卡强调三块:长周期编程(在极少人类监督下维持长时间工程会话、在庞大代码库中导航、编排终端工具,从 GPU kernel 优化、编译器开发到带视觉回环的游戏开发、CAD 乃至芯片设计);agentic 知识工作(端到端产出带交互式可视化、组件和仪表盘的深度研究,以及动效设计和视频编辑);以及原生多模态与长上下文。
评测结果。 模型卡给了一张非常长的对照表,对手是 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5 和 GLM-5.2。挑一些代表性的数字:推理与知识方面,GPQA Diamond 93.5(GPT-5.6 Sol 94.1 最高)、AA-LCR 74.7(全场最高)、HLE-Full 43.5/56.0(明显落后于 Claude Fable 5 的 53.3/63.0)。编程方面,Terminal-Bench 2.1 拿到 88.3(与前两名 88.0/88.8 几乎并列)、ProgramBench 77.8(最高)、SWE-Marathon 42.0(最高,远超 GPT-5.5 的 14.0 和 GLM-5.2 的 13.0);但 DeepSWE 67.5 和 FrontierSWE 81.2 都落后于对手的最好成绩。Agentic 方面表现最亮眼:BrowseComp 91.2、DeepSearchQA 95.0、ResearchRubrics 76.2、MCPMark-Verified 94.5、AutomationBench 30.8、τ³-Banking 33.4、Harvey Lab-AA 94.6、CorpFin v2 71.6 都是全场第一;而 GDPval-AA v2(Elo 1686)、AA-Briefcase(Elo 1548)、JobBench、OfficeQA Pro、OSWorld 2.0、Legal Research Bench 等则不及 Claude Fable 5。视觉方面,WorldVQA ForceAnswer 51.0 领先于 GPT-5.6 Sol 的 41.8。
值得称道的是模型卡对评测口径的披露相当细致:明确列出每个 benchmark 用的是哪套 harness(Kimi Code、Claude Code、Codex 或 mini-SWE-agent),哪些分数是从第三方榜单(Artificial Analysis、Vals AI、DeepSWE leaderboard、FrontierSWE 等)引用的,SWE-Marathon 用的是按 H20 重新校准的分支,PostTrainBench 用 H20 而非官方的 H100,甚至坦承 Claude Fable 5 在他们的评测中有 35% 的任务命中了 fallback、可能拉低了其成绩,以及在内部的 Kimi Code Bench 2.0 上各家模型的拒答/fallback 比例。BrowseComp 用了 300K token 触发的上下文压缩策略;如果用完整的 1M 上下文且不做上下文管理,分数是 90.4。
部署与使用。 推荐的推理引擎是 vLLM、SGLang 和 TokenSpeed,各自都有对应的 recipe/cookbook;API 在 platform.kimi.ai 上提供,兼容 OpenAI/Anthropic 格式。使用上有两个重要约束:Kimi K3 始终开启思考,会返回 reasoning_content,思考强度通过顶层的 reasoning_effort 字段控制(low/high/max,默认 max);而且它是在「保留思考历史」模式下训练的——多轮对话和工具调用时必须把 API 返回的完整 assistant 消息原样传回 messages,包括 reasoning_content 和 tool_calls,而不只是 content。官方推荐的 agent 框架是 Kimi Code CLI。代码仓库和模型权重都采用 Kimi K3 License 发布。
HN 评论精华
这条讨论的走向很有意思:几乎没有人在谈模型能力本身,绝大部分火力集中在「谁能跑得起」「token 会便宜到什么程度」,以及地缘政治。(另外,帖子是在权重正式发布前挂出来的,页面上有个倒计时,于是最热闹的几条讨论串之一居然是在争论日期格式。)
这么大的模型,经济账怎么算
- NitpickLawyer(196 条子回复的起点,全帖信息量最大的一条):这次发布有几个看点。首先,第三方服务商最终把价格定在哪个中位数,会告诉我们服务一个 3T 模型的真实成本。因为是 MXFP4 原生,托管它大约需要 1.5TB 显存,「刚刚好卡在 8 张 B200 的极限上(但现实中为了上下文和吞吐优化你需要 16 张)」。托管不便宜,但至少我们能拿到一个 3T 模型的 $/MTok 区间,从而推测「各大实验室是否在补贴 API token 价格」。其次是微调这头巨兽要花多大力气——最新的 AISI 网络安全评测把它排在 GLM-5.2 之上,但仍远落后于闭源 SotA。第三是会不会有人做真正的蒸馏(训练完整分布)把它蒸进小模型。
- dist-epoch 引用 SemiAnalysis 的估算反驳「补贴论」:Anthropic 当前的混合毛利率已升至 60% 中段,API 业务毛利率超过 80%。「当然,还是会有人坚持说『他们在撒谎』『众所周知他们补贴 API 定价』。」
- woctordho 从微调角度补充:目前常见做法是在 bnb 4-bit 基座上做 LoRA,但他认为该把 bnb 换成 GGUF 作为基座格式了,因为 GGUF 在积极支持新架构和更激进的量化;他给了个 PoC,能在 16 GiB 显存里微调 Qwen3.5-35B-A3B、在 90 GiB 里微调 DeepSeek-V4-Flash,且不需要 CPU offload。
- gorgmah 提供了价格下行的实证:GLM 5.2 自 6 月 16 日发布以来价格已降约 45%,而且看起来还没触底。他的经济学分析是:一般认为服务商不该定价低于边际成本,对他们来说边际成本大致就是电费,因为很多数据中心的显卡并未满载。「我猜很快就会有人以低于电费 + 显卡折旧的价格卖 token。」markasoftware 对 45% 这个数字表示怀疑:OpenRouter 上便宜的服务商是 fp4 而官方 z.ai 是 fp8,少数便宜的 fp8(比如 novita)看起来像临时促销。teruakohatu 给了个阴暗的猜测:「我猜他们把 token 卖给你,然后把你的 token(数据)再卖给别人。」
- m00dy:「围绕这个模型会有很多竞争。看看 AI 服务商愿意把价格压到多低。」Iolaum 提出前提:「只要他们对自己服务的是哪个量化版本、以及做了哪些影响推理质量的优化保持透明。」torginus 更悲观:结果可能令人失望,服务商要盈利、又用着和大家一样的商品化硬件,「我不会惊讶于他们开始在不告诉用户的情况下,用能力大幅下降的糟糕量化版本换取更低价格」。
个人和小团队跑不动,这是本帖最普遍的情绪
- KronisLV(57 条子回复):「我觉得大多数能跑 LLM 的硬件对个人来说形状是错的。」要么是靠统一内存艰难地跑出 5-10 tokens/s,要么是几百 GB 显存、功耗超过一千瓦的数据中心卡。「似乎不存在那种 180W-250W TDP、配 128GB 或 256GB 显存的准专业级 GPU(可以做梦嘛)。」他明确表示没人会在家里跑 Kimi K3,但能以 ~100 tokens/s 跑 GLM 5.2 就很好了。
- walrus01 用实测数据佐证:他想跑的那些「基本没损失什么」的 Q8 大模型,都装不进那些「只要 3995 美元!」的 128GB 内存机器,加上可用的上下文更不可能——Qwen 3.5 122B Q8、deepseek v4 flash Q8 这类需要 170-190GB。
- efficax 对「这是把强大智能交到大众手中」的说法泼冷水:「我不确定大众能不能负担得起跑这玩意需要的 50 万美元 GPU。」
- martindelophy:「显存、电力、网络和运维要求,把它放在了很多企业的能力范围之外。」
- khanhnguyen8386 贡献了最好笑的一条:「等不及要在我的 CPU 上以 0.02 tokens/秒跑它了,这样我下个月就能及时收到回复。」mattstir 认真回复:现代消费级 CPU 恐怕物理上都寻址不了足够的内存来加载这个模型。
- pmg1991 担心 HuggingFace 会被下载洪峰打垮。someguyornotidk 提议:「对这种巨型模型,唯一合理的托管方式是种子。我不理解 hf 为什么不提供这个选项。Linux 发行版就做对了:HTTP 和 Torrent 都给,让用户自己选。」Havoc 则认为纯粹因为体积太大,下载量反而会很小。thundergolfer(Modal 工程师)出面说:让模型跑起来相当有挑战,但现在已经可以通过 Modal Endpoints 用上了。
蒸馏与瘦身:呼声很高
- docheinestages:鉴于 Kimi K3 达到了前沿水平,有没有可能把核心能力(基础推理和工具调用)抽取到一个消费级设备能跑的小模型里?考虑到它是 MoE 架构,也许能做某种「外科手术」。「我认为一个不在权重里存领域知识或事实、但在给定正确上下文时能准确推理该做什么、该用哪个工具的小模型,非常有价值。」
- snemvalts 的类比很到位:「『我想要一辆时速 300 英里同时百公里油耗极低的车。我知道有辆车油耗很低,但它极慢。』你描述的是根本性的权衡取舍。让模型在给定规模和训练 token 量下获得更多性能,正是所有实验室在解决的问题。」
- leobg 给了实操路径:用商业 API 生成人工数据集,再去微调小模型。「我用这种方式让 7B 模型在单领域任务上(包括推理和工具调用)都取得了成功。你可以用开放模型,重点只是把推理外包出去,这样你不用自己去跑大模型。」
- rs38 问是否有现实的办法蒸馏出 ~200B 和 ~20B 两个消费硬件友好的版本,「Qwen 做到了,但第三方(比如 unsloth)可能吗?」embedding-shape:能,最难的部分是搞到硬件来生成训练轨迹,越过这个坎之后没什么能拦住你。
地缘政治与开放权重的意义
- davidkunz:「这是历史性的。开放权重 LLM 第一次站到了最顶端。我们自己跑不了,但很多服务商可以。」embedding-shape 提出异议:这份荣誉大概属于 OpenAI——GPT-2(甚至 GPT-1)发布时确实就是当时生态里的 SotA。
- padolsey:「这件事回不去了。这是把一个非常强大的智能交到大众手里。美国的私营公司渴望特朗普的保护主义,但那不会有用。跑它所需的硬件当然是高不可攀的,但把它放出来这个动作本身,感觉像是人类的『把 RSA 源码印在 T 恤上』时刻。」edot 补充了一个有意思的产业观察:幸运的是美国的私营公司希望这不被禁——英伟达、微软等刚发了那封联名信。「我们被那些出于自身利益行事的万亿美元公司(托管商和硬件商),从另一些万亿美元公司(OpenAI、Anthropic)手里救了下来。」
- throwaw12 半开玩笑:「奇怪的共产主义者,把这么贵的模型白送给公众。」他更关心 1bit 量化——如果基准测试表现依然很好,对 GPU 托管商来说是天大的好消息,能「以 Haiku 4.5 的成本提供 Opus 4.5 级别的模型」。supjeff 给出反面解读:中国发布这些东西更多是关于声望——美国的出口管制让向中国出售英伟达芯片非法,而这是中国在说「随你便」;同时它削弱西方科技公司在 AI 上的地位,并潜移默化地推广 CCP 的偏见。「把你的产品/公司建在一个在所有问题上都倾向 CCP 立场的文本生成模型之上,就是宣传的巅峰。」
- maelito 问有没有人做过审查和政治偏见测试。walrus01 提供了单人样本的轶事:几个人发布的 Qwen 3.5-122、3.6-27B 和 3.6-35B-A3B 的「heretic」去审查 Q8 GGUF 变体,非常乐意讨论几乎任何 CCP 讨厌的话题,包括很多如果用中文发在中国国内互联网上会让你进监狱的内容。esperent 反问:除了让它谈天安门,究竟有没有标准的「偏见」测试?如果有,是谁做的、他们自己的偏见是什么?
- elo02 提出了一个所有人都在想的问题(18 条子回复):「听说这是最近城里的热门话题。为什么 Meta 跟不上?资源多一千万倍,你会以为他们能拿出至少同样好的开放权重模型。」teruakohatu 的回答很冷静:「在当下这个时点,Meta 从发布开放权重模型里能得到什么?为什么要为此投入资源。」walrus01 的愤世嫉俗版本:「如果他们没把 800 亿美元砸在造 Metaverse VR 世界上,也许现在会走得更远。我从没见过任何真正在用它的人。……这不算是对美元和我们这代最优秀头脑的工时的最佳使用方式。」
- rvz 贡献了最热血也最有争议的一条:「这(真的)是 AGI,惠及全人类且零守门。现在美国政府还有 5 小时来(试图)阻止这次发布(并拯救 Anthropic)。让竞争走完它的进程,让市场——而不是政府——决定谁输谁赢。」
- seydor 给了个财务角度的短评:「幸好 OpenAI 和 Anthropic 还没 IPO。或者说,对某些人来说这很糟糕。」