Kimi K3:开放的前沿智能
文章摘要
月之暗面(Moonshot AI)发布了最新一代模型 Kimi K3,号称是”全球首个开放权重的 3 万亿参数级别模型”,总参数量达 2.8T。它面向长周期编程、专业知识工作和复杂推理等高难度任务,原生支持视觉理解,并提供高达 100 万 token 的上下文窗口。
在架构层面,K3 引入了多项新设计:Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes)作为核心组件,采用 Stable LatentMoE 结构,从 896 个专家中激活约 16 个。官方称这套架构相比 Kimi K2 实现了约 2.5 倍的整体扩展效率提升,同时还配套了用于专家分配的 Quantile Balancing、Per-Head Muon 优化器以及 Sigmoid Tanh 激活单元等改进。
在性能方面,月之暗面坦承 K3 整体上仍落后于最强的闭源模型(Claude Fable 5 和 GPT 5.6 Sol),但宣称在其评测套件中达到了前沿水平,通常优于其它参与对比的模型。具体能力包括:编程上完成了 GPU kernel 优化,并独立开发出一个类 Triton 的完整编译器 MiniTriton,在部分基准上可与 Triton 比肩;知识工作上擅长生成交互式研究可视化(含动态图表和动画的金融分析、科学报告);多模态上统一处理文本、图像、视频,可用于视频编辑、游戏开发和视觉设计;科研上曾把一项原本需要 1-2 周的天体物理计算工作压缩到约 2 小时完成。
价格方面,API 定价为缓存命中输入 $0.30/百万 token、未命中输入 $3.00、输出 $15.00。官方也披露了两个局限:一是对”思考历史”敏感,若历史思考内容未被妥善保留,生成会不稳定;二是”过度主动”,执行任务时偶尔会超出用户明确意图自作主张。
HN 评论精华
-
Tiberium 指出这个 $3/$15(缓存 $0.3)的定价对一个中国开源权重模型来说”极高”,恰好是 Anthropic Sonnet 系列的 1:1 定价,也很接近 GPT 5.6 Terra。但他强调真正决定成本的是推理效率:如果 Sol 用 1 万思考 token 完成的事情 K3 要用 5 万,那即便单价更低,实际成本也可能更高。
-
dghlsakjg 和多位用户认为 K3 真正的竞争对手是 GLM,而 GLM 5.2 的价格还不到 K3 的三分之一。但 asenna 反驳说以这个定价,K3 根本不是在跟 GLM 竞争。InsideOutSanta 从实测角度补充:GLM 5.2 虽好,但明显不如 Opus 4.8 或 GPT-5.5,而 K3 已经和 Fable、Sol 处在同一档次,两者不在一个水平线上。
-
leecommamichael 做了重要的技术澄清:分词器(tokenizer)定义的是模型训练所用的”字母表”,它不是可以随意替换的独立模块,字母表大小是与训练数据编码方式相关的设计考量。围绕”按 token 计价难以横向比较”,众人提出了替代方案——按字节计价、按标准英文页计价,甚至借鉴 bits-per-byte 作为损失指标的做法。
-
cmrdporcupine 提出一个反直觉的实战观点:GLM 虽然单价便宜,但因为 token 效率低,包月订阅下实际并不划算,很难比 Codex 更省。他的结论是——只要不是按 token 付费,Anthropic 和 OpenAI 的包月编程套餐目前仍是性价比最优选择,开源权重模型没有成本上的理由。
-
easygenes 反驳”补贴论”,认为这次定价只是按能力定价(K3 是迄今最大、服务成本最高、能力最强的开源权重模型),并主张推理的实际运营 TCO 比人们想象的低、API 利润率很高。csomar 则持相反态度,认为补贴时代正在结束,各家会先在 API 定价上收敛,订阅价随后跟进。
-
hedora 提出一个价值观层面的担忧:他反感 Claude 频繁误报安全护栏(把普通请求误判为生物或安全研究),认为支持这种”由中央权威决定哪些知识探索被允许”的工具在伦理上有问题,并借此追问 K3 是否也有类似过度敏感的护栏。