Kimi K3 冲击波:2.8 万亿参数的野心,和它背后的三场技术硬仗

  • AI
  • 7月 20, 2026
  • 0 评论

2026 年 7 月 16 日,月之暗面(Moonshot AI)发布了 Kimi K3。2.8 万亿参数、896 专家、1M 上下文、登顶 Arena 前端代码榜——这些数字横扫了科技头条。但比参数更值得解剖的,是这张成绩单背后的三场硬仗:注意力机制的重新设计、残差连接的范式替换、以及超稀疏 MoE 的工程落地。


一、参数拜物教的终结:2.8T 到底意味着什么

先拆一个最容易被误读的数字:2.8 万亿参数

在一个稠密(Dense)模型里,每个 token 激活所有参数,2.8T 意味着推理一次需要 2.8T 次浮点运算——这在物理上不可行。Kimi K3 是 MoE(Mixture-of-Experts)架构,896 个专家网络,每个 token 只激活其中 16 个

这意味着:

指标 数值
总参数 2.8 万亿
每 token 激活专家数 16 / 896
激活参数(等效) ~500 亿
激活率 < 2%

总参数决定了你需要多大的显存来装载模型,激活参数决定了每次推理的计算成本。 两者差距越大,经济账就越好看。K3 的 2% 激活率是当前业界最高的稀疏比之一——前代 K2 的比例约为 3-4%,DeepSeek V4-Pro 约为 5%。

密集参数是基建投资,稀疏激活才是运营成本。K3 的「2.8T」不是噱头,但如果你只看这一个数字,你会完全误解它的经济学。


二、Kimi Delta Attention(KDA):把注意力成本从平方降到线性

2.1 问题

标准 Transformer 的注意力机制复杂度是 O(n²·d)——序列长度 n 翻倍,计算量翻四倍。到了 1M token 上下文,这条曲线变成了一堵墙。

此前的主流解决思路分两条路:

  • 线性注意力(Mamba、Mamba2):用 RNN-style 的状态空间模型替代注意力,大幅降低复杂度,但在长程召回和信息选择性上付出了代价。
  • MLA(Multi-head Latent Attention):DeepSeek 提出的方案,通过低秩压缩降低 KV Cache 体积,但注意力本身仍然是二次复杂度。

2.2 KDA 的核心设计

KDA 走的是第三条路:混合线性注意力 + 细粒度门控机制

它的创新来自一个非常精巧的改动——将 Gated DeltaNet 的标量遗忘门(scalar decay)替换为向量级对角遗忘门(diagonalized gate)

用白话解释:

  • 在标准 DeltaNet 中,每一层的循环状态(recurrent state)的所有通道共享同一个遗忘速率 —— 要么一起记忆,要么一起遗忘。这是一个”粗颗粒度”的操作。
  • KDA 为循环状态中的每一个隐藏维度分配独立的遗忘速率,用 Diag(αt) 表示。某个通道如果携带了关键的长程信息,它可以”拒绝遗忘”;某个通道如果只负责局部上下文,它可以快速刷新。

这个设计在数学上对应 Diagonal-Plus-Low-Rank(DPLR)转移矩阵的一个特化版本。KDA 将其压缩为高效的 chunkwise 并行算法,避免了通用 DPLR 的高计算开销。

2.3 混合策略:3:1 插层

纯线性注意力在长程精确召回上仍然不如全注意力。KDA 的解决方案是层级别混合(layerwise hybrid)

[KDA] [KDA] [KDA] [MLA]  ← 每 4 层一个循环
[KDA] [KDA] [KDA] [MLA]
...

3 层 KDA(线性注意力,高效处理局部结构)+ 1 层 MLA(全注意力,保留全局信息流)。

在 3B 激活 / 48B 总参数的 Kimi Linear 验证模型上,月之暗面对不同的混合比做了消融实验:

混合比 (KDA:MLA) 训练 Loss 验证 Loss 推理开销
7:1 较低 显著变差 最低
3:1 最低 最优 平衡
1:1 中等 接近 3:1 较高
0:1(纯 MLA) 最差 最高

3:1 是帕累托最优点。 3 层 KDA 保证推理效率和长程处理能力,1 层 MLA 兜底精确召回。

2.4 实测收益

月之暗面在 Kimi Linear 技术报告(arXiv:2510.26692)中报告的数据:

  • KV Cache 削减 75%——以 48B 验证模型计
  • 1M 上下文解码吞吐提升 6.3 倍(理论值,经硬件实现验证)
  • 在所有评估任务上匹配或超过全注意力 MLA 基线——包括短上下文、长上下文和 RL 后训练场景
  • 在 48B 模型中实现 H20 GPU 上 prefill 1.72-2.22 倍加速

FlashKDA 内核已开源,提供 chunkwise 并行和高效率 recurrent 两种实现。


三、Attention Residuals(AttnRes):深度方向的注意力革命

3.1 PreNorm 稀释问题

标准 Transformer 使用 PreNorm + 残差连接:

这个设计的问题在于均匀累加——每一层的输出以相同权重累加到总和中。当模型堆叠到上百层时:

  • 隐藏状态(hidden state)持续膨胀
  • 早期层的贡献被稀释到噪声水平
  • 梯度分布在各层间严重不均

这不是一个理论问题,而是已在实际训练中被反复观察到的现象。

3.2 AttnRes:把累加改为检索

月之暗面在 2026 年 3 月发表的论文(arXiv:2603.15031)中提出 Attention Residuals,核心思想:

不要均匀累加,让每一层自己决定从前面的哪些层获取信息。

具体实现:每一层维护一个伪查询向量(pseudo-query vector),对所有前层输出做 softmax 注意力:

这意味着 Layer 3 可以从 Layer 1 提取 60% 的信息,从 Layer 0 只提取 10%——而不是机械地各加一份。

3.3 Block AttnRes:工程化折中

全量 AttnRes 的问题是注意力矩阵的平方复杂度——每个层都要关注所有前层,在 2.8T 参数规模下内存不可接受。

Block AttnRes 的分层策略:

  • 块内(intra-block):使用标准残差连接(保持计算简单)
  • 块间(inter-block):使用 AttnRes 选择性检索

以 K3 的实际配置(约 90+ 层,每 6 层为一块,约 15 个块),复杂度从  降到 ,其中 L 是层数,N 是块数,N << L。

3.4 Scale Law 验证

在 48B 验证模型上的关键数据:

  • Block AttnRes 匹配了使用 1.25 倍计算量的基线模型的 loss——相当于免费获得 25% 的训练效率提升
  • 额外计算开销 < 2%——仅增加一个 RMSNorm 和一个伪查询向量
  • 在 GPQA-Diamond 上提升了 7.5 个点——这是需要跨层推理的复杂任务
  • 训练过程中所有层的输出范数和梯度范数分布更加均匀——PreNorm 稀释问题得到实质缓解

这也是为什么 AttnRes 在 2.8T 规模格外重要:模型越深,收益越大。 在小型模型上边际收益可能不明显,但在 K3 的深度下,它是使训练保持稳定的关键基础设施。


四、Stable LatentMoE:98.2% 稀疏性的工程挑战

4.1 数字的震撼

指标 K3 K2 DeepSeek V4-Pro
总专家数 896 256 256
每 token 激活 16 8 8
激活率 1.79% 3.13% 3.13%
等效激活参数 ~50B ~32B ~37B

K3 的激活率不到 2%,是业界最极端的稀疏比之一。

4.2 高稀疏度的三个核心约束

当激活率压倒性地低时,你面临三个工程问题:

问题 1:路由不稳定。 在极端稀疏下,路由器很容易陷入”富者愈富”的恶性循环——几个专家获得大部分 token,其他专家饿死(dead expert)。传统解决方式是用 auxiliary balancing loss 做负载均衡,但这引入了敏感的超参数和启发式更新。

K3 的解法:Quantile Balancing。 不是通过 loss 惩罚来维持均衡,而是直接从 router-score 的分位数推导专家分配。如果某个 token 的 router score 落入 top-16 分位数,就路由到对应专家。确定性的、无超参数的、保证零死专家。

问题 2:优化不稳定。 MoE 的每个专家参数量巨大,在 896 专家的级别,标准优化器(AdamW)的显存开销不可接受。

K3 的解法:Per-Head Muon。 将 Muon 优化器扩展到每个注意力头独立优化。Muon 本身相比 AdamW 可以减少约 50% 的优化器状态显存;Per-Head 变体进一步增强了适应性。在 2.8T 规模上,这直接决定了训练能否跑通。

问题 3:激活函数在稀疏场景下的退化。 低激活率的专家容易出现 dead neuron 病理——神经元从未被激活,梯度为零,永远无法恢复。

K3 的解法:Sigmoid Tanh Unit(SiTU)。 替代标准的 GeLU / SwiGLU。SiTU 通过 Sigmoid 门控 + Tanh 非线性的组合,在负半轴保持小但非零的梯度,使低激活专家仍然可以学习。

4.3 LatentMoE:先压缩,再路由

标准 MoE 直接将 token 表示送入全量维度做路由。K3 的 Stable LatentMoE 增加了一个压缩步骤:

  1. Latent Projection:将 token 表示投影到低维隐空间
  2. Latent Routing:在隐空间中选择 top-16 专家——计算量大幅降低
  3. Expert Computation:被选中的专家在原始高维空间运行
  4. Unprojection & Combine:专家输出被投影回原始空间,加权组合

这篇设计的核心洞察:路由决策不需要在高维空间做。 隐空间路由的计算成本不足原始路由的 1/50,同时因为隐空间本身已经编码了语义信息,路由质量没有下降。


五、训练和推理:从 QAT 到 Mooncake 的系统级优化

5.1 Quantization-Aware Training(QAT)

大多数模型的量化是后训练量化(PTQ)——先训好 FP16/BF16 模型,再压缩到 INT4/FP8。这通常带来 10-15% 的质量损失。

K3 从 SFT(Supervised Fine-Tuning)阶段开始就采用 QAT——量化感知训练。模型在学习过程中就适应低精度格式,量化误差在网络中自动被补偿。

具体规格:

  • 权重:MXFP4(Microscaling FP4)——每个权重 4 位浮点 + 逐块缩放因子。Blackwell GPU 和 AMD MI400 原生支持
  • 激活值:MXFP8(8 位浮点)
  • 完整模型权重约 1.4TB——而 FP16 需要约 5.6TB,4 倍压缩

这意味着什么?一个 8 节点(64x H100/B200)的集群可以实际装载和运行 K3。如果没有 QAT,128 卡都困难。

5.2 平衡的 Expert-Parallel 训练

896 专家 + 激活率不到 2% 的组合在分布式训练中制造了一个独特的瓶颈:专家不均衡导致某些设备成为 straggler。

K3 的训练方案引入了 Fully Balanced Expert-Parallel

  • 静态形状(static shapes):每设备分配的专家数量在训练过程中保持不变
  • 无需主机同步(no host sync on critical path):避免同步屏障带来的通信开销

5.3 Mooncake 分离式推理架构

K3 的 API 定价能做到缓存命中 $0.30/百万 token 输入,背后是月之暗面的 Mooncake 基础设施:

  • 分离 Prefill 和 Decode:分属不同的节点池,各自独立扩缩
  • KDA Prefix Caching:KDA 的线性注意力机制对传统 prefix caching 提出了新挑战,月之暗面为 vLLM 社区贡献了适配实现
  • 编程场景缓存命中率 > 90%:得益于编程提示词的高度可复用性

六、Benchmark 拆解:K3 到底比谁强,强在哪里

K3 的 benchmark 数据最好的解读是:它不是全科全能冠军,但在最硬的几个科目上,它把差距缩小到了几乎可忽略的程度。

6.1 与 Claude Fable 5 的对阵

在月之暗面公布的 14 个共享 benchmark 中:

类别 K3 胜 Fable 5 胜
Coding SWE Marathon (+7.0)、Terminal-Bench 2.1 (+3.7)、Program Bench (+1.0) FrontierSWE (+5.4)、DeepSWE (+2.5)、Kimi Code Bench 2.0 (+4.0)
Knowledge/Agent BrowseComp (+3.2)、Automation Bench (+1.7)、SpreadsheetBench 2 (+0.1) GDPval-AA (+92 Elo)、JobBench (+4.5)、AA-Briefcase (+35 Elo)
Visual Reasoning CharXiv、HLE-Full

比分 8:6,Fable 5 领先。 但 Fable 5 领先幅度最大的是知识工作(GDPval +92 Elo),而 K3 领先幅度最大的是长程编程(SWE Marathon +7.0)——这恰恰是 K3 定位的核心场景。

6.2 与 GPT-5.6 Sol 的对阵

Benchmark K3 GPT-5.6 Sol Leader
Terminal-Bench 2.1 88.3 88.8 Sol +0.5
DeepSWE 67.5 73.0 Sol +5.5
FrontierSWE 81.2 71.3 K3 +9.9
BrowseComp 91.2 90.4 K3 +0.8
GPQA Diamond 93.5 94.6 Sol +1.1

最引人注目的差距在 FrontierSWE——这是目前最难的软件工程 benchmark 之一,需要模型在 20 小时内完成开放式实现、性能优化和研究任务。K3 以 81.2 的 dominance score 领先 Sol 近 10 个点(81.2 vs 71.3),这是 K3 在所有公开对比中差距最大的一场胜利。

6.3 社区投票的权威性:Arena Frontend Code #1

Arena 的 Frontend Code Arena 不是厂商自报分数,而是 数千次盲测中的人类偏好投票。K3 以 1,679 分登顶,在 7 个前端子域中拿下 6 个第一,将 Claude Fable 5 挤到次席。

从 K2.6 的第 18 名到 K3 的第 1 名——17 位的跃升是月之暗面从 “规模跟随者” 到 “架构设计者” 转型的最有力注脚。 这不是仅靠堆参数能实现的。


七、Demo 超越 Benchmark:自举式芯片设计的象征意义

Benchmark 是可操作的,但 Demo 往往是信号。K3 最令人印象深刻的演示不是排行榜,而是它设计了一颗芯片

K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,为一个基于自身架构的 nano 模型完成了芯片设计、优化与验证,连续自主运行 48 小时,最终实现时序收敛(timing closure),仿真解码吞吐超过每秒 8,700 token。

另一个案例:K3 被要求优化自己的 AttnRes 训练内核。在 15 小时内,它设计了全新的两相内核算法、融合内核同时保持数值精度、将前向+反向时间从 283.6ms 降至 114.4ms——这是一个模型在自我优化。

这些案例的共同模式是长时间(小时级)、多步骤(数百步)、自纠正(遇到错误自己定位修复)——这正是 Agent 场景的核心特征。而行业此前最大的痛点是:大多数模型在几分钟后就开始丢方向。

K3 为什么能做到

这与架构直接相关:

  • 1M 上下文窗口 + KDA 使模型能保持整个工作过程的历史
  • Attention Residuals 允许深层持续回调早期信息,不会”忘了开头说过什么”
  • ~50B 活跃参数提供了充裕的推理容量

八、定价策略:从”价格屠夫”到”价值竞争”

8.1 告别白牌定价

K3 的 API 定价标志着中国大模型定价策略的历史性转折:

模型 输入(/M token) 输出(/M token) 缓存命中
Kimi K3 $3 $15 $0.30
GPT-5.6 Sol $5 $30
Claude Fable 5 $10 $50
Claude Opus 4.8 $5 $25
Kimi K2.6 ~$0.6 ~$3.5

输出价格是 K2.6 的约 4 倍。月之暗面在战术上做出了明确选择:脱离低价内卷,进入前沿模型的定价区间。

仍然比 Fable 5 便宜 70%,比 Sol 便宜 50%。但不再用”中国模型 = 白牌”的定位来获客。

8.2 上下文分层定价

另一个值得关注的变化:K3 的 1M 上下文不完全是全量开放的。

  • Moderato 用户:256K
  • Allegretto 及以上:1M

把上下文长度做成会员权益,在行业里还比较少见。这说明月之暗面清楚长上下文的推理成本高,不打算在免费层无限承受。

8.3 对闭源估值的影响

Anthropic 的推理毛利率长期在 75% 以上,这是其万亿美元估值想象空间的核心支柱。当开源模型以接近的性能、远低的价格进入市场时,这根柱子的根基开始松动。

K3 并不是第一个挑战闭源的——DeepSeek R1 在年初就证明了”开源可以追平前沿”。但 K3 的不同在于:

  1. 它是参数规模的代差级领先(2.8T vs 闭源估计的 100-200B 稠密)
  2. 它在最硬的 benchmark(代码、Agent)上做到了头对头接近
  3. 它的开源权重即将发布——比 R1 更接近前沿

九、7 月 27 日:真正的考试

截至本文写作时,K3 的开源权重仍未发布(承诺 7 月 27 日前)。这意味着当前所有人的判断都存在两个不确定因素:

  1. License 条款:”开源权重”的范围从 Apache-2.0 到带有商业限制的定制许可证。Moonshot 之前的 K2 采用 Modified MIT,K3 尚未公布。
  2. 权重的实际内容:API 端的多模态能力是否完全包含在发布权重中?图像/视频理解是否端到端集成?
  3. 社区复现:独立第三方能否复现月之暗面报告的 benchmark 分数(尤其是 FrontierSWE 和 Terminal-Bench 2.1)?

部署要求方面,K3 推荐在 64 卡以上超节点运行。即使经过 MXFP4 量化,完整模型仍需约 1.4TB 显存。这意味着开源不等于可自由运行——能够实际部署 K3 的组织不会很多,量化版本的社区产出将是关键。

但即便如此,K3 的架构成果已经超越了”又一个开源模型”的范畴:KDA、AttnRes、Stable LatentMoE 三项技术中的任何一项单独发表,都是一篇顶会论文的体量。而月之暗面在一次发布中同时交付了这三项,并附带了 FlashKDA 内核、vLLM KDA Prefix Caching 等工程产出的开源。


十、结语:K3 的坐标

2025 年 1 月,DeepSeek R1 证明了中国 AI 能在算力受限下追上前沿。

2026 年 7 月,K3 证明了更有分量的另一件事:中国 AI 不仅能追,还能在架构层面提出原创方案。

KDA 不是对 Mamba 或 MLA 的简单复现;AttnRes 不是对残差连接的微调;Stable LatentMoE 的 Quantile Balancing 不是常规的 auxiliary loss。这三项创新都是解决问题的第一性原理方法,而不是增量式的局部 patch。

从市场信号来看:

  • 美股费城半导体指数在 K3 发布后连续三日下跌,较 6 月 22 日高点跌逾 20%
  • Apple 超越 Nvidia 成为全球市值最高公司——市场在重新定价”算力稀缺性”的叙事
  • “都怪 KIMI” 成为 WallStreetBets 的热门标签——调侃但指向真实的市场焦虑

但 K3 也并非没有代价。62 TPS 的输出速度低于同档中位数 72 TPS。始终开启的 Max 思考模式推高了实际 token 消耗。缓存保留时间只有 10 分钟可能来自 KDA 快照缓存的架构特性。指令模糊时”过于主动”的行为边界尚不稳定。

K3 是一颗信号弹,不是终点。它照亮的方向是:规模法则没有失效,它在以新的形式生效。 更大参数、更复杂架构、更长上下文、更强的 Agent 能力——这些方向仍然在手握原创技术的人手中继续演进。

7 月 27 日权重发布之后,我们才能真正知道 K3 的完整面貌。但即使只看 7 月 16 日至今的量产版表现,也可以确定一件事:

中国 AI 竞争的故事已经从 “追赶” 翻到了新的一章。

u2

Related Posts

当AI开始吃自己:数据污染正在成为大模型行业最隐秘的危机

当整个互联网的知识产出越来越依靠AI,人类还有能力持续生产「干净的」数据吗?

Read more

  • AI
  • 6月 21, 2026
  • 235 views
封禁Fable 5:当美国政府成为AI的”守门人”

到今天,6月21日,Fable 5仍未恢复。而今天是免费窗口的最后一天。

Read more

发表回复

You Missed

Kimi K3 冲击波:2.8 万亿参数的野心,和它背后的三场技术硬仗

  • u2
  • 7月 20, 2026
  • 52 views

Anthropic 指控阿里蒸馏攻击:AI 军备竞赛的拐点

  • u2
  • 6月 25, 2026
  • 141 views

当AI开始吃自己:数据污染正在成为大模型行业最隐秘的危机

  • u2
  • 6月 25, 2026
  • 171 views

Google 用 AI「杀死」Google

  • u2
  • 6月 22, 2026
  • 163 views

封禁Fable 5:当美国政府成为AI的”守门人”

  • u2
  • 6月 21, 2026
  • 235 views

27亿美元没留住的人,奥特曼等了十年

  • u2
  • 6月 19, 2026
  • 175 views