3 分钟看懂 Kimi K3:2.8T 参数,为何每个 Token 只激活 104B?

一句话概括:Kimi K3 并不是简单地把模型“堆到 2.8T”,而是同时改造了信息在长序列、深网络和超宽 MoE 中的流动方式,再用稀疏激活把巨大的模型容量与单次计算量分开。
看到 Kimi K3 的技术报告,最抓眼球的通常是三组数字:2.8T 总参数、104B 激活参数、1M 上下文窗口。
它们很容易引出两种相反的误解:一种是“2.8T 参数,每次推理一定重得惊人”;另一种是“每个 token 只激活 104B,所以它本质上就是一个 104B 模型”。两种说法都不准确。
Kimi K3 真正值得读的地方,不只是参数规模,而是它把大模型的信息流拆成了三个方向:
沿序列方向流动:怎样处理最长 100 万 token,而不让注意力成本完全失控?
沿网络深度流动:模型加深到 93 层后,后面的层怎样直接找到前面真正有用的表示?
沿模型宽度流动:怎样把专家池扩到 896 个,又不让每个 token 把所有专家都跑一遍?
对应的三个答案分别是 Kimi Delta Attention(KDA)、Attention Residuals(AttnRes) 和 Stable LatentMoE。理解这三条主线,也就理解了 Kimi K3 的架构逻辑。

图 1:Kimi K3 总体架构。右侧是 3 个 KDA 层与 1 个 Gated MLA 层交替组成的主干;红色连线表示跨深度的信息选择;左上是共享专家与路由专家组成的 Stable LatentMoE。原图来自论文 Figure 2。
先用 3 分钟记住结论
如果只想带走最关键的内容,可以记住下面四点:
Kimi K3 是原生多模态 MoE 模型。论文表格给出的精确规模是 2.78T 总参数、104.2B 激活参数,共 93 层,训练上下文长度为 1M。
长序列靠混合注意力。每个基本块由 3 层 KDA 加 1 层 Gated MLA 组成:KDA 负责大部分高效的长序列混合,周期性的 MLA 负责补充全局交互。
深网络靠 AttnRes。普通残差连接把历史逐层压进一个状态;AttnRes 允许当前层对更早的层表示进行有选择的读取。
超宽模型靠稀疏 MoE。每个 token 不访问 896 个路由专家,而是选择其中 16 个;两个共享专家则负责通用变换。
这四点合在一起,才构成论文所谓的“沿序列长度、网络深度和模型宽度扩展信息流”。
2.8T 参数与 104B 激活参数,究竟是什么关系?
先把最容易混淆的问题讲清楚。
2.78T 总参数,指模型完整拥有的参数总量。它包含注意力层、视觉编码器、共享专家,以及分布在各层的大量路由专家。部署完整模型时,这些权重仍然需要被保存,并通常要分布到多台设备上。
104.2B 激活参数,指处理一个 token 时,实际参与这次前向计算的参数量。由于 MoE 的路由器只为该 token 选择少数专家,其余专家虽然属于模型,却不会参与这个 token 的计算。
可以把它想象成一所拥有 896 位专科医生的超级医院:
医院的“总能力”来自全部医生,对应 2.78T 总参数;
一位患者不会同时找遍所有医生,而是被分诊给 16 位相关专家;
公共检查和基础科室仍然要经过,对应注意力、共享专家和投影等通用路径。
因此,下面两个比例不能画等号:
16 ÷ 896 ≈ 1.79%,而 104.2B ÷ 2.78T ≈ 3.75%
前者只是“被选中的路由专家比例”,后者才是论文口径下的“单 token 激活参数占总参数比例”。后者更高,是因为一个 token 除了经过 16 个路由专家,还要经过注意力层、两个共享专家、路由与升降维投影等路径。
反过来看,2.78T 与 104.2B 相差约 26.7 倍。这说明 MoE 把模型可以容纳的知识容量与每个 token 实际承担的计算量部分解耦了。
但这里还有一句非常重要的限制:“激活 104B”不代表它就是一个普通的 104B 稠密模型。完整的 2.78T 权重仍需存储和调度;跨设备专家路由会引入通信成本;实际速度还取决于批量大小、专家负载是否均衡、缓存和内核实现。稀疏激活降低的是单 token 的主要计算量,不是把模型的存储和系统复杂度一起缩成 104B。

图 2:论文给出的 Kimi K2 与 Kimi K3 架构对比。Kimi K3 从 61 层增至 93 层,路由专家从 384 个增至 896 个,每 token 激活专家从 8 个增至 16 个,上下文长度从 128K 增至 1M。原图来自论文 Table 1。
第一条主线:长序列不是只靠“把窗口改成 1M”
标准全注意力需要比较大量 token 对。序列越长,计算和 KV 缓存压力越大;当上下文走向 100 万 token,单纯沿用每层全注意力会非常昂贵。
Kimi K3 的做法是混合两类机制:
KDA采用带遗忘门的递归状态来持续吸收序列信息,并支持分块并行计算,承担大部分长上下文 token 混合;
Gated MLA保留高容量的全局注意力交互,避免模型只靠压缩状态处理所有历史。
论文采用固定的 3:1 配比:每 3 个 KDA 层后接 1 个 Gated MLA 层,并在主干末尾再放置一个 Gated MLA 层,确保最终层能够进行全局交互。表 1 中的总构成为 69 个 KDA 层与 24 个 MLA 层。
直观地说,KDA 像持续更新的工作笔记,适合低成本地把很长的过程向后传递;周期性的 MLA 则像回到完整档案室重新检索,负责纠正“只看笔记”可能造成的信息损失。Kimi K3 不是在线性注意力和全注意力之间二选一,而是让它们分工。
KDA 还有一个很工程化、但很关键的改动:论文把对数衰减限制在下界之上。这样做不只是为了数学形式更漂亮,而是为了避免分块计算中的倒数衰减无限增大,使原本需要逐位置处理的对角块也能使用稠密 Tensor Core 矩阵乘法。

图 3:Kimi K3 将 KDA 的对数衰减限制在下界之上,使所有因果分块都能转为稠密 Tensor Core 矩阵乘法。原图来自论文 Figure 3。
所以,“支持 1M 上下文”背后至少包含三层含义:架构上用 KDA 降低大部分长序列混合成本,用周期性 MLA 保留全局交互,系统上再为 KDA 状态、前缀缓存和长请求调度专门优化。窗口数字只是结果,不是方法本身。
第二条主线:模型变深后,不能只靠逐层传话
Kimi K3 有 93 层,比 Kimi K2 的 61 层增加了 52%。网络加深能够提供更多变换步骤,却也会暴露普通残差连接的局限。
传统残差网络大体是在做这样的事:每一层都把自己的输出加进当前隐藏状态,再交给下一层。走到很深的位置时,前面所有信息已经被不断累加、压缩进同一个状态。后层能拿到历史,却很难直接表达“我现在最需要第 7 层和第 42 层的表示,而不是所有历史的平均混合”。
AttnRes 把注意力思想从“序列位置”搬到了“网络深度”:
在普通注意力里,当前 token 从前面的 token 中选择信息;
在 AttnRes 里,当前层从前面的层表示中选择信息。
它为每层学习一个伪查询,对较早的层输出计算权重,再按需汇总。图 1 右侧从早期 Block 和 Embedding 指向后层的红色线,就是这条跨深度的信息通路。
如果保存所有层输出,内存和跨流水线通信会增加。论文因此采用 Block AttnRes:先把相邻层组织成块,只在块间保留可检索的表示,块内继续做局部累加。Kimi K3 使用约 12 层一个块的划分,并将嵌入表示也作为可访问来源,从而把需要保留的信息从“每一层一份”压缩为“每个块一份”。
这个设计的价值不是让网络无条件记住更多,而是让后层拥有选择历史表示的权利。对深模型而言,信息能否被准确取回,和信息能否继续向前传播同样重要。
第三条主线:896 个专家,为什么不会把计算量一起放大 896 倍?
MoE 的基本逻辑是“用很多专家扩充容量,用路由控制每次实际计算”。Kimi K3 把路由专家池扩展到 896 个,每个 token 选择 16 个,同时设置 2 个共享专家。
但专家数量大幅增加后,会出现三个现实问题:
路由专家若直接处理完整的 7168 维隐藏状态,专家越多、每 token 选得越多,通信与权重读取越重;
极稀疏路由可能让少数热门专家过载,另一些专家长期吃不到 token;
多层矩阵乘法串联后,内部激活值可能爆炸,2.8T 规模下更难稳定训练。
Stable LatentMoE 对这三个问题分别下手。
首先,共享专家保留完整宽度,路由专家进入较窄的潜在空间。Kimi K3 的主隐藏维度是 7168,而 Latent MoE 维度是 3584,相当于一半。常见能力走两个全宽共享专家,专门能力在较窄空间里分发给 16 个路由专家,之后再投影回主干维度。这样才能在专家池扩大时控制通信和权重流量。
其次,论文在路由分支加入 RMSNorm,并使用有界的 SiTU-GLU 抑制大激活值,降低低精度训练中的溢出风险。
最后,Kimi K3 使用 Quantile Balancing(分位数均衡)调整专家偏置。它根据路由分数的分位点,把负载向目标值拉齐,避免热门专家拥堵、冷门专家“饿死”。这不是装饰性优化:当专家数接近 1000 时,负载失衡既会拖慢并行训练,也会让部分专家学不到足够数据。

图 4:左侧是不均衡路由,中间依据分位点调整专家偏置,右侧得到更均衡的专家负载。原图来自论文 Figure 5。
因此,Stable LatentMoE 中的“Stable”并非泛泛而谈。它具体指向三件事:缩窄路由空间以控制成本、限制内部激活以稳定数值、平衡专家负载以稳定并行训练。
三条主线为什么必须同时存在?
这三套机制分别解决不同方向的瓶颈:
扩展方向 | 直接问题 | Kimi K3 的主要机制 | 直观作用 |
|---|---|---|---|
序列长度 | 1M token 下全注意力和缓存代价高 | KDA + 周期性 Gated MLA | 大部分层高效传递长历史,少数层恢复全局交互 |
网络深度 | 历史表示被逐层压进单一状态 | Block AttnRes | 当前层按需检索较早的块表示 |
模型宽度 | 专家越多,计算、通信和负载失衡越严重 | Stable LatentMoE | 扩大专家容量,同时保持稀疏计算和训练稳定 |
只扩大宽度,没有长序列机制,模型仍难以高效处理百万 token;只扩大上下文,没有深度选择,长轨迹中的有用表示可能在 93 层传播中被稀释;只有稀疏路由而没有稳定化和负载均衡,896 个专家也很难真正训练起来。
所以 Kimi K3 的重点不是三个模块的简单拼装,而是试图让信息在时间跨度、抽象层级和专家容量三个方向同时扩展。
这些设计真的带来了效果吗?
论文在留出的分布外验证数据上拟合 scaling law,并报告:架构、数据与训练配方的整体组合,相比 Kimi K2 带来约 2.5 倍总体 scaling efficiency 提升。在图 5 中,相同验证损失下,Kimi K3 曲线对应的计算量更低;或者在相近计算预算下,Kimi K3 达到更低损失。

图 5:Kimi K3 与 Kimi K2 的拟合 scaling-law 曲线。论文报告整体 scaling efficiency 提升约 2.5 倍。原图来自论文 Figure 7。
这里要注意措辞:2.5 倍是整套架构、数据与训练改进共同得到的结果,不能直接解释为某一个模块单独带来 2.5 倍提升。论文没有在这张图里把 KDA、AttnRes 与 Stable LatentMoE 的收益逐项拆开。
能力评测方面,论文结论也不是“Kimi K3 已经全面第一”。报告称它在所覆盖的长程编码、智能体、知识、推理和视觉任务上达到前沿水平,但整体仍落后于其中最强的闭源模型 Claude Fable 5 与 GPT-5.6 Sol。报告汇总的第三方评测截至 2026 年 7 月 23 日:Kimi K3 在 Artificial Analysis Intelligence Index v4.1 中为 57.1,在 Vals Index 中为 74.7;在 WebDev Arena 上以 1678 Elo 位列当时第一。
论文还强调推理成本效率,但不同任务使用的运行框架、推理强度和成本来源并不完全一致,因此更适合把这些结果看作“接近性能—成本前沿的证据”,而不是脱离评测设置的绝对排名。

图 6:论文汇总的四组分数—单任务成本比较,红色星标为 Kimi K3。原图来自论文 Figure 13;各任务的成本统计口径见报告第 6.4 节。
Kimi K3 最值得记住的,不是“参数更大”
如果把整篇技术报告压缩成一句话,我会这样总结:
Kimi K3 用 KDA 扩展 token 之间的信息流,用 AttnRes 扩展层之间的信息流,再用 Stable LatentMoE 扩展专家之间的信息流。
2.8T 提供的是容量上限,104.2B 描述的是单 token 的激活路径,1M 则是模型希望持续工作的时间尺度。三组数字分别对应“能装多少”“一次算多少”和“能看多远”,不能混为一谈。
这也解释了为什么“2.8T 参数、每 token 只激活 104B”并不矛盾:模型可以拥有一个极大的专家知识库,但每次只调用与当前 token 相关的一小部分;同时,序列与深度方向的专门结构负责把正确的信息送到正确的专家面前。