HelloKitty • 2026-07-30 14:52
107
本文由 鲸选AI 撰写/授权提供,转载请注明原出处。
以下文章来源于:鲸选AI
作者:鲸哥
最近 Kimi K3 火了,国产开源模型成了世界顶模。
在第三方评测机构 Artificial Analysis 的榜单上,它排全球第三,仅次于 Claude Fable 5 和 GPT-5.6 Sol,把其他所有模型甩在身后。长上下文浏览、深度搜索、表格处理、法律 Agent,这几个方向上它是开源里最好的。
创始人杨植麟赌对了——2.8 万亿参数的大模型,大力还真出了奇迹。
但参数真的决定一切吗?AI 圈里同时在传另一件事。
据雷峰网报道,国内某老牌科技巨头更早就集全公司算力砸过一个 2 万亿参数的大模型。结果数据量跟不上,脏数据也多,训出来的效果远不如预期。更要命的是,算力全砸去预训练堆参数了,后面强化学习、后训练的预算被挤没,节奏直接慢了半拍,被同行反超。内部复盘到最后,得出结论:行业主流的 200B 左右参数就能兼顾速度和效果,更适合落地。
这话听着有道理,又总觉得哪里不对。同样是往万亿级冲,有人砸进去全是水漂,有人做成了开源标杆。
差别到底在哪?翻开 K3 这份技术报告,答案写得很清楚。

2.8 万亿参数,主线全压在 MoE 上
K3 总参数 2.8 万亿,是目前开源里最大的一档。896 个路由专家,每次激活 16 个,激活参数 1040 亿。一百万 token 上下文,原生多模态,全开源权重。
这些数字摆出来确实令人吃惊。但真正厉害的不是参数多,而是缩放效率比上一代 K2 提升了 2.5 倍。同样算力投入,换来比以前好得多的效果。这才是报告最核心的东西——大模型的规模战,早就不是比谁参数多了,而是比谁能把规模用得更有效率。
MoE 不是新鲜东西。简单说就是模型里有很多个“专家”,每个 token 进来只挑少数几个干活,不用全跑一遍。总参数可以做很大,激活的参数不多,推理成本能压住。
K2 是 384 个路由专家,每次激活 8 个。到 K3 直接翻了一倍还多:896 个专家,每次激活 16 个。
专家数量翻番,听起来就是加数量的事,实际上坑特别多。老牌巨头堆参数踩的坑,很大一部分就在这里。专家多了最容易出两个问题。
一是数值不稳定——模型规模小的时候不明显,到了大几百上千个专家,某个神经元突然爆个大数值,整条链路都能被带歪,训练说崩就崩。
二是负载不均衡——有的专家活多到干不过来,有的常年接不到活,模型越训越偏,到最后参数翻了几倍,性能涨不了多少。规模上去了,效率没跟上,钱全打了水漂。
Kimi 这边的解法是一套组合拳,挨个拆坑。
第一个坑:专家太胖,通信量太大。 以前的 MoE 专家都是全宽度的,每个进来的 token 都要传完整的向量,专家越多通信量越大,到最后瓶颈根本不在计算,在数据搬运。K3 把路由专家的维度砍到原来的一半,先投影到窄空间里再进专家,算完再投影回去。
专家数量翻一倍多,通信和计算的压力没涨那么夸张。这个思路叫 LatentMoE,说白了就是让专家“瘦个身”,轻装上阵才能跑得快。
第二个坑:激活函数没上限,数值容易爆。 以前常用的 SwiGLU,数值大了之后是没边的。模型小的时候偶尔爆一下,还能靠别的地方找补回来。到了 896 个专家这种量级,一个神经元出问题,连锁反应能崩掉一整层训练。
K3 换了自己调整的 SiTU-GLU,两边分支都用 tanh 压了一下,数值再大也超不出预设范围,相当于给每个神经元装了个安全阀,压力再大也不会炸。

看这张图就明白:SwiGLU 那条线越往右越往上翘,没个头;SiTU-GLU 到了一定程度就平了,有天花板顶着。就这一个改动,训练稳定性上去了一大截。
第三个坑,也是最大的坑:负载不均衡。 896 个专家,怎么让每个分到的活差不多?以前做 MoE 均衡大多靠辅助损失一点点调,调参数很麻烦,专家多了根本压不住。就像一个公司有几百个部门,活怎么分全靠领导拍脑袋,时间长了肯定有的忙死有的闲死。
Kimi 用了分位数均衡的思路,不算损失,直接按分位数给每个专家调偏置,一步到位把负载拉平。

左边是传统的 Top-k 路由,有的专家活堆成山,有的闲着没事干。右边用了分位数均衡之后,每个专家的工作量基本一样。896 个专家,没有谁累死谁闲死。
这几件事凑在一起,最终结果是 K3 的整体缩放效率比 K2 高了 2.5 倍。

同样的算力投入,K3 的验证损失比 K2 低得多。以前花一块钱能办的事,现在四毛钱就办了。这也是为什么同样冲万亿参数,有人砸进去全是响,有人能真把性能推上去。
加分项和后训练:上限怎么兑现
光靠 MoE 不够,其他地方也得跟上,但那些都是加分项,主线还是那一条——怎么让超大的规模真的转化成性能,而不是变成算力黑洞。
比如注意力,K3 混着用了两种:三层线性注意力加一层全局注意力。长上下文靠线性结构压成本,全局交互靠常规注意力保效果,不用改位置编码就能外推到一百万 token。还有注意力残差,每层都能选择性地拿前面层的信息,不用等信号一层层传下来——就像看书遇到不懂的可以随时翻前面的笔记,不用非得从第一页按顺序读。
视觉编码器更有意思。别人都拿预训练好的模型往上接,觉得有现成知识打底肯定更好。Kimi 偏不,从零开始训自己的视觉塔,结果梯度更稳,效果也好。这些改动各有各的道理,但都不是最核心的。最核心的还是 MoE 那套效率革命——把规模的水分挤掉,让每一个参数都真的在干活。
而真正把上限兑现出来的,是后训练。K3 不是训完一个基础模型就完事,而是在上面做了一整套强化学习。三个大领域——通用任务、通用 Agent、编码,每个领域又分三个推理强度(低、高、最大),加起来九个专家模型,然后用多教师蒸馏把九个老师的本事揉进一个学生模型里。

随着 RL 算力投入增加,工具调用的步数在稳定增长,各项能力也在全面提升。不是说 RL 加得越多越好,而是在合理的框架下,RL 确实能把模型实际干活的能力往上推一大截。
这恰好解释了前面那桩旧事:老牌巨头把钱全砸去预训练堆参数,后面 RL 跟不上,很吃亏。预训练决定上限在哪,RL 决定这个上限能发挥出来多少。光有上限,发挥不出来,等于白搭。
万亿参数如何更便宜?
整体性能上,K3 还追不上最强的两家闭源模型——Claude Fable 5 和 GPT-5.6 Sol,在研究级推理、复杂多步 Agent 任务上还有明显差距。但更关键的是成本。

同样的任务,K3 的推理成本大概是 Claude Fable 5 的三分之一到四分之一,长浏览类任务甚至能差一个数量级。对开发者来说这才是最实在的:以前用百万上下文要掂量预算,现在开源模型就能用,成本还扛得住。而且它是全开源权重,谁都能下载下来改、部署、做二次训练。这件事的影响比跑分本身大得多。
很多人复盘的时候喜欢说规模没用、参数无用。其实不对。规模从来都是有用的,不然闭源旗舰也不会一路往大了做。问题出在很多人对规模的理解停留在“堆参数数量”上,觉得参数够多效果自然就好。
实际上到了万亿这个级别,参数数量本身早就不是门槛。怎么把几千个专家训稳,怎么让长上下文真的能用,怎么把推理成本压到可落地,这些才是真正的门槛。
Kimi K3 的意义不是干翻了闭源,而是证明了一件事:开源模型也能摸到 3T 级的规模,也能把百万上下文、Agent 能力打包放出来,还能让普通人用得起。
有人说,两百亿就是落地最优解。现在看,不是两百亿最优,是之前的技术只能把两百亿做明白。等技术跟上了,更大的规模,自然会有更大的价值。
规模不是错,瞎堆参数才是。


扫码关注公众号
获取更多技术资讯