|

股票

从Kimi K3看大模型规模效应的新叙事

来源:证券之星财经

2026-07-20 15:47:56

2026年7月16日,月之暗面扔出了一颗重磅炸弹。Kimi K3正式发布,2.8万亿参数,100万Token上下文窗口,原生视觉理解能力。这不仅是Kimi迄今能力最强的模型,更是全球参数最大的开源模型。消息一出,连埃隆·马斯克都在X评论区留下了一句“Impressive”。

但真正让行业震动的,或许不是参数本身。2.8万亿这个数字固然震撼,但大模型行业早就过了那个“谁参数大谁就赢”的蛮荒时代。真正值得追问的是:在这个Scaling Law频频被质疑“撞墙”的2026年,Kimi K3到底讲述了一个怎样的规模效应故事?

规模效应从来没有消失,它只是换了种活法

过去几年,大模型领域最深入人心的经验总结莫过于Scaling Law。OpenAI在2020年提出的这条定律,用一句话概括就是:训练参数量越大、算力越多、数据越多,模型性能就越好。这套逻辑驱动了整整一代AI创业者的军备竞赛,也催生了从千亿到万亿、再到数万亿参数的模型迭代。

但进入2026年,情况起了变化。单纯通过囤积算力、增加数据量来提升模型能力的收益开始递减。行业普遍感受到,更大的参数、更多的芯片,已经无法带来同等比例的智能提升。Scaling Law似乎撞上了一堵高墙——数十亿美元砸下去训练下一代超级大模型,性能的提升却没有太大飞跃。

然而,如果说Scaling Law“失效”了,那Kimi K3的出现就是一个有力的反驳。真正在发生的不是Scaling Law失效,而是单一维度的参数堆叠遇到了边际收益递减。K3的2.8万亿参数不是简单的数字游戏——月之暗面将参数比作人脑里的神经连接,“近3万亿参数意味着这个模型能把更多的知识和规律装进'脑子',懂得更多、想得更深、答得更准”。但真正让这些参数发挥作用的,是模型架构层面的系统性创新。

KDA与稀疏MoE:用更聪明的方式变大

Kimi K3的核心秘密藏在一个叫KDA的技术里——Kimi Delta Attention混合线性注意力机制。传统Transformer的注意力计算随着上下文长度增加呈平方级增长,而KDA通过细粒度的通道级门控和分块循环更新,实现了更高效的注意力计算。研究显示,KDA在短上下文、长上下文和强化学习等多种场景中在效率上展现出了与全注意力模型相当甚至更优的表现(据月之暗面内部研究)。

与此同时,K3采用了896个专家的MoE架构,但每次推理只激活其中16个。这就好比一个拥有896名专家的超级智库,处理任何问题时只调动最对口的16个人——既保证了专业深度,又控制了计算成本。再加上注意力残差技术——用不到2%的算力换取约25%的训练效率提升——K3在架构层面的创新形成了一套精密的组合拳。

结果是:Kimi K3相较上一代K2的整体扩展效率提升了约2.5倍。这是一个关键数字。规模效应的本质从来不是“大”,而是“大的同时更有效率”。K3证明了一件事:参数规模的扩张可以不再以同等比例的算力消耗为代价。规模效应正在从“堆规模”转向“用更聪明的方式实现规模”。

从“能聊天”到“能干活”:规模效应的价值转向

如果说参数是K3的“体量”,架构是它的“肌肉”,那真正让行业兴奋的,或许是它展现出的“干活”能力。

K3的定位非常明确:面向长程编程、知识工作和复杂推理等前沿智能场景。它不是另一个陪你聊天的对话模型,而是一个能持续调用工具、根据运行结果迭代、把复杂任务推进到最终交付的长程Agent。

一组数据可以说明这种能力的分量。在生成AI ASIC行业研究网站的任务中,K3经历了120轮以上的递归改进,完成了2800多次网页搜索与抓取、1100多次终端数据调用,处理了超过1.1万页内容。在引力波分析案例中,它调用了20个以上的并发子Agent处理391个事件。这些任务已经从单轮问答,转变为检索、执行、校验、绘图和修改组成的长链路流程。(数据来源:月之暗面官方演示案例)

在社区盲测平台Arena AI的Frontend Code Arena榜单上,K3以1679分超越Claude Fable 5,位居第一。在月之暗面内部评测体系SWE Marathon(测试超长程软件工程任务能力)中,K3同样位列第一。更令人印象深刻的是,K3在连续48小时的自主运行中,基于开源EDA工具和45nm工艺库,独立完成了芯片的设计、优化与验证。

规模效应的本质没有变,但实现的路径彻底变了

回到最初的问题:从Kimi K3身上,我们看到了大模型规模效应的什么新叙事?

第一,规模仍然是有效的,但“规模”的内涵变了。 2.8万亿参数不是用来堆砌数字的——它服务于更深层的能力跃迁。参数规模决定了能力上限,但真正把上限兑现为实际表现的,是架构、训练方法、数据配方的协同优化。

第二,规模效应的衡量标准变了。 过去我们看参数数量,现在我们要看扩展效率。

2026年7月,当Kimi K3以2.8万亿参数的姿态站上全球开源模型的巅峰时,它证明了一件事:大模型的规模效应远未走到尽头,只是我们不能再拿旧地图去探索新大陆。参数竞赛的时代或许正在落幕,但一个关于“如何让规模真正产生价值”的新时代,才刚刚开始。

首页 股票 财经 基金 导航