Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?
AI技术研报 2026-09-25 10:11
+6319 阅读

大模型 Attention 路线变迁:从分流到重组。


一张大模型架构图里,同时出现了 Kimi 和 DeepSeek 的影子。       


Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?


GLM-5.3-Flash项目配置文件:45层架构中,34层采用Kimi路线的KDA线性注意力,另外11层采用DeepSeek路线的KPool-DSA稀疏注意力


今年以来,大模型架构里出现了一条越来越清晰的变化:一些混合注意力架构中原本由全局Attention承担的角色,开始被Sparse Attention(稀疏注意力)接替。


要理解这个变化,得先回到 Attention 本身。


Attention解决的是一个基础问题:模型处理当前token时,能不能在越来越长的历史里,找到真正有用的信息。


Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?


大致来看,目前常见的Attention机制可以理解成三类:


全局注意力(Full / Global Attention)


直接读取完整的token历史,信息保留最充分,但计算和缓存成本也最高;


线性注意力(Linear Attention)


把历史压缩进更紧凑的状态,以降低长序列的计算成本;


稀疏注意力(Sparse Attention)


则保留更完整的历史,只选择其中一部分重要信息参与计算。过去几年出现的很多


高效注意力(Efficient Attention),主要就在后两种方向上继续演化。


最开始,经典 Transformer 主要使用 Full Attention,Full Attention让模型可以直接访问完整的token级历史,代价是计算和KV Cache随上下文迅速增长。连带着训练和推理成本也随之大幅增加。


过去几年,大家对 Attention 的改造,本质上都是在能力和成本之间找平衡。于是,作为折中方案的混合注意力架构逐渐流行起来:不同机制被放进同一套模型里分工,高效Attention负责降低成本,少量全局Attention保留直接访问完整历史的机会。


Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?


 从不同Attention路线,看大模型公司的选择


到了今年,很多混合注意力架构里由全局Attention承担的角色,开始出现被Sparse Attention接替的迹象。


8月发布的Qwen3.8-Flash-Next就是一个很清楚的例子。它延续此前三层 Gated DeltaNet 配一层 Attention 的结构,但那一层原本负责全局精确读取的 Attention,被进一步改造成了 Qwen Sparse Attention这样的高效注意力机制。(此前,我们也对 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 做过详细实测,可参见https://mp.weixin.qq.com/s/HxJhiH0O1etsHoH_X1J5VQ)


Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?


 Qwen3.8-Flash-Next 架构图:每四层里,三层是 GDN,一层是 QSA


为什么那层一直被认为无法替代的全局 Attention,也开始有人尝试用另一种高效机制接替?如果具体的 Attention 技术正在变成可以流动和重组的零件,我们今天所谓一家模型公司的“技术路线”,到底还指什么?


MiniMax最后还是留下了Full Attention


要回答这个问题,可以看看MiniMax过去几年的架构变化,几乎完整经历了这一轮反复:从押注线性注意力,到保留少量全局注意力做混合注意力,再回到全局注意力,后来又转向稀疏注意力。每一次变化背后,都对应着模型Scale以后新暴露出来的问题。


Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?


2023年底,后来主导过MiniMax-01网络架构设计的钟怡然正在给Linear Attention找一家愿意真正把它Scale Up的公司。


他从2021年开始研究这条路线,此前最大的实验模型已经做到15B。在他看来,Linear Attention在建模效果和运行效率上的几个主要问题已经基本解决,真正剩下的问题只有一个:


它被放大到几百B参数以后,还能不能成立?


这个问题已经不是研究团队自己可以回答的了。


预训练一个几百B参数的大模型,架构一旦确定,数据、算法、训练系统和工程资源都会跟着转向。钟怡然此前也接触过其他公司,最终在2023年底和闫俊杰的一次交流后,MiniMax决定把这条还没有经过大规模验证的路线接下来。


双方对这件事的把握其实并不一样。


钟怡然后来回忆,作为长期研究Linear Attention的人,他当时觉得成功概率接近99%;但站在闫俊杰的位置上,他估计这个数字只有大约一半。一旦把Linear作为下一代主模型的架构,MiniMax超过80%的研发资源都会被卷进来。


一家大模型公司要用绝大多数研发资源,去验证一件只有五成把握的事。


Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?


MiniMax创始人闫俊杰,图源网络


早期实验一度让这场下注显得没有那么危险。团队曾经训练过一版15B左右的纯Linear模型,效果已经可以接近Transformer,似乎说明这条路线可以继续往上Scale。


但模型进一步放大后,问题开始暴露出来。


Linear Attention为了降低长上下文的计算成本,会把历史信息压缩进更紧凑的状态里,而在检索这类需要从很长文本中准确找回某个细节的任务上,这种压缩会出现问题。


Linear Attention省下计算的关键,在于它不会一直保存并重新读取每个历史token,而是把过去的信息不断压缩进有限的状态里。这样做很像把一本书边读边做笔记:记住主题和大意很高效,但如果几百页以后突然问“第37页某句话具体写了什么”,压缩过的笔记未必还能完整还原。


MiniMax原本希望把Linear做得更彻底,最后还是把Full Attention加了回来。


后来MiniMax-01采用的7:1 混合注意力架构由此出现:每7层Lightning Attention之后,加入1层传统SoftMax Attention。大部分计算交给更便宜的Linear Attention,但模型隔一段仍然获得一次直接读取完整上下文的机会。


这个比例是在不同层数和组合之间反复实验后找到的折中。钟怡然后来把混合注意力形容成一种“保底方案”。


可是,15B模型给出的信号仍不足以支撑一轮4560亿参数的正式训练。在真正开跑MiniMax-01之前,团队做了大约3700次预训练实验,不断改变模型大小、架构和参数组合,再从这些相对便宜的小实验中判断Scaling Law是否还能继续成立。


2024年中,MiniMax最终开始训练4560亿参数的MiniMax-01。到2025年1月模型发布时,7层Lightning Attention加1层Full Attention的架构被正式保留下来,上下文长度也被推到了400万token。


MiniMax花了数千次实验和一轮大规模预训练,最后仍然没有把那层Full Attention拿掉。它恰恰解释了为什么在后来很长一段时间里,混合注意力 Attention虽然越来越常见,却往往仍要保留少量全局Attention。


而MiniMax很快还会第二次碰到这个问题。


Scale之后,混合注意力又暴露了新问题


模型继续Scale以后,第二轮问题出现了。


这一次是更复杂的多跳推理问题。当模型需要经过多个中间步骤,把前面的条件、推导和结论重新串起来时,混合注意力开始出现比Full Attention更明显的能力损失。


问题暴露以后,团队重新设计测试和训练方法,小规模实验里,混合注意力又可以追上Full Attention。真正让MiniMax犹豫的也因此不再是这个具体缺陷,而是另一件事:


这次的问题可以找到、可以修,下一次还没有被发现的问题在哪里?


Text-01时期使用的Benchmark,并没有提前暴露后来的多跳推理差距。即使团队为这个问题补上新的测试,也无法证明在更大的模型和更复杂的任务上,不会继续出现新的能力缺口。


这意味着,混合注意力真正的风险是


未知能力损失无法被提前穷尽。


Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?


MiniMax官网技术博客截图


所以到了M2,MiniMax重新采用了Full Attention。相比继续押注一个可能在更大Scale上暴露新问题的架构,Full Attention虽然更贵,但它的能力边界和工程行为更可预期。


这也是Full Attention长期很难从混合注意力架构里彻底消失的原因:它留下来的价值,很大一部分来自对未知能力风险的兜底。


但到了下一阶段,Agent又重新改变了这笔账。


Agent重新放大了Full Attention的成本


M2回到Full Attention之后,MiniMax并没有在那里停太久。


2026年6月发布的M3重新离开Full,转向自研的MiniMax Sparse Attention(MSA)。这一次,变化来自于模型要处理的任务。


Text-01时期,长上下文更多意味着一次性读进更多材料:一本书、一份报告,或者几十万token的文档。到了Agent阶段,上下文开始变成一段不断增长的工作历史。搜索结果、网页、代码、工具返回、报错和中间结果,会随着任务一轮轮执行不断累积。一个Agent可能工作几十轮甚至更久,前面发生过的事情又不能轻易丢掉。


这让Full Attention的另一面越来越难忽视。


M2时期,MiniMax最担心的是高效Attention可能带来的未知能力损失,因此宁愿接受Full Attention更高的成本。但到了M3,长程Agent开始把这笔成本不断放大:


历史越长,每一轮需要处理的信息越多,计算和KV Cache都会继续增长。


MiniMax在M3发布时把“Context Scaling”


直接列为解决复杂Agent任务的核心问题,并重新从Attention架构动手。最终采用的MSA不再让每一步都处理完整历史,而是先从长上下文中筛出真正需要参与Attention计算的部分。官方数据显示,在100万token上下文下,M3单token计算量约为上一代模型的1/20。


于是,MiniMax几年的路线看起来像是绕了一圈:Text-01用Linear降低长上下文成本,同时留下Full Attention兜底;M2因为Scale后暴露出的能力风险,重新回到Full;到了M3,Agent又把长上下文成本推到前台,于是团队再次寻找Full Attention之外的方案,只是这一次选择了Sparse。


M2时,MiniMax愿意用更高的计算成本换能力上的确定性;到了M3,Agent让这份“确定性保险”的价格变得越来越高。


Linear和Sparse被放进同一个模型


MiniMax重新走向Sparse时,类似的变化已经开始在其他模型里出现。


过去很多混合注意力架构虽然引入了更高效的Attention,最后仍会保留少量全局Attention。到了2026年,这个结构开始松动。2月发布的MiniCPM-SALA直接把Lightning Attention和Sparse Attention放到了一起;到了8月,Qwen3.8-Flash-Next延续此前三层Gated DeltaNet配一层Attention的结构,却把负责精确检索的那部分进一步改成了Qwen Sparse Attention。


这个变化在Qwen身上尤其清楚。三比一的结构没有变,变的是那一层“兜底”的方式。过去由全局Attention直接读取完整历史,现在开始交给Sparse Attention,从长上下文中筛出真正需要的信息。


到了GLM-5.3-Flash,类似的组合再次出现:45层模型中,34层采用KDA,另外11层采用KPool-DSA。过去分别由Kimi和DeepSeek推进的Linear与Sparse路线,被放进了同一套模型。


Linear和Sparse之所以能够放在一起,恰好因为两者解决的是不同的问题。Linear擅长用较低成本维持一段很长的历史,却不擅长随时恢复其中某个具体细节;Sparse保留token级历史,但每次只读取其中一小部分。前者更像负责“记住整体状态”,后者负责“需要时回去查具体内容”。这也是为什么两种过去看起来彼此竞争的方案,后来开始出现在同一套架构里。


三个模型的实现并不相同,但它们指向了一个共同变化:


Attention架构正在从寻找一种更好的机制,走向让不同机制承担不同的工作。


 Linear或Recurrent Attention负责以更低成本维持长历史,Sparse Attention负责在需要时从中找回更具体的信息。


过去被当作不同路线讨论的Linear、Sparse和Full,正在变成同一个架构设计空间里的不同选项。


技术开始越过公司的边界


这种组合越来越容易发生,也和过去几年技术扩散的方式有关。


2024年,长期研究线性注意力的杨松琳开始维护线性注意力开源社区FLA。她后来回忆,FLA从一开始就不只是为了发布论文,而是希望把Linear Attention变成真正可以复用的基础设施:算法之外,接口、kernel和具体实现也一起开放。后来Kimi推进KDA时,也从这个社区吸收了核心贡献者。


技术因此不再只跟着论文流动。代码、社区和研究人员,把一项架构创新带出了最初提出它的团队。


到2025年底,杨松琳在讨论Linear Attention下一步时,已经提出过一个当时还很激进的方向:既然Linear在精确检索上仍有缺口,是否可以直接和Sparse结合,让两种机制各自处理不同的问题。她当时举出的例子,就是Kimi的KDA和DeepSeek的DSA。


不到一年,这种设想已经出现在真实模型里。


这也让“技术路线”越来越难简单地和某一种Attention机制绑定。过去人们习惯说MiniMax做Linear、DeepSeek做Sparse、Kimi做KDA;但当代码可以开源、人员可以流动、已经被验证过的技术可以迅速进入另一家公司的模型,这些标签的有效期会越来越短。


真正拉开差距的,也越来越不是“有没有某项技术”,而是


什么时候采用它、怎样和其他技术组合,以及愿意在能力、成本和工程风险之间做什么取舍。


尾声:路线没有消失


再回到开头那张架构图,Kimi和DeepSeek的名字同时出现在GLM-5.3-Flash里,已经没有那么反常了。


过去几年,人们习惯用Linear、Sparse、Full Attention来区分不同公司的技术路线。但MiniMax几次看似反复的选择,其实已经说明,这种划分越来越难解释真实的大模型研发。


做Text-01时,MiniMax最先看到的是长上下文带来的成本,于是押注Linear;模型继续Scale以后,未知的能力损失变得更危险,M2因此重新回到Full;到了Agent阶段,不断增长的工作历史又把计算成本推到前台,M3再次转向Sparse。


技术没有突然变好或变坏,变化的是每个阶段最先撞到的约束。


这也解释了为什么今天很难再用一种Attention机制定义一家公司的路线。真正决定选择的,是模型下一步要处理什么任务,什么成本已经不能继续接受,以及团队愿意为能力上的确定性付出多少代价。


GLM-5.3-Flash里KDA和DSA同时出现,记录下来的也不是哪一条路线最终赢了。它更像一个结果:当具体技术越来越容易被验证、吸收和重新组合,所谓“路线”正在从对某一种架构的长期押注,变成一家公司对约束变化的持续判断。


技术会扩散,也会被重新组合。真正没有那么容易被复制的,是一家团队判断下一堵墙会出现在哪里。


参考资料:


1.晚点聊 LateTalk 104:《我给线性注意力找“金主”,字节 say No,MiniMax say Yes》


2.MiniMax:《MiniMax-01 is Now Open-Source: Scaling Lightning Attention for the AI Agent Era》



文章来自于微信公众号 “AI科技评论”,作者 “AI科技评论”

1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群