一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录
AI技术研报 2026-09-02 15:03
+8863 阅读

家人们,我最近在GitHub上看到一个爽文。


事情是这样的:一个大模型的训练任务,在最开始的时候需要45分钟。后来,全球的各路大牛围着一点点地优化,换架构、改优化器、写GPU Kernel,前前后后左左右右一共刷新了80多次,时间压到了84秒左右。


到这个阶段后,基本进入了瓶颈,容易改的地方基本都改完了。


有时候为了再快0.1秒,这些人甚至愿意专门写几百行Kernel来抠时间……按理说,这个榜单已经快被薅到头了。


官方的纪录榜上从 2025 年 10 月开始记录,到2026年4月几乎就躺平了。


但是,爽文从这里开始了!


一个多月后,一个3人小团队,把训练时间从84秒优化到81秒,再降到76秒,连续两次刷新了记录。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


没有更换训练数据,没有降低模型效果,也没有偷偷多加几张显卡,硬是刷新了当时的训练速度记录。


这真是,拿到大结果了!更意外的是,提交者的账号当时只有3个关注者。


这个仓库的维护者、榜单多项纪录贡献者Larry Dial先感叹“这项技术非常先进,我得确保自己完全理解”,最终合并时又评价:


“This is an awesome PR and easily the most advanced in quite a while.” 这是一个很棒的PR,也是很长一段时间以来最先进的提交之一。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


“论文作者们非常令人印象深刻,等大家跟上这些思路后,它们很可能会被用于更大规模的训练。”


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


我先来给家人们介绍一下NanoGPT Speedrun这个项目。


NanoGPT Speedrun是一个托管在GitHub上、由全球开发者共同参与的开源训练竞速项目。


规则很简单,所有参赛者使用固定的8张H100,把一个GPT-2 Small规模的语言模型训练到同一标准,在FineWeb验证集上的loss不高于3.28,最后比较完整训练耗时。


谁能把训练时间进一步压低,谁就创造新的 Track 1 纪录。


可以改模型架构、优化器和训练策略,也可以自己写Kernel;但不能更换底层数据,也不能降低最终效果。


形象地说,就是大模型训练界的F1,赛道和燃料基本一样,拼的是训练技术。


虽然,看着像跑分,氮素,这并不是能简单地这么快。


比如,后来被Kimi用于大规模模型训练的Muon优化器,最早就是在NanoGPT Speedrun中得到验证并大幅刷新纪录,Kimi又继续把它扩展成MuonClip,用于训练万亿参数的Kimi K2。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


以及,DeepSeek提出Engram条件记忆后,这个榜单里也很快出现了受其启发的Bigram Hash Embedding。


NanoGPT 更像一个大模型训练的拉力赛+竞技场+实验室,一些后来进入大模型训练的技术,会先在这里接受固定硬件、真实时间和公开代码的检验。


一只国产AI小透明


开头这个爽文故事的主角,是一个国产AI小透明,来自彩云科技的基础模型算法团队。


2026年4月第一次刷新记录,是第81次官方记录提交#81 MUDD Skip Connections,将训练时间从84.36秒压到81.78秒,缩短3.1%。


第一次(#81),砍掉2.58秒。


一个多月后,第 85 次纪录提交又杀回来了,#85 MUDD Gates + DC MHA砍掉约2.9秒,从79.2 秒降到76.3 秒,缩短约 3.7%。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


我顺着代码和论文仔细看了一遍,发现还是可以和大家说说的。


连续两刀技术突破


第一刀—砍层间


彩云第一刀【记录#81】— MUDD Skip Connections,MUDD的全称是Multiway Dynamic Dense Connections,多路动态稠密连接。这个我之前看过,还仔细读了他们的论文


这个算法优化问题思路是把Transformer想象成一个办公楼,传统的Transformer只有一条提前修好的楼梯,不管模型当前处理的是数学题、代码、对话还是一段反讽,每一层的信息都沿着基本固定的路线往后传。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


但是,其实不同的Token需要的信息并不一样,有的Token可能需要回头寻找前面几层的词法信息,有的更需要最近几层刚刚完成的推理结果。


但是传统的残差链接并没有能力去主动判断:


  • 这一次应该保留哪一层的信息?
  • 哪一路应该加强?
  • 哪一路应该被压低,甚至抵消?


MUDD就是给Transformer,装上一套动态电梯。模型可以根据当前Token和内部状态,自己判断应该从哪些历史层取回信息,以及这些信息应该以多大的权重参与当前计算。


而且,完整的MUDD不只控制一条残差路径,分别为Q、K、V和Residual四类内部信号设计了动态连接,相当于给不同类型的信息分别安排了自己的路线,让不同Token、不同内部信号动态选择跨层信息。


彩云团队在2025年的ICML发表过详细的实验结果:


只增加了约0.23%的参数量和0.4%的计算量,就能达到普通Transformer使用1.8至2.4倍训练算力时的效果。


不过,论文出的时候我看了,我没有真的觉得放在竞技场一定会赢。


因为这个学术界的基准和公开的擂台赛还是有区别的,不只看训练步数,还要计算真实的端到端时间。


比如,你新加一个模块,哪怕能让模型少训练几十步,只要这个模块自己运行得太慢,最后还是会输。


彩云的处理很明白:


没有把完整MUDD原样搬过去,把其中最有价值的部分拆出来,做成低开销的MUDD Skip Connections,根据当前隐藏状态生成动态权重,改善跨层信息传递,同时尽量减少额外计算。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


最终,这项工作把训练时间从84.36秒砍到了81.78秒,一次减少2.58秒,提升约3.1%。


第二刀-砍层内


一个多月以后,彩云又来了一刀—【记录#85】。这次改的是多头注意力,MMUDD Gates+Lightweight DC。


我看这个模型名字,特别特别眼熟,我就发现24年的时候,这篇论文我也精读了,是2024 年拿到ICML Oral的论文。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


DC(来自DCHA)关心的是注意力头之间如何协作。


传统多头注意力会让多个Attention Head并行处理输入,各个Head基本独立计算注意力图,直到输出阶段才进行拼接。这样虽然并行效率高,却缺少随输入动态协作的机制,也容易产生Head冗余。


彩云提出DCMHA(Dynamically Composable Multi-Head Attention,可动态组合的多头注意力),通过Compose模块对注意力分数和权重进行跨Head变换。


简单说,它不再让多个Head各自为战,而是根据当前输入动态决定哪些Head需要协同、哪些信息应该加强或重新组合。


基于这套机制构建的DCFormer,达到了普通Transformer使用约1.7至2倍计算量时的效果。


到了NanoGPT Speedrun,彩云也没有直接搬入完整DCMHA,而是设计了Lightweight DC。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


它复用了原有Q/K,额外计算一个112 Token的局部注意力窗口;经过Softmax后,再将多个Head的注意力图动态合成为一张共享图,并通过不同的Head Scale作用于各自的Value。


这样既保留了跨Head动态组合能力,又通过复用投影、缩短窗口和专用Kernel控制额外开销。


最终,Lightweight DC让训练步数下降约7%,将世界纪录从79.2秒推进到76.3秒,一次缩短约2.9秒。


和业界其他工作的联系


说到这里,熟悉大模型架构的人可能会想到另外两项工作:Kimi的Attention Residuals(也就是AttnRes)和字节Seed团队的Hyper-Connections(HC)。


这两个工作和彩云这两刀的工作其实都在同一个研究的大方向:


【Transformer层与层之间的信息,不一定非要按照固定方式传递。】


先来讲讲Kimi26年3月发布的AttnRes。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


它同样认为,传统残差会让不同层的信息逐渐混在一起,会导致越深的网络单层贡献越来越容易被稀释。


AttnRes的做法,是让当前层对历史层进行打分,再经过Softmax,决定应该从哪些历史层取回信息。


我理解,Kimi的AttnRes,相当于给Transformer每一层增加了“往前翻资料”的能力:


传统残差连接会把前面各层的信息一路累加,AttnRes则会针对每个Token,动态判断当前最该参考哪几层。


为了适配大模型,Block AttnRes又把历史层整理成几个资料夹,只在块级信息中进行选择,从而降低显存和通信开销。


MUDD和AttnRes都会针对每个Token动态调用历史层信息,但MUDD不受Softmax归一化约束,可以直接生成正负连接系数,对信息进行放大、抑制或抵消。


完整MUDD还将这种动态路由扩展到Q、K、V和Residual四路,而不只作用于残差流。


再说字节Seed的HC。


HC同样在改造残差连接:它把单一隐藏状态扩展为多条可交互的信息流,让模型动态重组层与层之间的连接关系。


一个国产AI小透明,连续两次刷新NanoGPT Speedrun世界纪录


在NanoGPT Speedrun中,Partitioned Hyperconnections将第73项纪录缩短了约0.66秒,MUDD Skip Connections则在第81项纪录中缩短了2.58秒。


(ps:由于两次提交基于不同版本的训练代码,这组数字不能作为严格的对比!)


结语


很多人认识彩云,可能还是因为彩云天气。


从小有名气的彩云小译、彩云小梦,到后来在模型架构方向持续投入的 DCMHA、MUDD,我一直Focus这家公司研究动态,是因为他们一直在攻坚一个还是比较重要的问题:


同样的计算预算,能不能训练出更好的模型?


对于大公司来说,几个百分点的效率提升,可能意味着大量 GPU、电力和训练时间的节省。


对于高校实验室和小团队来说,这几个百分点甚至可能决定一个实验能不能做下去。


Kimi、DeepSeek和彩云采用的技术路线并不相同,但它们都在尝试回答同一个问题:在算力越来越昂贵的今天,如何让每一次计算产生更大的价值。


也正因为如此,NanoGPT Speedrun 这样的公开竞速项目才有意义。


当然,需要说明的是,今天这篇文章中的爽文故事,测试对象仍然是 GPT-2 Small。这里提升 3%,并不意味着放大到百亿、千亿参数规模后依然能够获得完全相同的收益。模型规模、硬件环境、训练策略以及并行方式,都可能影响最终结果。


但至少在固定硬件、固定数据、公开代码和真实训练时间的条件下,彩云证明了一件事:


这些看似停留在论文里的架构优化,并不是实验室里的表格数字,而是真正能够改变训练过程的工程方法。


第 81 项纪录优化的是层间信息流动,让模型能够动态选择不同历史层的信息;第 85 项纪录进一步探索层内协作,让不同注意力头可以根据输入动态组合。


简单来说,一个是在思考“不同层之间的信息如何更高效流动”,另一个是在探索“同一层内部的计算如何更聪明协作”。


而这两次突破背后,还有一个容易被忽略的落差。


“Crazy 3 followers and doing stuff like this.”


这句感叹之所以引发共鸣,是因为它揭示了行业里的一个现实—市场的关注度,往往优先聚焦于拥有巨大算力集群和宏大叙事的巨头;但真正推动技术进步的,也可能是一群规模不大的团队,在代码细节里不断寻找突破口。


技术演进史,从来不只是由声量书写。


从 DC 到 MUDD,再到 NanoGPT Speedrun 中连续刷新纪录,彩云给出的其实是一条清晰的技术路径:发现架构瓶颈、提出优化机制、开源验证效果,再让整个社区继续迭代。


现在,彩云的两项纪录已经被后来者继续刷新。


但竞速项目的意义,本来就不是让某一个名字永远停留在第一名,而是让一个有效的想法进入公共代码库,成为下一次突破的起点。


也许未来的大模型竞争,不只是“谁拥有更多 GPU”,还会越来越取决于:


谁能让每一次计算,都变得更加值得。


今天的技术解读内容有点多,我给大家准备了技术的详细介绍,大家感兴趣的话,可以再仔细读读~


传送门: 

MUDD:

https://github.com/KellerJordan/modded-nanogpt/pull/259

MUDD Gates+ Lightweight DCMHA:

https://github.com/KellerJordan/modded-nanogpt/pull/315


文章来自于"夕小瑶科技说",作者 "夕小瑶编辑部"。

1
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

添加客服微信openai178,进AITNT官方交流群