梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

梁文锋狙击战:深扒那些梁文锋署名的论文有多牛
AI技术研报 2026-09-25 10:13
+8396 阅读

过去三年,梁圣署名了11篇论文,每篇都几乎震动世界。


当 RSI 的风吹到了 DeepSeek,这次讨论的是一个新话题“自动化沙箱”。


9 月 19 日,arXiv 更新了一篇 DeepSeek 新论文《DSec:面向大规模智能体训练的高效沙箱基础设施》,论文长达 31 页,首次展示了 DeepSeek 自动化沙箱系统 —— DSec(DeepSeek Elastic Compute)。它是专门应用于其内部超大规模智能体(Agent)强化学习与评测体系的生产级底座,能为每一次训练任务秒级创建独立的虚拟“新考场”。


DSec 的工程能力十分惊人。每日可自动运行 300 万个沙箱环境,单生产单元横跨 160 个 CPU 节点。通过严苛的权限隔离,DSec 不仅能防止 AI 作弊,还能对 AI 在沙箱内每一步环境反馈的精准复现。


这篇论文是这轮 RSI 革命在工程深水区的探寻,在Agent强大到频频失控,甚至意识到自己被“监控”,隐藏起思维链的2026年,沙箱不再是附庸的安全配件,它既是AI进化的训练场,也是锁死 AI 破坏力的关键防线。


而拥有这样前沿意识的,正是通讯作者栏里那个熟悉的名字 —— 梁文锋。


过去三年,梁文锋极少以第一作者或通讯作者身份,出现在 V3.2、V4、V4.1-Flash 这些动辄上百人署名的旗舰模型整体报告中;却始终把名字签在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理算子、DSec 智能体沙盒这些最底层的原子技术论文上。


整整 11 篇 梁文锋署名的论文,串起的是一部精准瞄准行业核心痛点、直击底层内核的技术狙击史。


1.《DeepSeek LLM: Scaling Open-Source Language Models with Longtermism》

2.《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》

3.《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》

4.《DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence》

5.《DeepSeek-V3 Technical Report》

6.《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》


7.《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》 

8.《Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures》

9.《mHC: Manifold-Constrained Hyper-Connections》

10《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》

11.《DSec: An Efficient Sandbox Infrastructure for Large-Scale Agent Training》


2024 年初的破局之战:


买不起一万张显卡,那就打效率战


2024年初的大模型行业,深陷算力规模的军备竞赛。稠密模型的缩放定律几乎等同于 "烧钱定律",整个赛道被万卡集群、数亿美金的投入门槛圈成了一个巨头专属的 “顶级俱乐部”。


能坐在牌桌上的玩家屈指可数:OpenAI、Google、Anthropic、Meta。像OpenAI的GPT-4 级别模型需要上万张高端 GPU,单次训练物料成本超过 6300 万美元,训练成本动辄数亿美元。


算力资源直接决定了模型能力的天花板。对所有初创公司而言,沿着巨头定下的稠密模型路线追赶,永远只能活在对方的阴影里。


像 Stability AI 这样的明星开源公司 ,2024 年因无力承担高昂的 GPU 云租赁费用,资金链断裂,CEO 黯然离职;Inflection AI 同样扛不住稠密模型持续翻倍的训练成本,2024 年 3 月核心团队被微软反向并购,退出了通用大模型内卷。


国内一众曾在 2023 年喊出 “百模大战” 口号的初创团队,到 2024 年初直面 “万卡集群” 的硬件门槛时,仅凭几百、上千张卡的作坊式训练规模,直接遭遇降维打击,纷纷掉队。


梁文锋的第一波狙击,直接打在了 "算力与能力线性绑定" 这个底层规则上。《DeepSeek LLM》、《DeepSeekMoE》、《DeepSeek-V2》正是这段时间的作品。


《DeepSeek LLM》


2024 年 1 月 5 日,梁文锋团队发布《DeepSeek LLM》,这是 DeepSeek在全球开源社区的首秀,直接给浮躁的“参数军备竞赛”泼了一盆冷水。


经过严密的数学推导与验证,他们发现在算力固定的前提下,盲目扩大模型参数并非最优解,提升数据质量与数据密度的配比,反而能带来更强的模型能力。


在这套思路下,团队在 2 万亿优质中英双语 Token 上训练出 DeepSeek LLM 7B 与 67B 两个版本。其中仅 67B 参数的版本,就在代码、数学与推理基准测试中全面反超当时的开源标杆 Llama-2 70B,更在开放对话测试中击败 GPT-3.5。


这是梁文锋技术路线打响的第一枪,“我可以用更少、更精密的算力,训出比你更聪明的开源模型。”


《DeepSeekMoE》《DeepSeek-V2》


随后,就是大众熟知的经典之作《DeepSeekMoE》《DeepSeek-V2》,直接重构了传统 Transformer 架构。


DeepSeekMoE 架构通过细粒度专家动态路由与共享专家隔离,让每个 Token 仅调用少量专家参与计算,直接将训练开销降低 42.5%。


首创的 MLA 多头潜在注意力机制,精准击破了长上下文推理的“成本黑洞”,利用低秩潜在向量压缩,将 KV Cache 的体积极限压缩了 93.3%。


基于这两项技术突破诞生的 DeepSeek-V2 ,凭借比肩 GPT-4 的性能和极低的成本震惊世界。它把千 token 推理成本打到了此前的几十分之一,直接引爆了国内大模型 API 的价格战。


这不仅让 DeepSeek 挤进核心牌桌,成为性价比代名词,更把一大批买不起算力门票、濒临出局的边缘玩家,连同整个开源社区,重新拉回赛场。


2024 年到 2025 年的能力击穿战:


冲击闭源模型的智力高地


如果说第一阶段解决了 "用低成本做出可用模型" 的问题,那么第二阶段的梁文锋,把这条低成本路线推到极致,追赶闭源模型的顶级水平。


《DeepSeek-Coder-V2》2024 年 6 月,DeepSeek 发布《DeepSeek-Coder-V2》,率先向闭源模型垄断最深的代码垂直领域痛下杀手。


在大模型行业发展的早期,开源模型在复杂代码生成、前沿数学推理等领域,始终无法赶超闭源模型,这背后的原因,既有高质量代码数据的稀缺,也因为老架构算力效率低下。而闭源厂商有几万张 H100 ,可以不计成本地依靠丰富的物理硬件资源,强行堆砌出高端的代码与推理能力,形成商业垄断。


而梁文锋在新架构基础上,额外注入了 6 万亿高质量中英代码与数学数据进行持续预训练。将支持的编程语言从 86 种扩充至 338 种,上下文窗口直接拉满至 128K。


最终, DeepSeek-Coder-V2,在 HumanEval、Codeforces、LiveCodeBench 等主流代码基准上,首次全面超越 GPT-4 Turbo、Claude 3 Opus 等闭源顶级模型。


这次尝试既验证了新 MoE 架构的高端能力,还把推理价格打了下来。其每百万 Token 的输入价格仅为 0.14 美元,输出价格仅为 0.28 美元。作为对比,当时闭源世界的霸主 GPT-4 Turbo 每百万 Token 输入需要 10.00 美元,输出高达 30.00 美元。在提供同等甚至更强代码智能的前提下,DeepSeek 的价格仅为 OpenAI 的约百分之一。


这直接把高端代码智能的调用成本打至近乎可忽略的 “水电费” 级别,让不少中小企业或独立开发者可以构建自己的 Agent 团队。


《DeepSeek-V3》随后,2024 年底,DeepSeek团队做了新 MoE 架构的超大规模尝试。


在不到2个月的时间,他们仅凭 2048 块 H800 显卡,就从头开始训出顶级模型 DeepSeek-V3。它的参数高达671B ,总成本才 560 万美元,这个数字直接让硅谷破防。当时,同等能力级别的闭源模型,训练成本通常是它的数倍甚至十倍。


当时不少人戏称,“中国团队在用自行车的预算造火箭”。


虽然,科技分析机构 SemiAnalysis 等在复盘时调侃道,这 560 万美元只是“纯 GPU 烧电训练的最浅层账单”,不包括前面的研发亏损、卡群折旧和高达 13 亿美元的基础硬件大总账。但这并不妨碍大家拿这张“漂亮的收据”去羞辱那些动辄要募资 1000 亿美元的硅谷大佬。


560 万美元成为全行业拿来公开处刑的标尺。


而这一切的奥秘藏在了《DeepSeek-V3》论文里,梁文锋团队做了三件事,把每一分算力都榨到极致。一是用无辅助损失的专家负载均衡策略,让所有专家均匀分配任务;二是用更精简的 FP8 数值精度做训练,让显卡的计算效率直接拉满;三是训练大模型时,让“数值计算” 和 “数据传输”并行启动,把硬件的空闲时间压到几乎为零。


这一战彻底证明了, 新 MoE 架构不仅能进行超大规模训练,还能以极低的成本稳定地训练完成。


《DeepSeek-R1》真正奠定 DeepSeek 行业一哥地位的,来自 2025 那场春节。


在此之前,硅谷牢牢把持着 “深度推理” 的话语权,将其塑造成万卡集群、海量名校博士手工标注才能堆出来的昂贵特权,OpenAI 的 o1 更是被奉为闭源推理的标杆。


DeepSeek-R1 的横空出世,直接斩落了闭源推理王牌 o1。而整个强化学习阶段仅耗资 29.4 万美元,这在动辄需要数千万、数亿美元“强化学习预算”的硅谷面前,无异于降维打击。


在《DeepSeek-R1》论文中,其核心突破在于团队提出的组相对策略优化(GRPO)算法。首次严谨证明无需大规模监督微调(SFT),仅通过纯强化学习,大模型就能自主涌现出链式思考能力;其中 R1-Zero 版本,完全从零冷启动,不依赖任何人工标注数据,仅凭 RL 训练就达到了接近闭源顶级推理模型的水平。


这项成果的影响力迅速突破行业圈层。它后来登上《Nature》杂志封面,成为首个获此权威认可的主流大模型成果。《麻省理工科技评论》《纽约时报》《华盛顿邮报》、CNBC、英国《金融时报》等西方主流媒体密集报道,惊呼美国对中国人工智能领域的限制,根本无法阻止中国在这一领域取得进步。


国内更是掀起了 R1 热潮。无数科技从业者连夜研读技术报告,科技媒体扎堆跟进报道,DeepSeek 从 “性价比黑马” 摇身一变,成为 “全球 AI 底层范式定义者” ,走进大众视野。梁文锋也被请到了政府座谈会上,分享中国 AI 的发展。


梁文锋还顺手把 R1 的硬核逻辑‘蒸馏’给了全球所有开源小模型,直接解构硅谷资源霸权。


梁文锋狙击战:深扒那些梁文锋署名的论文有多牛


《Native Sparse Attention》《Insights into DeepSeek-V3》


拿下推理能力的高地之后,这一阶段,梁文锋的狙击范围还在向更底层延伸,把成本战下沉到芯片的微观访存逻辑里,解决长文本训练与推理的物理成本问题。


此前业内解决超长上下文,都爱用 “稀疏注意力”,这是个纸上谈兵的技术,真跑在 GPU 上就水土不服,并没有省很多算力。


2025 年 2 月,团队提交《Native Sparse Attention(原生稀疏注意力,NSA)》论文,没有停在应用层做小修小补,直接用 Triton 语言重写了最底层的硬件计算算子。NSA 创造性地设计出分层动态稀疏策略,让稀疏计算的访问节奏,精准对齐 NVIDIA GPU Tensor Core 的微观电路结构,这相当于给算法量身定做了适配硬件的 “跑道”,让稀疏计算能在硬件上全速跑起来。


而且,NSA 是从预训练第一天起就把稀疏性刻进模型里的原生技术,全程不损失模型精度。这直接让模型前向传播速度提升 9 倍,长序列解码速度直接拉高 11.6 倍。


NSA 斩获 ACL 2025 最佳论文奖,也成为了下一代长上下文大模型公认的标配技术方向。


2025 年 6 月发表于 ISCA 的《Insights into DeepSeek-V3》,从计算机体系结构视角,拆解了大规模 MoE 训练的内存墙、通信墙瓶颈,分析了 MLA、MoE 路由、FP8 精度与 GPU 硬件的协同关系,甚至给出了下一代 AI 加速芯片的设计建议。相当于把中国大模型的工程经验,变成了全球芯片行业的可参考的指南。


这一波把 DeepSeek 的技术影响力,从算法层延伸到了硬件层。


2025 年末的深水区攻坚战:当 AI 冲进无人区,用数学重构底座。


2025 年末的深水区攻坚战:


当 AI 冲进无人区,用数学重构底座


当模型规模冲到千亿级、网络层数突破上百层,行业彻底进入了无经验可循的 “无人区”。大模型的竞争,也从参数规模的比拼,悄然变成了深层网络拓扑的数学命题。


大模型由上百层网络堆叠而成,训练时信号与梯度要在层间反复传递。过去十年,全行业都沿用经典的残差连接,也就是著名的 x + F (x) 范式。


它像一条保留了直通车道的公路,前一层的信号可以原封不动地流向深层,以此缓解梯度消失,让深层网络得以训练。但当模型做到极深、极宽,这条范式就触到了天花板:数值稳定性不足,梯度很容易在百层传递中逐渐消散或者失控暴涨,训练中频繁出现 Loss Spike(损失突增),一次失控就可能让数千万的算力投入付诸东流。


学界此前提出过超连接架构,相当于把单车道升级成多线并行的高架立交桥,允许多路信号同时交叉、融合,理论上能大幅提升网络的表达能力。但这种架构缺少数值边界约束,信号越传越偏,深层训练极易发散,始终停留在实验室阶段,无法大规模落地。


2025 年 12 月 31 日,梁文锋团队在《mHC》论文中,给出了一个极其优雅的数学解法 —— 流形约束超连接(mHC)。


mHC 相当于在立交桥的所有出入口架起了一道透明的 “数值护栏”:它强制要求所有层间的交互映射矩阵,必须严格落在由双随机矩阵构成的特定数学区域 ,即Birkhoff 多面体流形之内。这样一来,无论多路信号在层间怎么交叉、融合、传递,整体的数值尺度始终保持守恒,从数学底层解决了超深层模型训练不稳定的根源问题。


这一步,梁文锋已经在解决 “规模堆上去之后会不会崩” 的底层数学问题,从拓扑层面,重新定义了深层网络的连接规则,也为千亿甚至万亿参数的极限模型,打下了稳固的数学地基。


2026 年的终局卡位战:


把战火烧到 Agent 基础设施层


进入 2026 年,全行业都已认准下一个主战场:智能体(Agent)。几乎所有厂商的注意力,都集中在模型的推理能力、工具调用能力、任务完成率这些显性指标上。而梁文锋已经开始注意到更底层的东西,Agent 训练的基础设施。


《DSpark》2026 年 6 月,DeepSeek在《DSpark》中提出一个“推理加速”工具——DSpark,它解决的是大模型生成回答的速度问题。


大模型生成回答时,越到后面越慢;当很多人同时用 AI 时,速度就更拉跨。


DSpark 让 AI 生成回答时,不再压榨单个算子的计算速度,而是动态调整生成节奏:有把握的地方就提速,容易出错的地方就慢下来。从根本上避免“猜错要回滚重算”的浪费,把“事后补救”变成了“事前规避”。


在多人同时使用的高并发场景下,DSpark 能让每个人的生成速度提升 60%–85%。


DSpark 之所以重要,是因为它把推理效率的比拼,从“谁的芯片更快”拉到了“谁的调度更聪明”这个层面。现在的大模型正从“答一次题”走向“全天候帮人干活”。当所有人同时发起请求,对基础设施的考验完全不同。这套思路,正是在为“百万人同时用 AI 干活”的未来提前打好地基。


《DSec》另一方面,底层的沙箱基础设施,可能会是大规模 Agent 训练的关键瓶颈。


Agent 的强化学习需要在可执行环境中反复试错,百万级的交互迭代就需要百万级的沙箱环境。传统沙盒方案启动慢、密度低、成本高、安全隔离差,根本支撑不起日均百万级的生产级训练任务。


它们是为“验证代码”设计的,不是为“培养智能”设计的。


9 月,DeepSeek 发布自动化沙箱 DSec,每天可运行约 300 万个沙箱,并发承载 38 万个实例。同时内置完整防作弊机制,保证训练交互数据的真实性。


在此之前,各家厂商的 Agent 沙盒都是内部定制的黑盒,没有统一标准,也没有公开的生产级参考方案。DSec 的发布,相当于第一次把 Agent 大规模训练的基础设施标准化、公开化。


更关键的是,这是一次典型的 "提前卡位"。当同行还在打磨单个 Agent 的任务能力时,梁文锋已经在搭建能支撑百万级 Agent 并行训练的基础设施。


技术狙击手的哲学


回望三年,梁文锋署名的这 11 篇技术论文,从成本战出发,专挑最底层、最硬核的地方下手。


从 MoE 重构算力成本,到 MLA、NSA 击穿长上下文瓶颈;从 R1 颠覆推理范式,到 mHC 筑牢数学底座;从 DSpark 榨干推理效率,到 DSec 卡位 Agent 基础设施。


梁文锋之所以被尊称为“梁圣”,正是在于他的每一步都精准踩在了技术演进的节点上,他的每一枪都解决了行业的致命痛点,最终完成了 AI 的技术普惠。


真正的狙击手,从不炫耀枪支的口径,也不比拼弹药的数量。他只关心一件事:用最精准的打击,完成最致命的突破。而这条 "底层击穿" 的技术路线,或许正是中国大模型在全球竞争中,最有价值的差异化路径。


文章来自于微信公众号 “AI科技评论”,作者 “AI科技评论”

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

5
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

添加客服微信openai178,进AITNT官方交流群