原生液冷不是液冷技术的“Pro Max”,Token工厂需要一次系统重构

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

原生液冷不是液冷技术的“Pro Max”,Token工厂需要一次系统重构
AI资讯 2026-08-03 15:51
+6952 阅读

原生液冷不是液冷技术的“Pro Max”,Token工厂需要一次系统重构


Token可以“热”,但Token工厂必须靠原生液冷“冷”下来。


从年初的“小龙虾”OpenClaw爆火出圈开始,Agent的爆发便势不可挡。


从单一模型的阶段性训练与推理,到大模型训练、多模型协同推理和海量Agent持续运行……AI任务正在进入一个“永远在线”的新阶段。


在2026世界人工智能大会(WAIC 2026)上,中国工程院院士、清华大学计算机科学与技术系教授郑纬民曾提出,单智能体的Token消耗量可达传统对话应用的百倍至千倍级。随着海量Agent并发调用模型、读写记忆、编排任务、执行工具,Token的消耗速度正以指数级飙升。


Token需求的暴涨,直接推高了AI基础设施的规模天花板,千卡集群不够用了,万卡、十万卡正在成为前沿大模型训练的标配。


但数据中心的电力和空间是有限的,要想满足没有上限的Token需求,核心的方向是在单位空间内塞进更多算力,把算力密度逼到极致。


算力密度提升,单机柜功耗必然飙升,从数十千瓦跃升至数百千瓦,并进一步向MW级迈进。


但这时问题出现了。当单柜功率到达这个量级,传统冷板液冷方案会导致机柜散热跟不上、空间不够用、互连被干扰,三条瓶颈同时在有限的空间里收窄。


Token工厂想继续扩产,计算、散热、互连、供电不能再各自为政,必须从系统底层找到新解法。


原生液冷,这个从系统层面将计算、散热、互连、供电耦合的方案,开始出现在行业视野。


01.

Token需求井喷

把传统液冷的三重困境逼出来了


Token需求爆发推高了单机柜功率,也把部署空间压到了极限。在这样的场景下,传统液冷的短板被急剧放大。原本在低功率密度下尚能运转的方案,如今在三个关键维度上同时亮起了红灯。


第一个困境是算力密度受限于全系统热管理。


高算力密度意味着单位空间内集成了更多芯片乃至HBM、内存、网卡、光模块等全系统部件,也意味着需要导出更多热量。在高密度部署下,传统冷板液冷“逐个加板”的方式终究难以追上全系统发热的增长速度。


一旦散热能力跟不上,芯片触发温度墙而降频,Token产出就从峰值开始持续衰减。散热跟不上,Token就掉速。


第二个困境是散热结构持续挤占计算空间。


当前冷板液冷占据了液冷数据中心市场93.5%的份额,但绝大多数方案的底层逻辑依然是将风扇、冷板、软管、分液器层层叠加。散热结构层层堆叠,不断挤占本属于计算单元的空间,进一步压缩单柜GPU的装载上限。


当机柜功率迈向MW级,这种空间矛盾被急剧放大:散热越复杂,挤占的空间越多,能放下的计算单元就越少,单柜Token产能上限就这样被锁死了。


第三个困境是散热与互连的冲突在MW级被放大。


Scale-up计算域扩大,需要更多计算节点和交换节点组成高带宽、低时延的统一系统。但在传统架构中,背板、线缆、风道、冷板、液路分别规划,互连路径被拉长,接口数量增加,通信时延上升。


当几十甚至上百颗GPU需要频繁同步数据时,哪怕微小的时延都会被成倍放大,多卡并行推理的整体效率被系统性压低。互连效率折损,Token生成就变慢。


三重困境指向同一个结论:Token工厂的问题已经超出了“散热”本身,而是计算、互连、供电、散热在有限空间内互相掣肘的系统性困局。


要同时摆脱这三重困境,必须从系统设计的源头重新思考——把计算、散热、互连、供电作为统一整体来规划。


02.

原生液冷:

从系统源头回应三重困境


那什么才是“从源头重新思考”的正确姿势?把冷板做大一点、把软管换粗一点……这些常规思路只能治标,要想治本,我们就需要换一种思路——原生液冷


传统液冷是“先定计算、再配散热”,在计算系统定型后再找空间塞液冷设备。原生液冷不是冷板液冷的“Pro Max”版,其本质区别体现在三个维度:


时间维度上,热设计从后置变为前置,不再是谁将就谁;在空间维度上,散热从分散覆盖走向全域管理,不再割裂;在逻辑维度上,优化的对象从单一散热部件上升为整个计算系统,计算、散热、供电、互连不再各自为政。


这种系统重构,正是沿着算力密度、空间密度和互连密度逐一展开,最终都指向Token产能


先看算力密度。原生液冷采用散热架构与计算架构协同的全系统热设计,通过一体化冷板与全域液冷重构,实现整个计算系统协同散热。


它跳出了传统冷板液冷架构分模块局部优化的思维惯性,将GPU、CPU、内存、网卡、光模块、SSD全部纳入统一热管理,整机柜算力密度可提升至传统方案的10倍以上


散热能力上去了,芯片在持续高负载下不掉频,Token产出稳定在峰值,不随时间衰减。


原生液冷不是液冷技术的“Pro Max”,Token工厂需要一次系统重构


再看空间密度。原生液冷通过系统结构重构,充分释放计算部署空间,采用一体化冷板和极简工程设计,实现零软管、零线缆、零风扇,装配接口减少80%,流阻降低60%,释放50%设备空间用于芯片、内存和互连等核心单元。


同样的机柜空间,可承载的计算单元数量大幅跃升。散热不再挤占空间,单柜Token产能上限被彻底打开。


原生液冷不是液冷技术的“Pro Max”,Token工厂需要一次系统重构


互连密度的突破同样重要。原生液冷采用无中背板正交直连架构,将计算节点与交换节点解耦,通过前后向最短路径构建高密、低时延的直连网络矩阵。


基于单GPU与Switch 4.8TB/s高速直连设计,64卡全互连架构可提供300TB/s互连带宽,支持224G高速数据传输。更短的互连路径意味着更低的通信时延、更高的多卡协同效率,让更多计算资源能够高效协同工作,集群整体Token吞吐能力被系统性拉高。


原生液冷不是液冷技术的“Pro Max”,Token工厂需要一次系统重构


03.

Agent时代需要两类算力底座

浪潮信息用原生液冷同时覆盖


从三重困境到三个维度的突破,原生液冷证明了系统重构的价值。


但架构逻辑成立之后,下一个更现实的问题是:这些能力最终如何落地为产品?Agent时代的算力底座,到底需要什么样的硬件支撑?


要回答这个问题,得先看清Agent的工作方式。一个Agent从接收指令到完成任务,要经历工具调用、记忆读写、任务编排、并行调度等多个步骤。而这些“编排调度”类任务,主要运行在CPU上。


换句话说,Agent的完整工作流是“两条腿走路”:GPU负责高速生成Token,CPU负责高效调度Agent。两类算力缺一不可,任何一端掉链子,整个Agent系统的响应速度都会被拖垮。


IT基础设施产品、方案和服务提供商浪潮信息,基于原生液冷架构,针对这两类需求分别推出了对应的高密整机柜产品。


先看GPU侧,浪潮信息的GPU原生液冷整机柜服务器,可在48U空间内承载千卡算力——单柜算力密度达到传统方案的10倍以上


它创新采用一体式SDAC冷板,将GPU、CPU、内存、网卡、光模块等热源在整块冷板上双面高密平面化部署,散热效率翻倍;互连方面,则首创无中背板MDP矩阵式直连架构,1024颗GPU与Switch之间通过高速直连形成高密全互连矩阵,支持千卡、万卡超大规模无损扩展


原生液冷不是液冷技术的“Pro Max”,Token工厂需要一次系统重构


最终交出的成绩单是:单柜功率覆盖330kW至1MW,大模型吞吐达到146万tokens/s。一个MW级机柜就能撑起一条高产的Token产线,持续满速输出,不降频、不掉速。


但光有GPU还不够。浪潮信息同步推出了CPU原生液冷整机柜服务器,基于液冷OCM架构,单柜集成384颗CPU,支持4万以上Agent高并发运行,确保高负载下不掉频、不降速,让Agent的调度响应始终保持在低延迟状态。


GPU整机柜负责高速生产Token,CPU整机柜负责高效调度Agent——两类算力底座在统一的原生液冷架构下协同工作。


从Token生成到Agent执行,全链路不再有散热瓶颈拖后腿,也不再出现某一端掉速导致整体排队的情况。原生液冷系统性地支撑起算力产线,让Token从生成到执行始终保持高效。


04.

结语:硬件趋同

系统架构能力才是Token产能天花板


当下,AI基础设施赛道硬件层面的差距正在收窄。各家厂商能采购到的核心器件几乎一样,芯片本身的性能天花板也越来越透明。你有的GPU,别人也有;你用的HBM,别人也能买到。单纯的硬件堆砌已经拉不开身位了。


当GPU、HBM、网络芯片逐渐趋同,电力和空间成为AI基础设施的硬约束时,真正的分水岭在于:谁能把这些相同的组件组织成更高效率的算力Token产线。


同样的千卡规模算力,放进不同的机柜系统架构里,最终的Token产出可能差出30%甚至更多。差距不在芯片本身,而在芯片与芯片之间如何通信、热量如何导出、供电如何分配、空间如何利用……这些系统层面的设计选择,最终决定了每一颗芯片的性能有多少能被真正释放出来。


这就是系统架构能力的价值所在。


它是对算力转化上限的物理层定义:什么样的散热方案能让芯片持续满频运行?什么样的互连拓扑能让多卡协同不产生通信瓶颈?什么样的空间布局能在有限机柜里塞进最多的计算单元?


这些问题没有标准答案,考验的是在计算、散热、互连、供电之间权衡与协同的架构设计功底。


原生液冷,正是这种系统级创新的物理层体现。


文章来自于"智东西",作者 "王涵"。

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群