GPU荒还没结束,CPU可能要被抢起来了

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

GPU荒还没结束,CPU可能要被抢起来了
AI资讯 2026-08-18 15:28
+10039 阅读

GPU荒还没结束,CPU可能要被抢起来了


2026 年 5 月 31 日,英伟达(Nvidia)宣布一颗拥有 88 个定制核心的 CPU 已经进入全面量产。它叫 Vera,采用 Arm 指令集和英伟达自研的 Olympus 核心,既会进入 Vera Rubin 超级计算平台,也会被单独装进 CPU 服务器。戴尔、惠普、联想、超微以及多家服务器厂商,已经开始制造搭载 Vera 的系统。


英伟达把 Vera 称作“第一颗为 AI 智能体打造的 CPU”。Vera 会与 Rubin GPU 组成一套平台,也会被装进独立 CPU 服务器。时隔多年,卖 GPU 的英伟达,又开始单独卖 CPU 算力了,这件事听起来似乎并不寻常。


GPU荒还没结束,CPU可能要被抢起来了

图丨 Nvdia Vera(来源:Nvdia)


过去三年,AI 产业的硬件焦虑几乎都围绕 GPU 展开。训练需要更多 GPU,推理需要更多 GPU,模型参数和用户数量增长后,答案仍然是增加 GPU。CPU 在这套系统里负责启动任务、搬运数据和管理服务器,很少成为投资者关心的主角。


直到 AI Agent 改变了任务的形态。


普通聊天机器人接收一段文字,运行一次模型,再生成一段文字。Agent 还要把模型的判断变成操作:读取文件、搜索网页、查询数据库、调用应用程序接口(API)、执行代码,再把结果送回模型。一次任务可能经历十几轮“推理—操作—观察”,每一轮都要在 GPU 与 CPU 之间切换。


GPU 仍然负责最重的模型计算,而解析模型输出、判断工具类型、发起请求、运行程序、管理文件、收集结果和安排下一轮任务等工作,则通常由 CPU 处理。AMD 计算与企业 AI 副总裁 Madhu Rangarajan 称,在公司测试的一条真实智能体流水线中,8 个阶段有 7 个完全运行在 CPU 上。这个比例来自 AMD 自测,不一定代表所有系统,但也足以说明:模型推理只是智能体完成任务的一环,而在这一环之外的所有协调工作都压在 CPU 上。


单个 Agent 带来的开销可能还不算大,但在规模化以后这个数字就会相当恐怖。


一个智能体可以同时调用多个工具,也可以创建子智能体。企业把同一套系统部署给数万名员工后,并发任务可能迅速膨胀。每个智能体都在解析输出、执行代码和读写数据,原本零散的 CPU 开销开始积累成容量需求。CPU 处理得慢,GPU 就要等待下一轮推理所需的输入。


安全检查也在增加这部分负担。智能体拥有的权限越多,系统越需要检查它打开了什么文件、调用了哪个接口、是否触碰敏感数据。规则匹配、日志分析和小模型审核通常留在 CPU 上运行,因为任务分散、延迟敏感,单独调用 GPU 未必划算。于是,智能体越自主,需要检查的环节就越多,CPU 的负担就越重。


今年 7 月 OpenAI 的智能体在一次内部安全评估中意外突破沙箱、闯入 Hugging Face 生产系统的事件,足以说明这类安全机制的重要性,也说明了它们在实际部署中会带来多少额外的计算开销。


另一个容易被忽视的负担是分词。


大模型处理文本前,要先把文字转换成 Token。这个过程包含大量字符串处理和条件分支,不像矩阵运算那样适合 GPU。普通对话的输入很短,分词延迟通常没有存在感;智能体会不断积累工具返回结果、代码、日志和历史操作,输入可能增长到数万甚至数十万个 Token。


佐治亚理工学院博士生 Euijun Chung 在接受 IEEE Spectrum 采访时举例称,在一些实现中,已有 10 万个 Token 的上下文再加入 1,000 个 Token 的工具结果,分词器仍可能重新处理整段输入。前缀缓存和增量分词可以减少重复工作,所以这并非所有系统必然采用的方式;长文本带来的 CPU 压力仍然存在。


Chung 团队在最新论文中测试了 Llama 3.1 和 Qwen3 等模型。在长序列、大批量配置下,分词最高占到首个 Token 延迟的约 80%。当 CPU 核心数不足,分词线程还会与任务调度和 GPU 内核启动争抢资源,导致 CPU 满载、而 GPU 未能跑满。增加 CPU 核心后,不同配置的首个 Token 延迟改善了 1.47—5.15 倍,而无需增加 GPU。


产业数据已经开始回应这一变化。2026 年 1 月,KeyBanc 根据供应链调查判断,Intel 全年大部分服务器 CPU 产能已经售出,AMD 的服务器 CPU 供应也接近满载,两家公司因此拥有了提价空间。这是分析机构的渠道判断,并非厂商披露的订单数据。


Intel 随后的财务文件给出了部分印证。公司称,服务器 CPU 需求在 2026 年第一季度超过可供应数量,内部产能限制预计持续至年底。服务器产品平均售价同比提高 27%,出货量却下降了 5%;Intel 将价格上涨归因于高端产品占比提升、需求定价和成本增加。


AMD 同期的数据中心业务收入达到 58 亿美元,同比增长 57%,增长同时来自 EPYC 服务器 CPU 和 Instinct GPU。AMD 没有单独披露服务器 CPU 收入增速,因此无法把这 57% 全部归因于智能体需求。


公司对未来的判断更加激进。AMD 此前预计服务器 CPU 市场年增长约 18%;2026 年 5 月又将预期提高到 35% 以上,预计市场规模到 2030 年超过 1,200 亿美元。AMD 给出的理由是,智能体需要独立的 CPU 计算层来承担编排、数据处理、工具执行和安全检查。


数据中心过去常用一颗 CPU 管理 4—8 颗 GPU。AMD 观察到,智能体系统正把这一比例推向 1∶1,部分负载使用的 CPU 甚至更多。这仍是供应商根据客户需求作出的判断,工作负载不同,实际配置会有很大差异。比例变化的方向却很清楚:多配几颗 CPU 已经不够,云厂商开始考虑为智能体单独建设 CPU 机架。


Arm 也在 2026 年 3 月第一次从出售处理器设计方案走向直接出售数据中心 CPU。其 AGI 处理器最多拥有 136 个核心,由 Meta 参与开发。Arm 预计,同等功耗下,智能体数据中心需要的 CPU 容量可能达到现有数据中心的 4 倍以上。


高通随后发布拥有超过 250 个核心的 Dragonfly C1000,并与 Meta 签署多代服务器 CPU 合作协议。Intel、AMD、Arm、高通和 英伟达在几个月内把“智能体 CPU”写进各自的产品路线,说明这轮竞争已经越过传统的 x86 市场,扩展到 Arm 服务器、自研核心和整机架设计。


英伟达在其中占据了一个特殊位置。它既销售造成 CPU 压力的 GPU,也销售缓解压力的 Vera;从处理器、网络到存储,整套设备都可以由 英伟达提供。Vera 因而不只是一次产品线扩张,它还要保护 GPU 的利用率。GPU 每减少一秒等待,都可能转化成更多 Token 和更高的机架收入。


不过,芯片厂商跟着钱走的时候,总有人要承担代价。和 GPU、存储芯片一样,这次产能的变化很可能又是由我们消费者来买单。


Intel 在 2025 年第四季度财报电话会上承认,公司正在尽量把内部晶圆供应转向数据中心,同时增加客户端产品的外部代工;管理层随后补充说,Intel 也不能完全退出客户端市场。到了 2026 年第一季度,Intel 客户端 CPU 的平均售价同比上涨 16%,销量下降 13%,公司预计供应限制至少持续至上半年。


客户端产品的变化不能全部算在智能体头上。Intel 自身的制程切换、内外部产能和内存供应同样影响了价格与出货。但在有限产能中,服务器芯片核心更多、售价更高,云厂商又愿意签订长期订单,生产资源自然也就开始向数据中心倾斜。


过去三年,普通消费者已经见识了 GPU 涨价和断货的滋味。接下来,同样的事可能发生在 CPU 上。


参考资料:

1.https://spectrum.ieee.org/ai-cpu-comeback

2.https://www.amd.com/en/blogs/2026/agentic-ai-changes-the-cpu-gpu-equation.html

3.https://arxiv.org/html/2603.22774v2


文章来自于"DeepTech深科技",作者 "加洋"。

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群