英伟达震撼开源Harness!AI自己爆改AI

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

英伟达震撼开源Harness!AI自己爆改AI
AI资讯 2026-09-11 10:47
+6050 阅读

OpenAI之后,老黄也出手了!


终于,英伟达重磅开源了自家的Harness——SoL-Pi。


它把Pi作为底盘,基于此重造了一套Harness效率增强层,让AI实现自我迭代、优化。


英伟达震撼开源Harness!AI自己爆改AI


在这套严苛的自动化流水线中,AI自己也当上了研究员。


它们观察Agent怎么干活,找出哪些步骤在白白烧Token,提出方案、修改bug,再把方案送进测试。


AI的整个搜索从152个候选方向开始,最终留下了四大杀手级架构机制。


实测结果,令人咋舌——


Token消耗最高省64%,API调用成本骤降50%-54%。


英伟达震撼开源Harness!AI自己爆改AI

GitHub传送门:https://github.com/NVlabs/SoL-Pi


在专业的研究场景下,每小时可直接省下8.75美元至13.5美元。英伟达,把AI省钱的开关开源了。


配置非常简单,仅需一行代码:「pi install git:github.com/NVlabs/SoL-Pi」,即可装到现有的Pi上。


Codex狂飙代码

一半Token却在空转


在让AI递归改进自己之前,能不能先让它把自我改进的账单打下来?


Harness,模型干活时使用的整套运行框架,是当下最好的解。


模型负责推理,Harness负责把工具、上下文、执行反馈和任务流程组织起来,让模型能够读文件、改代码、跑测试,并根据结果继续行动。


同一个模型,放进不同的Harness里,做事效率可能差出一截。


英伟达震撼开源Harness!AI自己爆改AI


当前的问题在于,编程智能体的任务越来越长。


从补几行代码,到跨仓库修复问题,再到长时间自主工作,单次任务可以持续数小时。


这时候,一些平时不起眼的Token浪费,会不断累积。


改完文件,明明下一步就是跑测试,模型还要再推理一轮。一个大文件早已读过,后续请求仍在反复携带它。


几千行日志里,真正影响决策的可能只有几行,昂贵的模型却要从头读起。


英伟达震撼开源Harness!AI自己爆改AI


递归自我改进(RSI),同样绕不开这笔开销。AI每尝试改进一次系统,都要花Token。失败的方案,也照样收费。


SoL-Pi的出现,要解决的就是这件事。


最终结果显示,和底座Pi相比,SoL-Pi少用45%到49%的token,成本低大约三分之一,平均得分保留94%左右。


和Codex、Claude Code原配的harness相比,token少35%到64%,标价成本低50%到54%。


英伟达震撼开源Harness!AI自己爆改AI


这么惊艳的表现,SoL-Pi是如何做到的?这就不得不详细拆解下,它的核心四大机制了。


AI卷自己进化,四个大招来了


英伟达的流水线最终留下了四个机制,刀刀避开主干,专治重复劳动。


第一层:动作融合,一次调用完成编辑与验证


Action Fusion直击的是两次工具调用之间,那段多余的模型决策环节。


在基础Pi的运行轨迹里,最常见的序列是修改文件、收到结果,然后再调用命令去测试或者构建。


既然后续命令已经非常明确,中间这轮模型的「一来一回」就有了极大的压缩空间。


英伟达震撼开源Harness!AI自己爆改AI


动作融合将一次编辑及其后续命令保留在一个本地序列中,省去了中间的模型决策环节


Action Fusion直接把编辑和后续命令封装进同一个本地执行序列。


Harness在底层完成修改、运行命令,再把合并后的结果一次性返回。测试照常执行,结果正常获取,但中间那轮模型请求被成功省去。


这相当于把两次分散的请求,合并为了一次高效的闭环操作。


第二层:在线上下文压缩,按子任务动态核算成本


Online Context Compact,解决的是「何时触发压缩」这一核心痛点。


上下文越长,历史材料越容易变成算力与资金负担。


但压缩也是有代价的:重写上下文可能会打断已有的KV-cache复用,需要重新支付处理成本。


因此过早压缩未必省钱,过去的策略往往是把压缩动作尽量推迟。


英伟达震撼开源Harness!AI自己爆改AI


在线上下文压缩将已完成的子任务视为潜在的压缩点,然后等待后续请求能够偿还重写成本时再执行


SoL-Pi重构了判断时机,它把大任务拆分为子任务,每完成一步,就重新进行评估。


其核心逻辑在于精准计算:只有当「未来预计省下的开销」能够覆盖「本次重写的成本」时,系统才会真正执行压缩操作。


第三层:输出归档与索引,大块文件按需召回


ObservationPack,专门处理大段工具输出造成的「重复计费」问题。


一个大文件或一份超长结果,首次读取后如果一直滞留在上下文里,后续每一轮请求都会原样携带它,持续消耗缓存资源。


英伟达震撼开源Harness!AI自己爆改AI


ObservationPack用稳定的句柄取代了重复的完整输出,同时保留原始内容以便分页召回


SoL-Pi的做法是把完整内容直接归档到本地磁盘,上下文里只留一个稳定的短句柄和一小段摘录。


这就像读完长篇报告后,直接把原件存档,手边只留索引和关键摘要。模型需要查阅细节时,直接根据索引按页取回即可。


第四层:小模型初筛日志,引入严格的证据核验机制


Evidence-Preserving Reducer的核心,是把长日志的第一遍阅读委派给成本更低的模型。


构建和测试日志动辄上万字,真正影响下一步决策的往往只有几行报错。让前沿大模型每次通读全文成本极高;可直接交给小模型去总结,又容易引入幻觉。


英伟达震撼开源Harness!AI自己爆改AI


证据保留归约器仅在可对照存档日志核验其证据时,才接受紧凑的诊断回执


SoL-Pi在中间加了一道严格的防线——证据核验。辅助模型读完日志后,必须输出一份紧凑的诊断回执。


系统会拿着这份回执,逐条与归档的原始日志进行比对。只有严丝合缝对得上的原文,才会被放行交给前沿大模型。


这确保了主模型只接收被证实的信息,从源头上切断了误差传导。


152个点子厮杀,只留下4个


为什么是这4个机制?这就得说到英伟达真正的野心,RSI(递归自我改进)。


既然AI能改代码,也应该能改造「生产AI的系统」。


但RSI太烧钱,每一次试错都要付token费。于是英伟达换了个目标——先别急着让AI更聪明,先让它更省钱。


相比直接追分,token效率更难作弊。刷任务分数很容易过拟合,给特定题目写规则就行;但删重复上下文、压缩工具输出、合并无效决策,这些优化能迁移到不同任务和模型。


于是,一条「Agent研究Agent」的流水线启动了:


团队先搭出535个可验证环境,再让AI提出152个优化方向,随后经过三轮筛选——


先用历史轨迹估算收益,没潜力的直接淘汰;再让AI自己改代码、跑实验,并由Reviewer Agent挑刺;


最后冻结方案,在完全隔离的held-out任务上验真,能力不能掉,效率必须涨。


英伟达震撼开源Harness!AI自己爆改AI


152个想法,最终只活下来4个,平均约40个才能出1个。


于是SoL-Pi的核心方法也逐渐清晰:让AI大量提出假设,再自动实验、淘汰、验证,把真正有效的少数机制筛出来。


让RSI飞轮,自己转起来


SoL-Pi背后,是MIT副教授、英伟达研究总监韩松掌舵的Efficient AI团队。


对他们来说,SoL-Pi当前省下了多少token开销,不过是一个阶段性注脚。


他们真正看重的,是这条「AI研究AI」的飞轮还能转多大。


在官方项目的主页中,团队还埋下了两个极具野心的长线伏笔:


一个是「闭环预训练」(Pretraining the harness)。


目前的535个环境依然是人工构建的,未来将由Agent自己去全网收集任务、搭环境、验证、更新自己的harness。


算力和环境多样性一旦拉升,harness很可能也会跑出属于自己的Scaling Law。


英伟达震撼开源Harness!AI自己爆改AI


另一个是「效率复利」(Efficiency for efficiency)。


用变省了的harness,去跑规模更大、成本更低的自动研究循环,进而找出更高效的机制,形成成本压缩的复利效应。


在这个飞轮里,人只负责在初期提供先验方向;一旦进入循环,从研究到验证全程零干预;等AI把机制跑通了,人再回来搞清楚AI到底发现了什么,并将机器生成的粗糙代码重构成符合工业标准的版本。


现在,模型的Scaling Law各家还在争论不休;但Harness的Scaling Law,已经有人开始抢跑了。


而那个在赛道上狂奔的,是AI自己。


参考资料:

https://nvlabs.github.io/SoL-Pi/ 

https://github.com/NVlabs/SoL-Pi 

https://x.com/MaxForAI/status/2098050525279478059


文章来自于"新智元",作者 "桃子 摩西"。

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群