分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA
AI技术研报 2026-07-26 15:38
+7884 阅读

刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。


他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。


分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA


他们的视频播客里披露:十几名员工,配上约 400 个 Agent Workers,两个月做完了这套 Deep Search 系统(这 400 是整个项目里参与分析、开发、实验和评审的执行单元,具体任务再临时组队)。


分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA


① 先把它想成一个准备考试的学生


就像学生可以改学习资料、换解题方法、调整计算器,分析自己上次为什么答错。但永远不知道标准答案、也不知道阅卷规则。最后,新方法到底有没有用,由一位独立考官测试,考过保留,没过就退回。


论文把这套考场规则叫optimization contract。人类先写清楚要提升什么能力、允许 agent 改哪些部分、每轮能用多少资源、什么情况必须停。AI optimizer负责找问题和试新方案,isolated evaluator像独立考官,只给分数和必要的错题反馈,不泄露答案;gate决定这次修改是保留、拒绝,还是交给人判断。


每轮实验都会写进shared experience memory。成功方法留下,失败方法也留下,并注明当时用了什么数据、工具和评测版本。这个 memory 由 agent 自己维护,作用很像学生时代的错题本


我也看了他们在youtube的访谈,访谈把 memory 讲得比论文更具体。


它实际上分两层:第一层:保存所有原始日志,用于审计、复现,以及从任意 checkpoint 重启;第二层:把日志整理成结构化经验,比如当时看到了什么、证据链是什么、人类有没有介入、方案为什么通过或被拒绝。


更有意思的是,经验也有保质期。搜索工具和网页一变,过去有效的方法可能就失效了,系统会自动重新 review,把过期经验标出来。


所以严格来说,它不只是错题本,更像一本会自动修订旧答案的实验室 Wiki。


分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA


整套流程叫 AI4AI,核心是一个四步循环:Research → Development → Review → Record


分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA


  • Research像研究员做复盘。AI 看上一轮分数、失败案例、历史实验和人类意见,判断问题出在数据、训练,还是工具与运行方式,再提出一项能验证的改动。但它不能天马行空:可改范围、预算和风险边界都写在 optimization contract 里,隐藏答案也看不到。
  • Development 是把方案做出来,产出一个待测新版本,但不能提前偷看独立评测,更不能碰 gate。太贵的方案可以先跑便宜的小实验,过筛只说明“值得继续花钱”,离上线还远着。
  • Review 才轮到独立验收。isolated evaluator 用同一套版本化规则比较新旧版本,gate 只给accept、reject、escalate三种结果,模糊、高风险或越界的情况交给人。提方案的人不能顺手改阅卷规则,更不能自己签字上线。
  • Record 是给实验室写档案。无论成败,代码、数据、prompt、模型与评测版本、资源、trace 和评审意见都要留下,连同适用条件一起写进 shared memory,下一轮才不会重踩旧坑。


他们管这套东西叫bounded-exploration AI4AI。核心逻辑:人定义好目标、预算和边界,AI 在这个框里自己诊断、自己改、自己测试,但最终能不能合并进主分支,那张门禁卡还是捏在人手里


② 这个框架真正拿来做 Deep Search agent 时,主要做了三件事


第一,搭一条自动命题流水线。


普通 QA 搜一个关键词就能找到答案,训不出真正的搜索能力。但人工出难题太慢,一天写几百道就到头了,喂不饱训练。


所以团队干脆把出题这件事本身也自动化了:先把抓来的网页连成一张证据图,网页是节点,超链接和引用是边;再从图里随机捞一个连通子图,把散落在几个页面上的证据拼成一道题;最后自动把题面里直接出现的人名、日期、机构换成间接线索,比如不说“2021 年”,说“在那家公司搬到新总部的第二年”。


整条线不需要人坐在那里出题,所以能一直往下跑,源源不断产出必须多跳查找、还得自己做消歧的搜索任务。模型靠背关键词是过不了的。


第二,只让模型学习“它当时真的看见了什么”。


长任务里,后台完整档案可能保存了所有搜索结果,但 agent 当时脑子里的东西早被压缩或折叠过,早期搜到的网页,可能只剩一句摘要。


如果训练时把完整档案都喂给它,就像学生考试时只看到半页材料,复盘时却拿着整本答案在学。学的时候什么都齐全,真上考场又只有半页,自然对不上。


所以训练数据必须严格对齐它做任务时实际能看到的版本,包括摘要过的、折叠过的那部分历史。


第三,工具和复盘系统一起改。


agent 始终只有三个工具:search固定返回 top-10,scrape负责取网页内容,python在单个任务里保留变量和文件。系统同时保存完整档案和 agent 每一步实际看到的版本。


这样答错的时候,能分清到底是没搜到、网页没抽对、旧证据被挤掉了,还是证据明明在眼前却没用上


结果:


  • XYZ-Aquila-mini(基于 Qwen3.6-35B-A3B):在小于 40B 的 open-weight 组里,七个 benchmark 全组最高,比如 LiveBrowseComp48.7,下一名 41.4。
  • XYZ-Aquila-pro(基于 Qwen3.5-397B-A17B):小于 400B 组的六项全部领先,WideSearch81.2,下一名 75.6。对比更大的闭源前沿模型时,也在BrowseComp-ZH、LiveBrowseComp、WideSearch 拿到最高分。


分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA


③ 全文我觉得最有意思一件事:AI 自己提出了人类没想到的改法


团队原本觉得,让 agent 自己决定什么时候整理 context,会增加它的负担,所以这个方案根本不在人类最初的尝试清单里


结果 AI 分析历史日志后,主动提出了active compact:由 search agent 自己判断什么时候该整理上下文、保留哪些证据,并且把方案实现了。人类只负责验收效果,以及检查有没有 ground truth 泄漏。


这个例子非常重要。它第一次具体回答了:AI4AI已经超出“替人跑实验”了:从失败记录里看出问题,提出人没想到的方向,然后自己动手做出来。


④ AI4AI 和 AutoML 到底差在哪


这个问题他们博客里专门写了。


AutoML 通常是在预先划定的空间里,优化模型架构、训练方式和参数。AI4AI 改的是包含模型在内的整套系统:数据怎么造、工具怎么调用、harness 怎么运行、评测怎么做、infra 怎么优化,都在范围内。


而且 AutoML 更像按数值规则不断试参数,AI4AI 会读历史实验、总结失败原因、参考人的意见,再决定下一轮改哪里


这两年AI4AI一直是海外前沿实验室探索的重点。


2025 年OpenAI用 PaperBench 测 agent 能否从零复现 20 篇 ICML 论文,8316 个任务,最好成绩 21.0%,低于 ML PhD 基线到 GPT-5.6,模型已经参与完整研发循环:诊断故障、改训练、跑实验、解释结果,再去改另一个模型。半年里 coding inference 研究算力涨了100 倍,agentic token 涨了约22 倍


Anthropic那边,部署了 9 个 Claude Opus 4.6 实例做 Automated Alignment Researchers。在一个很窄的 weak-to-strong supervision 任务上,PGR 做到0.97;但迁移到 production-scale 的 Claude Sonnet 4 之后,没有统计显著提升


所以AI4AI 确实已经走进研发流程了。也很高兴看到国内也有同样前沿的成果。


论文:https://xyz-lab.ai/blogs/ai4ai-at-scale/assets/bounded-exploration-ai4ai-system-optimization.pdf


团队访谈:https://www.youtube.com/watch?v=aC7BhGGQUPo&t=792s


文章来自于微信公众号 “AI Dancer”,作者 “AI Dancer”

1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群