PDF当死,ARA该立!论文是时候Agent原生了

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

PDF当死,ARA该立!论文是时候Agent原生了
AI资讯 2026-08-10 10:29
+6584 阅读

啥情况?统治科研圈几十年的PDF格式,都需要因AI而“退休”…


因为以后论文的第一读者不是人,而是AI??


PDF当死,ARA该立!论文是时候Agent原生了


近日,IEEE Spectrum重点关注了一项新研究——ARA(Agent-Native Research Artifact)。它不仅能让AI理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究,让AI从辅助工具升级为科研协作者


据IEEE报道,ARA团队在一篇名为The Last Human-Written Paper: Agent-Native Research Artifacts的论文中,呼吁科学家们停止继续使用PDF撰写传统论文,并表示:


AI需要一种不同的内容格式,而AI的需求,理应被置于首位。


论文的第一作者刘嘉晨核心论点是:


一旦AI“榨干”了人类专家所有的数据,它就不再需要人类的任何输入。到那时,AI将开始自主进化。

现在这些只提升AI科学家的能力,却不改造科研知识的共享方式,就像在泥泞路上开F1赛车,难以复现并接续前人的工作。


PDF就是过去科研知识共享的最核心代表。


是时候了,ARA当立。


为什么PDF该死?


PDF代表的是传统论文的最终结果,是科研最后成果的最终呈现,但就是这种呈现,“有问题”。


ARA团队认为,真实的科研从来不是一条从问题直通答案的直线,研究者往往要提出十几个假设、尝试几十种方案、调整无数次参数,在经历大量失败后,才能摸索出一条走得通的路径。


然而,当这些探索被写成论文时,那棵枝杈横生的“探索树”通常会被修剪成一条干净、连贯的成功路径。


ARA团队将这种损失称为“叙事税”,即为了让研究成为一个有头有尾、逻辑自洽且成功的故事,大量的探索过程被主动舍弃,后来者只能被闪耀的新突破亮瞎眼,却看不见前人踩过的坑、受过的罪。


PDF当死,ARA该立!论文是时候Agent原生了


除了“叙事税”,传统论文还存在着“工程税”


一篇论文只要能让审稿人信服,便算完成了使命。


但“说服审稿人”与“让AI完整复现”完全是两套标准。


模型版本、运行环境、超参数、预处理方式、训练技巧……这些决定实验成败的关键细节,往往散落在正文、附录和代码仓库中,有些甚至从未被记录。


PDF当死,ARA该立!论文是时候Agent原生了


研究团队统计了PaperBench中的8921项专家复现要求,发现仅有45.4%在论文PDF中得到了完整说明。


对咱来说,实验信息少了,我们可以根据过往经验、求助导师或者不断试错补上;


但对AI来说,论文里没写,那就意味着只能靠猜(或者瞎编),它也很无奈。


PDF当死,ARA该立!论文是时候Agent原生了


因此,ARA选择彻底换一种思路:


不再将线性叙事的论文视为科研成果本身,而是把研究重组为一个机器可直接操作的知识包。


这个知识包包含四个层次:


  • 科学逻辑层:记录研究解决了什么问题、为何采用该方法,以及哪些主张可被证伪。
  • 可执行代码层:不仅提供代码仓库,还包含复现实验所需的环境、配置与关键参数。
  • 探索图层:将实验过程还原为一张可追踪的路线图,成功与失败的方向、放弃某条路线的原因均被保留。
  • 证据层:将论文中的每一项主张关联至原始实验结果,方便AI核验结论,而非仅采信正文中的概括性描述。


概括来说,论文最后通过PDF呈现的只是“我们最后做成了什么”


但如果通过ARA,展现的还有“为什么这么做”“具体怎么做”“哪些方法已失败”以及“原始证据在哪里”,追求的是知识优于叙事


更形而上来说,PDF只有结果,ARA还包括了整个过程。


道理似乎是这个么道理,但“一切存在皆合理”,PDF能成为人类科研论文最终呈现形式这么多年,一定是有其内在合理性的。


ARA要取而代之,需要的就不光是理念了。


ARA真的比PDF好用吗?


为了让ARA真正跑起来,研究团队设计了三套配套机制:


1、Live Research Manager:负责在研究过程中持续记录实验、决策、转向与失败路线;


2、ARA Compiler:负责将现有的PDF和代码仓库转换为ARA格式;


3、ARA原生审稿系统:负责让机器先行完成结构检查与复现验证,并将创新性、重要性与研究品位等判断留给人类审稿人。


为了体现ARA真的比PDF好用,研究团队分别从理解复现延伸三个维度进行了测试。


PDF当死,ARA该立!论文是时候Agent原生了


在理解测试中,研究人员设置了450个问题,要求AI从ARA或传统PDF加代码仓库中寻找答案。


结果显示,使用ARA的AI准确率达93.7%,而传统材料组仅为72.4%,相差21.3%


差距最大的是“复盘失败”,当问题涉及失败方案、替代路线和实验教训时,ARA组准确率为81.4%,传统材料组仅15.7%——原因很简单,传统论文里压根就没有这些信息。


PDF当死,ARA该立!论文是时候Agent原生了


在复现测试中,团队选取了15篇附带GitHub仓库的机器学习论文,设置了150项复现任务。


其中,ARA组的难度加权成功率为64.4%,传统组为57.4%。且任务越难,ARA的优势就越明显


ARA在简单、中等和困难三档任务中,分别领先4.9%5.6%8.5%


但ARA的表现并非一路开挂。


在最具挑战性的研究延伸环节,ARA组赢下了3项RE-Bench开放任务,但另有2项被传统论文组反超。


PDF当死,ARA该立!论文是时候Agent原生了


不过,也有可取之处。


ARA组在全部5项任务中,都抢先摸到了那步最关键、最值钱的第一步实验操作:利用失败记录迅速绕开已经被验证过无效的研究方向,省去大量重复探索。


这也对应了论文中的另一组数据。在论文分析24008次AI Agent运行中,90.2%的资金成本都消耗在失败探索上,而传统论文几乎不会保存这些失败。


对刘嘉晨而言,这正是ARA最重要的价值。


PDF当死,ARA该立!论文是时候Agent原生了


在她设想的人机科研关系中,AI不再只是润色论文、查找资料或生成代码的辅助工具,而是能真正成为参与阅读、复现和延伸研究的科研主体。


科研人员则可以更加聚焦于那些AI难以替代的判断、创新和品味工作,即判断问题是否重要、工作是否真正新颖、某条路线是否值得投入。


ARA也并非完美


不过,虽然ARA的成绩单看起来非常亮眼,但它目前更像一位野心勃勃、天资聪颖却根基尚浅的高一新生,才刚入学就想要在高考中考进北大。


它离成为“PDF终结者”还有很长的一段道路要走。


PDF当死,ARA该立!论文是时候Agent原生了


篇幅有限,简单说三点。


ARA的第一个缺陷,就是它目前实验的范围较窄,普适性较弱,只覆盖了天然适合代码复现的机器学习领域,能否用于湿实验或理论学科还尚未得到验证。


第二个问题,就是隐私和数据安全问题。


ARA目前不仅还没有实现细粒度的访问控制,缺少沙箱执行和内容异常检测,相关规则和标准也还没完善妥当。


要是你就这么大大咧咧地把机密数据喂给它,小心下一秒就被你的竞争对手拿走哦。


PDF当死,ARA该立!论文是时候Agent原生了


第三个是不可避免的AI幻觉和路径依赖问题。


在15篇论文的复现实验中,传统材料组出现了2次结果编造,ARA组也出现了1次。


所以它目前应该既不能保证AI永远不捏造结果、也不能保证它不会过度傻白甜地相信前人的判断。


PDF当死,ARA该立!论文是时候Agent原生了


当然,这种思考和理念,依然有其创新性和价值。


如果你需要更详细了解,建议你直接前往文末附上的论文和开源地址。


或者更进一步与ARA的研究团队、提出者交流。


ARA提出者


ARA研究由来自斯坦福大学、密歇根大学、卡内基梅隆大学和MIT等多家机构的37名研究者共同完成。


其中第一作者是刘嘉晨


她是密歇根大学的计算机科学博士,深耕机器学习系统与大模型基础设施领域。


PDF当死,ARA该立!论文是时候Agent原生了


刘嘉晨,来源IEEE Spectrum


她曾参与大模型服务、训练系统和Agentic RL系统研究,也曾在Meta从事大模型预训练与后训练基础设施相关工作。


刘嘉晨的个人主页和密歇根大学官网显示,她曾在2023年入选Machine Learning and Systems Rising Stars荣誉榜单。


PDF当死,ARA该立!论文是时候Agent原生了


图源密歇根大学官网


今年5月,刘嘉晨在帕洛阿尔托创立Agent-Native Research Lab,已经联动产学研来推动ARA Commons科研生态建设。目前,其公开成果主要包括ARA协议及论文、配套代码、研究生态构想,以及面向NeurIPS 2026的AI驱动科研生态研讨会。


实际上,这种Agent-Native的理念,也在AI狂飙这几年,正在给千行百业带来范式变革。


从PDF到ARA,一方面是AI能力的涌现,可以让整个科研过程的价值被重新发现和重视,而不仅仅是呈现一个最终的结果。


过去我们形成了PDF,是因为所有论文都是人类作为阅读者、使用者、核心对象。


但现在AI能力加持,Agent能力突破,人类看不过来的科研过程Agent可以看,人类难以并行的科研复现Agent可以复现……


以前是人类—PDF—人类,以后可能是人类—Agent—ARA—Agent—人类


这种变革也不局限于科研领域,在更早之前,一脉源流的已经有:


GUI已死,CLI当立…Markdown已死,HTML当立…Prompt已死,Loop当立………“PDF已死,ARA当立”


只是这种趋势下的一种因循结果罢了。


这更本质的是一种AI观、价值观上的哲学体现,你依然支持的是“人是万物的尺度”,还是AI才是更终极的尺度?


你是碳基生命守护者,还是完全拥抱硅基时代降临…


这无关对错,只是选择,选择的人多了,也就会在某个节点分出对错。


而ARA的提出者,显然选择的是AI为中心、Agent Native。


当然,目前为止,ARA这篇研究和论文,依然是PDF提交和呈现的。


参考链接:

[1]https://spectrum.ieee.org/ai-scientist-research-paper-format?itm_source=homepage&itm_medium=hero&itm_campaign=hero-2026-08-06&itm_content=hero1

[2]https://arxiv.org/abs/2604.24658

[3]https://amberljc.github.io/

[4]https://micl.engin.umich.edu/stories/two-cse-phd-students-named-machine-learning-and-systems-rising-stars

[5]https://github.com/ARA-Labs/Agent-Native-Research-Artifact

[6]https://the-future-of-research-ecosystem.github.io/

[7]https://www.agenticresearch.sh/


文章来自于"量子位",作者 "文婷"。

1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群