解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究
AI技术研报 2026-09-07 10:18
+6094 阅读

从「会执行」到「会掌舵」,长程 Agent 还缺什么?


解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究


在 Agent 快速发展的今天,Harness 已经让大模型触碰到真实世界,能够调用工具、修改代码并运行实验。但当任务从几十分钟延伸到数天,系统仍需要一个人长期守在屏幕前,判断下一步往哪里走。


造成这一瓶颈的关键,并不只是模型能力不足,更是现有 Agent 大多自动化了「执行」,却没有真正自动化执行之上的「驾驶」。Harness 赋予模型行动的能力,人类赋予模型决策。人一旦离开,项目也随之停下。并且,在没有密集奖励反馈时,Agent 的执行和反应也会显得迟钝笨拙。


为了解决这一问题,微软、上海交通大学等机构开源了 Argus,一套面向长周期研究任务的通用 Agent 推理运行时,并发布技术报告。系统通过证据驱动、自进化、多 Agent 协作、核心与垂域解耦等设计,让 Agent 在没有密集标准反馈的情况下扩展至多领域持续研究数天。


报告覆盖 27 个 Campaign、1,548 小时墙钟时间。平均每 40.7 小时一次主动请求一次人类干预;报告的工作占空比为 95.1%~98.7%。这次 Argus 交付的不只是高分 benchmark,而是一套完整的生产级成果册。团队在 AI4AI、GPU Kernel、模型训练、AI4Science、芯片设计、AI4math、AI4System 等广阔任务上给出了成果,体现了 Argus 的通用性与真实研究级智能。


解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究

图 1:Argus 运行时、能力基准与交付结果总览。


解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究


  • 论文标题: Argus: Who Drives the Harness for Days?
  • 论文: https://arxiv.org/abs/2608.05144  
  • 代码: https://github.com/lbx154/Argus   
  • 项目主页: https://argusbot.cn/  
  • 项目成果开源库: https://github.com/Argus-AiTeam
  • 项目数学解题直播:https://open.argusbot.cn/#counterexample-live


01|从 Goal-Driven 转向 Evidence-Driven:谁来决定 Agent 的下一步?


过去两年,Agent 工程的主要进展集中在 Harness:借用自动驾驶的 FSD 作比喻,模型像发动机,Harness 像传动系统,但真正决定车辆驶向哪里的,仍是坐在屏幕前的人。短任务中,就像普通的自动泊车,任务本身还能提供明确反馈;一旦任务延伸到数天,研究问题往往既没有稳定的奖励,也没有从一开始就定义清楚的目标。现有 Agent 由此暴露出真正瓶颈:它们已经会执行,却还不会在不确定性中持续判断。


解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究

图 2:Argus 通过实现 auto-research 的自主科研,将人类的角色从持续推动的驾驶位变为副驾驶。


Argus 将 Harness 上方这个此前没有被自动化的位置称为 Driver。它要做的是在计划与现实冲突时,仍能依据证据继续掌舵。研究开始时写下的目标,只是信息最少阶段的初始假设;如果 Agent 只能 Goal-Driven 地追逐预设终点,甚至在不可能的目标上反复浪费 Token,就会造成目标僵化。而 Evidence-Driven 则把控制逻辑倒转过来:下一步由已有证据决定,而不是由计划最初的假设决定。运行中的一切结果,都是会改变路线的有效证据;系统正是用证据驱动。具体而言,Driver 需要根据当前证据反复回答以下四个问题:


1. 这项工作是否已经完成,而且质量足够好吗?


2. 结合当前证据,下一步最值得做什么?


3. 本轮得到的经验,应该如何改变之后的系统行为?


4. 剩余问题是否涉及只有人类才能作出的决定?


02|搭起一套通用的客制化长程运行时


Argus 把长期项目组织成持久化的 Campaign,再拆成一系列边界明确的 Mission。它的基本闭环是 Manager → Planner → Engineer ⇄ Reviewer → Manager:


以 OpenAI Codex 的 /goal 模式为参照,可以更清楚地定位 Argus 的设计取向。/goal 是把一个 agent 的单轮循环拉长为带有 goal state 的持久循环;Argus 则是把研究项目组织为多角色、多 harness、可沉淀知识的长程运行时。前者回答「怎么让 agent 不停下来」,后者回答「agent 不停下来后,怎么有效工作」。这正是从 Goal-Driven 转向 Evidence-Driven 在运行时层面对应的结构差异。


1. Manager 掌握阶段转换,流程审批,全局策略;


2. Planner 根据当前证据规划具体任务;


3. Engineer 进入真实代码库、实验、执行;


4. Reviewer 独立审查工件,并检验创新性与有效性,汇报给 Manager 或打回 Engineer。


这里的重点不是多角色本身,而是拆开上下文 —— 多个角色互相配合,来避免 agent 变成简单的局部爬山器,每个角色拥有自己的独有上下文但是共享工作区,不至于将规划、执行、验证全部交给一个 agent 来完成,可以提高 token 效率。也正因此,可以在 Argus 的一个任务中,同时启用 Pi, Codex, Claude Code, DeepSeek Harness 等不同的 harness,保证了高度客制化。


系统保存的是一套完整的工件;只有通过证据门槛的经验,才会进入 Wiki 和 Skill,并按 Project、Vertical 或 Global 作用域供后续任务复用。


与此同时,Core 与 Vertical 保持解耦:Core 负责角色权限、证据提交和人类边界,Vertical 由领域专家定义数学、GPU、材料等任务中什么才算有效证据以及相关的人类 skill 和知识;Vertical 可以明显提高研究任务交付质量,同样为人类专家与 agent 协同进化,客制化工作流程,提供了接口。


解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究

图 3:Argus 的长程运行机制。四类角色围绕持久状态循环,Campaign 可在八个研究阶段间推进或回滚。


03|1548 小时之后,Argus 留下了什么?


真正决定长程 Agent 是否成立的,是时间能否转化为真实的研究成果。Argus 开源后不到一个月,已经在基础设施、材料、芯片、数学和 AI 系统研究中做出卓越贡献,同时我们是首个公布完整端到端数学猜想解决筛选日志的团队,将所有的运行轨迹 session 等均开放,以下为 Argus 开源后各项成果的汇总:


解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究

图 4:Argus 代表性研究成果、关键指标与验收依据


如上表所示,Argus 首先在 AI4System & Infra 中把持续运行转化为可验收的真实交付,以明确的工程结果完成从自动执行迈向自主研究的第一步;随后,任务从 AI 基础设施延伸到 AI4Science、AI4Hardware、AI4Math,评价标准也随之从 “是否完成既定任务” 转向 “能否探索悬而未决的现实研究问题”,自动研究因此由自动化交付进一步推进到自动化探索;在此基础上,Argus 又在 AI4AI 方向从单点成果扩展至完整研究流程,以证据持续驱动任务推进,无需人类始终守在屏幕前,由此形成一条从真实交付、跨领域探索到全流程自主研究的递进路径。


解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究

图 5:Argus 在全流程论文生产中的交付结果。


以上结果均在 1 个月内取得,把这些成果串起来,Argus 是一条逐步加深的价值链:自动化的对象由一次执行扩展为证据驱动的研究推进,大大加速研究进展,这也是「人离开屏幕后,谁来驾驶 Agent」最直接的回答。


结语|屏幕熄灭以后,项目没有归零


长程智能是让 Token 转化为智能,再用智能把一个研究项目持续推进,产生实际价值。Argus 将原本彼此割裂的模型调用组织成一套持续运转的研究系统,让 Evidence-Driven 控制方向,再通过自进化把经验沉淀为能力。


Argus 展示的不只是一个更长时间运行的 Agent,而是一种新的研究组织方式:Harness 解决模型如何行动,Driver 决定系统如何持续前进,研究速度不再受制于人类的工作娱乐时间。这可能意味着研究的加速时代正在到来。屏幕可以熄灭,研究仍在继续。


作者介绍


Argus 由微软与上海交通大学研究者牵头,由多所高校的研究者共同推进。


Argus,让每个人都有自己的数字实验室!


文章来自于"机器之心",作者 "机器之心"。

1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales

添加客服微信openai178,进AITNT官方交流群