配套CLI与Skills,浙大开源可插拔Agent评测底座

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

配套CLI与Skills,浙大开源可插拔Agent评测底座
AI技术研报 2026-09-14 09:49
+8829 阅读

配套CLI与Skills,浙大开源可插拔Agent评测底座


同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。


而在本地、Docker与各类云沙箱之间来回适配,又容易陷入写不完胶水代码的泥潭。


针对这一问题,浙江大学ZJU-REAL团队开源了ageval(agent eval)。它的核心思路是将待测Agent与运行环境通过插件彻底解耦:在配置文件中修改一行,同一份dataset就能在不同环境、不同Agent间自由切换运行。


配合专用的CLI与skills,ageval还能让coding agent自主编写benchmark、迁移已有测试集并执行自动化评测。


配套CLI与Skills,浙大开源可插拔Agent评测底座

演示视频:配置一次评测,任意切换运行


功能一览:从本地调试到Hub协作


做Agent评测,开发者常遇到两个痛点:一是换个Agent或换套环境就得重写一遍适配脚手架;二是跑完只给出一个笼统的分数,中间卡在哪一步完全无法追溯。ageval覆盖了从本地复盘调试到云端结果共享的完整工作流。


本地轻量复盘:逐轮交互轨迹回放


评测未通过时,定位问题最需要看清Agent的实际执行轨迹。


在终端执行ageval view,即可在本地启动轻量Web轨迹查看器,按照Jobs→Tasks层级完整复盘每一次运行:


  • 阶段耗时清晰可见:明确展示环境准备(environment)、任务循环(run)与评分(evaluate)各个阶段的精确耗时;
  • 交互事件逐轮展开:完整对照Agent输入、工具调用(Tool Calls)、终端输出与模型回复,无需再在终端漫无目的地翻看滚屏日志;
  • 单任务直接复现:每个失败task均附带完整的重跑命令,方便在终端针对单一用例单独复现和单步调试。


配套CLI与Skills,浙大开源可插拔Agent评测底座

本地Viewer中的一次运行轨迹与事件明细


插件中心:自由组合环境与Agent运行时


ageval将运行环境与Agent运行时均封装为标准插件,免去重复编写适配胶水代码的成本:


  • 环境插件(Environment):支持Docker、E2B、Daytona以及Local本地宿主环境;
  • Agent运行时插件(Executor):默认支持通过ACP接入通用coding agent(如pi、Codex、Claude Code、OpenCode等),同时也原生收录了各类特化执行栈(如DeepSeek官方dsh、NVIDIA nooa、SWE-agent miniswe)。


如果需要切换执行环境或待测Agent,只需在配置文件profiles.yaml中修改对应声明,原有的dataset无需任何改动即可直接运行。


配套CLI与Skills,浙大开源可插拔Agent评测底座

插件市场:浏览与接入环境插件和Agent运行时插件


插件详情页:依赖契约与运行参数一览


点击进入任意插件详情页,可以直观查看该插件对外export的服务、所依赖的环境capabilities,以及安装命令与参数配置示例:


配套CLI与Skills,浙大开源可插拔Agent评测底座

dsh插件详情页:查看DeepSeek官方harness的插件配置与能力说明


配套CLI与Skills,浙大开源可插拔Agent评测底座

nooa插件详情页:NVIDIA官方Agent运行时插件详情


公开榜单(Leaderboard):环境与配置严格对齐的对比


许多公开benchmark往往只公布模型名称与得分,既没有说明使用的是哪套Harness,也没有标明沙箱环境版本与Prompt模版,外界往往难以真正复现。


在ageval Hub的公开榜单上:


  • 每一项成绩都明确绑定了具体的Agent运行时版本与执行环境(如Docker、E2B)
  • 无论是更换底层沙箱还是调整工具调用策略,得分与资源消耗的变化都可以在榜单中横向对照;
  • 每次提交均附带不可变的lock.json与完整轨迹文件,其他开发者可以直接拉取配置一键复现。


配套CLI与Skills,浙大开源可插拔Agent评测底座

Hub Leaderboard榜单:查看不同环境与Agent组合下的真实评测成绩


Agents市场:沉淀与复用Agent资产


在实际业务中,调优出一套好用的Agent(包括Prompt模版、工具链编排与执行逻辑)通常需要投入大量的工程精力。


在ageval Hub上,团队可以直接将调优好的方案打包发布为Agent包:


  • 完整包含Prompt模版、Tool定义以及底层插件依赖声明;
  • 其他成员在运行评测时,只需指定--agent<org/name@version>,即可直接拉取并在任意dataset上开箱即用。


配套CLI与Skills,浙大开源可插拔Agent评测底座

Agents Hub:浏览、发布与复用已配置好的Agent包


点击进入单个Agent主页,可以进一步查看该Agent的配置详情、参与测评的模型列表与dataset历史记录。


配套CLI与Skills,浙大开源可插拔Agent评测底座

dsh-agent详情页:查看Agent架构、配置参数与历史评测记录


Models视图:模型画像与横向PK


在针对业务场景进行模型选型时,团队通常关注两个核心问题:


  • 该模型在不同的评测任务和不同的Agent架构下的整体表现如何?
  • 在固定当前自研Agent架构的前提下,换用哪个模型能在成功率与调用成本之间取得最优平衡?


Models Hub:以模型为维度的综合画像


Models Tab中,可以按照模型维度查看其在各类dataset与Agent组合下的解题成功率和调用成本:


配套CLI与Skills,浙大开源可插拔Agent评测底座

Models Hub:以模型为主维度的全景观测面板


点击具体模型进入详情页,可以进一步查看该模型在不同dataset和不同Agent下的表现明细:


配套CLI与Skills,浙大开源可插拔Agent评测底座

Model详情页:查看模型在各个dataset和不同Agent下的表现明细


固定Agent架构,横向对比不同模型


在Agent详情页中,可以固定同一套Agent运行时(保持相同的Prompt策略与工具调度链),横向对比不同模型在同一个dataset下的代码生成质量与解题通过率:


配套CLI与Skills,浙大开源可插拔Agent评测底座

在Agent Hub中比较Model表现:固定同一套Agent运行时,横向比对不同模型的解题效果


自动化评测:让coding agent驱动整个流程(Skills&CLI)


在本地开发环境中,只需为coding agent安装ageval CLI和配套skills:


uv tool install ageval-clinpx skills add ZJU-REAL/ageval


安装完成后,你的coding agent就能理解ageval的CLI指令与数据结构规范。你可以直接吩咐它完成原本繁琐的工程操作:


  • 自主编写新的benchmark,自动生成各task所需的run.py与evaluator.py;
  • 将团队现有的评测脚本迁移为标准的ageval dataset;
  • 自动拉起测试环境跑完指定评测矩阵,并汇总输出不同配置的对比分析报告。


配套CLI与Skills,浙大开源可插拔Agent评测底座

Agent借助skills自动化运行评测


运行机制:为什么能做到自由插拔?


要既能无缝适配多种执行环境(本机、Docker、云沙箱),又能兼容完全不同的Agent运行时,关键在于底层两项核心设计:一次运行的五个标准阶段以及基于服务契约的插件机制。


一次运行的五个阶段


ageval的执行底座是一条确定性的单向流水线:


lock→environment→run→evaluate→record


无论运行过程是成功、失败、超时还是被外部中断,cleanup钩子都会在finally阶段可靠执行,彻底清理容器实例、注销网络并擦除临时凭证。


配套CLI与Skills,浙大开源可插拔Agent评测底座

一次运行的生命周期:从静态lock、gold隔离、run任务循环到独立评分与evidence封存


  • ageval lock:在执行前静态拦截配置问题:在实际拉起运行环境之前,系统会静态解析出依赖图(ExtensionGraph)。比对环境是否满足Agent插件声明的capabilities要求,并检查宿主Docker守护进程与API Key凭证。一旦校验未通过,在lock阶段就会直接报错终止,避免运行到半途才因环境缺失而崩溃。
  • 独立评分与参考答案隔离(gold延迟上传):评分逻辑统一收敛在evaluator.py中,支持程序化断言测试、产物diff校验或LLM-as-a-judge。参考答案(gold)存放在tasks//evaluation/目录中,在Agent执行阶段环境内完全不可见;直到evaluate阶段才会挂载上传至打分环境。同时打分容器可以配置为network: none断开外网连接,彻底防止模型提前泄题或作弊。
  • 不可变证据链归档(Evidence):运行结束后,执行配置与拓扑快照lock.json、评分细节result.json、完整交互事件轨迹trajectory.jsonl会被一体化封存归档,确保每一次评测结果都有据可查、可精确复现。


插件机制:基于export与inject的服务契约


框架内部没有面向特定环境或特定Agent的硬编码if/else分支,所有组件均通过声明式的服务契约实现解耦:


配套CLI与Skills,浙大开源可插拔Agent评测底座

插件机制与依赖图:通过export与inject服务契约解耦环境与Agent,由ExtensionGraph驱动调度


服务声明(export与inject):


  • 环境插件(如docker、e2b、local):对外export提供environment服务,并声明自身支持的基础capabilities(如命令执行exec、文件上传upload、终端交互attach_stdio);
  • Agent插件(如acp、dsh、nooa):通过inject声明自身需要的服务与capabilities(例如dsh声明需要环境提供exec与upload)。


在lock阶段校验并编排依赖拓扑:


  • 静态检查requires⊆capabilities契约是否成立;
  • 检查通过后生成调度拓扑,运行时基座严格依照拓扑关系分发调用,从而实现“基座代码完全不变,环境与Agent自由插拔替换”。


实战:零侵入接入DeepSeek官方harness


以DeepSeek开源的deepseek-harness(dsh)为例。接入dsh不需要改动ageval框架的一行源码,只需要提供一份简明直观的插件声明:


plugins/dsh/plugin.yaml——Agent插件声明(节选)

plugin_id: dsh

slots:

exclusive:

id: executor #注册为Agent执行器

inject:

service: environment #声明依赖环境服务

capabilities: [exec, upload] #要求环境提供命令执行和文件上传能力


对于使用者而言,调用dsh与运行普通Agent完全一致。原有的dataset保持原样不动,切换对应的配置文件即可直接执行:


#1.安装带dsh支持的extras

uv tool install 'ageval-cli[dsh]'

#2.dataset保持不动,指定dsh配置开跑

ageval run <dataset> --task <task-id> --profiles profiles.dsh.yaml


快速开始


ageval现已正式开源。你可以通过pip/uv安装CLI,也可以直接从源码编译体验。


方式一:直接安装CLI(推荐)


#全局安装CLI

uv tool install ageval-cli

#或一次性安装全部插件扩展(含e2b,dsh,daytona等)

uv tool install 'ageval-cli[all]'

#检查安装

ageval -V

#为本机codingagent安装skills

npx skills add ZJU-REAL/ageval


直接运行公开的dataset,或本地dataset目录:


#查看公开可见的dataset

ageval registry list

#运行评测

ageval run <org>/<name>@<version> --task <task-id>

#本地启动复盘查看器

ageval view <org>/<name>@<version>


方式二:从源码体验最小示例


#克隆仓库

git clone https://github.com/ZJU-REAL/ageval.git

cd ageval

#安装项目依赖

uv sync --frozen --all-packages

#运行仓库自带的最小示例

uv run ageval run examples/datasets/minimal-demo --task terminal-jsonl-agg

#本地启动复盘查看器

uv run ageval view examples/datasets/minimal-demo


GitHub仓库:https://github.com/ZJU-REAL/ageval
项目主页:https://zju-real.github.io/ageval
文档与插件指南:https://zju-real.github.io/ageval/docs/


文章来自于"量子位",作者 "ZJU-REAL 团队"。

1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群