- ✓
最多50个API端点
- ✓
API合同测试
- ✓
用户界面测试
APIEval-20
一个用于测试API的AI代理开放基准
APIEval-20 是什么?
APIEval-20是一个面向API测试代理的黑盒基准测试。每个代理仅获取一个JSON模式和一个示例有效载荷,随后生成测试套件。我们针对部署了预设错误的真实API运行这些测试,并根据错误检测率、API覆盖率和效率进行评分。与基于大语言模型作为评判的评估不同,该评分完全客观:错误要么被捕获,要么未被捕获。任务涵盖认证、错误处理、分页、模式及多步骤流程。基准测试已在Hugging Face上开源。
产品详细介绍
一个用于测试API的AI代理开放基准
APIEval-20是一个面向API测试代理的黑盒基准测试。每个代理仅获取一个JSON模式和一个示例有效载荷,随后生成测试套件。我们针对部署了预设错误的真实API运行这些测试,并根据错误检测率、API覆盖率和效率进行评分。与基于大语言模型作为评判的评估不同,该评分完全客观:错误要么被捕获,要么未被捕获。任务涵盖认证、错误处理、分页、模式及多步骤流程。基准测试已在Hugging Face上开源。
定价方案
有免费方案- ✓
无限API端点
- ✓
完整的CI/CD集成
- ✓
SOC2和ISO27001认证的数据安全
创始人评论
嗨,Product Hunt,
我是 Abhishek,KushoAI 的首席执行官。
我们创建APIEval-20是因为API测试现在已成为AI代理间的普遍说法,但当时没有可靠的验证方法。
我们发现的评估通常有三个空白之一。他们假设能访问源代码,依赖详细文档,或者检查输出是否有效,而非测量实际发现的错误。
这感觉与大多数团队实际测试API的方式相去甚远。
所以我们建立了一个黑盒基准。
架构和有效载荷已输入。别无他物。
代理生成一个测试套件。我们会用带有植入漏洞的实时参考API进行测试。得分来自代理实际捕捉到的内容:漏洞检测、API覆盖率和效率。
没有LLM评委。没有主观判断。错误要么被发现,要么被漏掉。
我最自豪的是复杂度分类法。向每个字段发送空图很简单。真正的考验是代理是否能够推理字段关系、认证行为、分页、错误处理、模式约束和多步流程。这正是强力因子开始与弱因子区分开来的地方。
APIEval-20已在Hugging Face上开放。我们还在单独研究报告中整理一个排行榜,比较主要的人工智能代理。如果你在那之前让你的经纪人在基准测试中运行,我们很乐意把你的结果也包含进去。
给社区两个问题:
1. 接下来我们应该添加哪些域名或API模式?
2. 如果你正在构建测试工具或代理,你会希望你的结果被列入排行榜吗?
我会在这里待一整天。请留言或联系我们:
hello@kusho.ai
创始团队
官网信息
在生产前发现故障和安全漏洞