AI工具导航

CAFE — Compound-AI Factorial Evaluation

不要再猜测哪种 AI 配置更好,用事实证明它。

CAFE — Compound-AI Factorial Evaluation 是什么?

CAFE(Compound-AI Factorial Evaluation)是一款开源可自托管的AI流水线实验评估工具,它能将检索、重排序、提示词、模型等所有配置项作为实验因子,运行析因实验并评估结果。它通过混合效应模型统计分析,帮你准确判断哪些技术真正提升了AI效果,以及每个技术的贡献度,让你不用再靠猜测选择AI配置。

产品详细介绍

不要再猜测哪种 AI 配置更好,用事实证明它。

CAFE(Compound-AI Factorial Evaluation)是一款开源可自托管的AI流水线实验评估工具,它能将检索、重排序、提示词、模型等所有配置项作为实验因子,运行析因实验并评估结果。它通过混合效应模型统计分析,帮你准确判断哪些技术真正提升了AI效果,以及每个技术的贡献度,让你不用再靠猜测选择AI配置。

定价方案

需要付费
官网查看
定制方案
  • 暂未采集到具体套餐,价格以官网为准

查看官网价格

创始人评论

Fabian Lukassen
Fabian Lukassen创始人

大家好!作为一篇研究论文的工作成果,我们开发了 CAFE 来解答一个反复出现的问题:当我调整 RAG 或智能体流水线后输出效果得到了提升,究竟是哪一处修改带来了改变?总体基准测试和人工观察少量输出始终无法真正回答这个问题——尤其是当大语言模型每次运行都具有不确定性的时候。

CAFE 将你流水线中的每一个可调参数(检索、重排序、上下文组装、提示词、模型、工具等)都视为实验因子。它具备以下功能:

- 生成全因子或分式因子设计——覆盖所有值得测试的配置组合

- 以黑盒方式运行每个配置,并支持重复实验(可并发、可断点续跑)

- 使用可配置的大语言模型评判器和/或人工评分器对输出打分

- 使用与你的评分标准尺度匹配的混合效应模型来归因性能差异

最终得到的结果是具有统计依据的答案,能够解答如下问题:

- 哪些技术真正能够提升质量?

- 每种技术的贡献度有多大?

- 性能最优的配置是什么?

- 观测到的差异是真实存在的,还是只是噪声?

CAFE 还包含成本-质量帕累托前沿分析,以及使用克里彭多夫α系数进行评判器↔人工一致性分析。

本项目开源(Apache-2.0 许可证),支持完全自托管。你可以将它作为 Python 库使用,也可以作为 FastAPI + React 网络应用使用。数据不会离开你的本地机器。

⭐ GitHub:https://github.com/fabian-lu/Cafe

🧪 在线演示:https://cafe-ai.de/demo

📚 文档:https://fabian-lu.github.io/Cafe

欢迎大家提出反馈!!

创始团队

Fabian Lukassen
Fabian LukassenPhD student building AI tools

官网信息

官网https://cafe-ai.de/
公司使命

一个用于评估复合AI系统的实验设计平台,它支持研究人员和工程师使用统计方法,严格将质量归因于RAG、智能体和LLM链中的特定组件