- ✓
暂未采集到具体套餐,价格以官网为准
CAFE — Compound-AI Factorial Evaluation
不要再猜测哪种 AI 配置更好,用事实证明它。
CAFE — Compound-AI Factorial Evaluation 是什么?
CAFE(Compound-AI Factorial Evaluation)是一款开源可自托管的AI流水线实验评估工具,它能将检索、重排序、提示词、模型等所有配置项作为实验因子,运行析因实验并评估结果。它通过混合效应模型统计分析,帮你准确判断哪些技术真正提升了AI效果,以及每个技术的贡献度,让你不用再靠猜测选择AI配置。
产品详细介绍
不要再猜测哪种 AI 配置更好,用事实证明它。
CAFE(Compound-AI Factorial Evaluation)是一款开源可自托管的AI流水线实验评估工具,它能将检索、重排序、提示词、模型等所有配置项作为实验因子,运行析因实验并评估结果。它通过混合效应模型统计分析,帮你准确判断哪些技术真正提升了AI效果,以及每个技术的贡献度,让你不用再靠猜测选择AI配置。
定价方案
需要付费创始人评论
大家好!作为一篇研究论文的工作成果,我们开发了 CAFE 来解答一个反复出现的问题:当我调整 RAG 或智能体流水线后输出效果得到了提升,究竟是哪一处修改带来了改变?总体基准测试和人工观察少量输出始终无法真正回答这个问题——尤其是当大语言模型每次运行都具有不确定性的时候。
CAFE 将你流水线中的每一个可调参数(检索、重排序、上下文组装、提示词、模型、工具等)都视为实验因子。它具备以下功能:
- 生成全因子或分式因子设计——覆盖所有值得测试的配置组合
- 以黑盒方式运行每个配置,并支持重复实验(可并发、可断点续跑)
- 使用可配置的大语言模型评判器和/或人工评分器对输出打分
- 使用与你的评分标准尺度匹配的混合效应模型来归因性能差异
最终得到的结果是具有统计依据的答案,能够解答如下问题:
- 哪些技术真正能够提升质量?
- 每种技术的贡献度有多大?
- 性能最优的配置是什么?
- 观测到的差异是真实存在的,还是只是噪声?
CAFE 还包含成本-质量帕累托前沿分析,以及使用克里彭多夫α系数进行评判器↔人工一致性分析。
本项目开源(Apache-2.0 许可证),支持完全自托管。你可以将它作为 Python 库使用,也可以作为 FastAPI + React 网络应用使用。数据不会离开你的本地机器。
⭐ GitHub:https://github.com/fabian-lu/Cafe
🧪 在线演示:https://cafe-ai.de/demo
📚 文档:https://fabian-lu.github.io/Cafe
欢迎大家提出反馈!!
创始团队
官网信息
一个用于评估复合AI系统的实验设计平台,它支持研究人员和工程师使用统计方法,严格将质量归因于RAG、智能体和LLM链中的特定组件