AI工具导航

Quorum — Multi-LLM Starter Kit

部署不会产生幻觉的人工智能。11个大语言模型共同投票决策。

Quorum — Multi-LLM Starter Kit 是什么?

Quorum — Multi-LLM Starter Kit 是一个可以帮你快速交付不会产生幻觉的 AI 应用的 Next.js 模板。它通过 11 个大语言模型达成语义共识来提升准确性,还内置了欧盟 AI 法案合规审计证书生成器、故障安全网关,以及 Stripe 支付、魔法链接登录功能和四个垂直领域示例。真正可投入生产的代码,让你周五复刻,周一就能上线。

产品详细介绍

部署不会产生幻觉的人工智能。11个大语言模型共同投票决策。

Quorum — Multi-LLM Starter Kit 是一个可以帮你快速交付不会产生幻觉的 AI 应用的 Next.js 模板。它通过 11 个大语言模型达成语义共识来提升准确性,还内置了欧盟 AI 法案合规审计证书生成器、故障安全网关,以及 Stripe 支付、魔法链接登录功能和四个垂直领域示例。真正可投入生产的代码,让你周五复刻,周一就能上线。

定价方案

需要付费
£149/月付
专业版(单团队)
  • 每月 10,000 次托管查询

  • 全部14家供应商,BYOK

  • 包含源码可用许可证(FSL-1.1)

£499/月付
Pro+(审计级合规)
  • 每月 50,000 次托管查询

  • 欧盟人工智能法案第12/13条 每次查询审计证书

  • 分歧矩阵仪表盘

Contact us/custom
企业版
  • unlimited requests 无限制请求

  • 本地部署 / 私有网络部署

  • 专用 BYOK 管理

查看官网价格

创始人评论

M
Maker创始人

我是开发者,这是我个人独立开发的项目,没有团队。

六周前,我在调试一个为自己搭建的多大语言模型(LLM)共识工具。三个模型给出了相同结论,但表述完全不同。我之前用的一致性评分器——基于分词的 Jaccard + Sørensen-Dice 算法——只给出了 0.31 的分数,置信度很低。我差点就给用户加上一个「模型结论不一致」的警告。

就在那一刻我意识到:词汇相似度根本不是 LLM 集成的正确基础。两个用词完全不同但表意一致的回答会被判定为分歧,而两个用词重叠但结论完全相反的回答(比如「患者不应服用…」和「患者应服用…」)反而会被判定为一致。我好几个月以来一直都测错了方向。

于是我重构了一致性层,改用基于句子嵌入的余弦相似度(默认通过 Ollama 使用 nomic-embed-text,可切换为 Gemini 或 OpenAI)。刚才那三个回答的分数立刻从 0.31 升到了 0.89。在我的评估集上,误判分歧的概率下降了约 40%。这个修复就是本工具的核心。

**工具包含**

- 已对接 11 家服务商:OpenAI、Anthropic、Gemini、xAI Grok、Mistral、Cohere、NVIDIA、DeepSeek、Moonshot/Kimi、Zhipu/GLM、Ollama(本地 Llama)。统一适配器接口,带逐调用成本统计。

- 语义一致性评分器——对所有模型生成结果构建 pairwise 余弦矩阵,阈值以上的最大连通分量即为标准结论,离群值会被记录。

- 可选择开启 HSP 故障闭锁闸(专利申请中 PCT/US26/11908)。如果共识度低于阈值,调用直接返回错误,而非给出一个「最佳猜测」。默认关闭。

- 符合欧盟 AI 法案第 12 + 13 条的审计日志 + SHA-256 哈希链 PDF 证书生成器。它不能替代正式审计,但能生成审计师会要求你提供的工件。

**开发心得**

- 难点在于成本控制,而非算法本身。简单粗暴的 11 个模型并行调用每次回答要花费 0.4 美元以上。本工具自带分层混合专家(MoE)路由:先用便宜模型投票,置信度低时再升级调用更贵的模型。把我的平均成本降低了约 6 倍。

- 流式输出 + 模型集成是用户体验陷阱。你没法流式输出共识结论。我的方案是先流式输出领先候选答案,最后再做一致性校验修正。

- 嵌入模型是信任锚点。如果它出问题,直接触发故障闭锁。我踩了三次生产事故才学会这一点。

**现存问题**

- 即使 LLM 不变,嵌入模型的选择也会改变回答的聚类结果。目前还没有便捷的按领域微调方案。

- 对集成内部的工具调用分支还没有好的处理方案。目前这些分支不参与评分。

- 首次请求延迟较高——所有服务商都会并行调用,没有提前退出机制。

**我真正需要的反馈**

1. 如果你已经在生产环境部署了 LLM 集成——你的故障闭锁策略是什么?硬错误、降级回退还是人工交接?

2. 有没有人在结构化输出(JSON、函数调用)上衡量共识质量?基于文本嵌入的余弦相似度不能直接套用。

3. 当前价格分档 497 美元 / 997 美元 / 2497 美元,对应单项目 / 5 项目 / 无限项目+白标。这个划分合理吗,还是应该把审计证书生成器单独做成一个 SKU?

代码仓库:https://github.com/jaquelinejaqu...

在线托管:https://quorum-ai.dev

代码采用 Apache 2.0 + HSP 商业限制授权。我很乐意回答任何问题——哪怕是尖锐的问题也欢迎。

官网信息

官网https://quorum-ai.dev/
公司使命

多LLM编排API可将提示词并行路由到多个模型,对语义一致性进行评分,并返回共识加权答案,从而防止幻觉和单一供应商锁定。

所在地

UK