- ✓
无限评估
- ✓
所有内置评估域
- ✓
双次对抗评分
Bayescore
我们给自己打了46分(满分100分),并发布了结果。
Bayescore 是什么?
Bayescore 是一款基于双通对抗性大语言模型评估的文档 claims 评分工具。你只需传入包含主张的文档,它就能自动提取主题与标准构成的假设,推导出谓词并逐一评分,还会将缺乏证据视为不利证据。该工具团队对自己进行了测试,最终得出 46/100 的 D 级评分并公开了完整分析结果。
产品详细介绍
我们给自己打了46分(满分100分),并发布了结果。
Bayescore 是一款基于双通对抗性大语言模型评估的文档 claims 评分工具。你只需传入包含主张的文档,它就能自动提取主题与标准构成的假设,推导出谓词并逐一评分,还会将缺乏证据视为不利证据。该工具团队对自己进行了测试,最终得出 46/100 的 D 级评分并公开了完整分析结果。
定价方案
有免费方案- ✓
免费版中的所有功能
- ✓
自定义评估域
- ✓
已保存的域库
创始人评论
嘿,Product Hunt的朋友们!我是布格拉,Bayescore的独立创始人。我来谈谈为什么开发了这个工具。
当时我正在评审一份创业路演文档——创始人显然已经付出了很多努力,但我却没有一套有理有据的方式给出反馈。我说的一切都可能被当成主观意见,没有统一的评分框架。而我在网上找到的框架都是别人的检查清单,并非基于文档本身想要论证的内容推导而来。
所以我开发了一个能从文档本身提取评估框架的工具。
工作原理:
1. 上传任何包含主张的文档
2. Bayescore 提取出IS(主体, 评估标准)——即文档隐含的评估假设
3. 你会得到分数(0-100)、等级(A-F)、每个谓词的评估依据,以及优先级最高需要修复的漏洞
目前使用人群:
- 评审自己融资幻灯片的创始人:**「告诉我到底缺了什么,而不是好听的话」**
- 资助申请书撰写者:** 在提交前,按IS(申请, 可资助)评估得分**
- 创业加速器和投资人:**一次上传10份申请,获得所有申请一致的谓词细分评估**
- 营销人员:** 按IS(营销活动, 值得投放)对brief打分——证据真的支持这笔投放吗?**
- 评估创意的开发者:**IS(产品, 值得开发)——在你写第一行代码之前先评估**
最让我意外的成果:
提取步骤。让大语言模型从任意文档中识别评估领域,并将其表述为**外部评估者的可证伪假设**,而非对文档主张的内部描述,这原来是个难题。提示词必须区分「IS(创业项目, 准备就绪)」和「IS(创始人的主张, 真实)」。前者是评估,后者是同义反复。
我在Bayescore自己身上跑了一遍测试:
得分:46/100,等级D。
三个谓词通过:价值主张、值得解决的问题、已识别风险。五个不通过:客户验证(0)、需求信号(0)、获客渠道(部分通过)、领域专业度(部分通过)、市场进入策略(部分通过)。完整细分报告见 bayescore.com/self-eval。
我公开这个结果是因为,如果Bayescore隐藏自己的得分,你不可能相信它给出的任何分数。
我希望获得以下反馈:
1. 当你在自己的文档上试用时,IS(主体, 评估标准)这个框架是否清晰易懂?
2. 自定义领域——你可以上传任意文档,提取它的IS假设,分享评估链接。这对你有用吗?
3. 有哪些我没想到的文档类型是你会用来测试的?
去 bayescore.com 试用吧——粘贴任何带主张的内容,只需要大约30秒。
感谢今天来体验我们的产品。我一整天都在这里,会回答所有问题,尤其是难题。
—— 布格拉
创始团队
官网信息
每一份文档本身就知道应当如何被评估。BayesCore 将该标准明确化——提取评估DNA并让文档自我评分。