- ✓
暂未采集到具体套餐,价格以官网为准
Velrim
从文档中提取数据,并判断哪些字段值得信任。
Velrim 是什么?
Velrim 是一款文档数据提取 API,即使原始文档中缺失字段也能稳定返回合法 JSON,并为每个字段附带置信度评分,帮助开发者区分可直接使用的数据与需要人工复核的内容。支持 Zod 或 Pydantic schema 输入,输出附带边界框的类型化数据;其在 124 份真实文档上与 Gemini、ChatGPT、Mistral 等主流模型的对比结果已全部公开,定价低至每页 0.02 美元,新用户可免费试用约 500 页。
产品详细介绍
从文档中提取数据,并判断哪些字段值得信任。
Velrim 是一款文档数据提取 API,即使原始文档中缺失字段也能稳定返回合法 JSON,并为每个字段附带置信度评分,帮助开发者区分可直接使用的数据与需要人工复核的内容。支持 Zod 或 Pydantic schema 输入,输出附带边界框的类型化数据;其在 124 份真实文档上与 Gemini、ChatGPT、Mistral 等主流模型的对比结果已全部公开,定价低至每页 0.02 美元,新用户可免费试用约 500 页。
定价方案
需要付费创始人评论
{"translation":"嗨 PH,我是创始人。Velrim 是一个文档提取 API,会为每个字段返回一个置信度分数。它运行在 Gemini 之上,所以我们把自己放进表格中,紧邻我们所运行的模型以及其他四种方案,看看我们的表现如何。
关键问题是置信度层是否真的能衡量什么。也就是说,当置信度分数为 80 时,这类字段中是否大约有 80/100 是正确的;以及当我们凭空编造一个值时,分数是否会下降。
完整文章:https://velrim.com/research/fabrication-on-absent-fields
包含所有原始输出和评分脚本的代码仓库:https://github.com/velrimhq/velrim-eval
归档:https://doi.org/10.5281/zenodo.22233430
方法说明:
1. 数据来自 CORD、DeepForm 和 VRDU 的 124 份真实文档。每个模型在预训练中都见过这些文档,这对每种方案的影响是均等的。这一点在仓库的披露中有列出。
2. 在基准测试运行之前,我对照原始页面手动核查了全部 142 个"该字段缺失"的标签。其中 40 个是错的,数值明明就印在页面上。每个系统统一剔除了 46 个单元格,因此编造数据的统计是基于 96 个缺失字段,而不是 142 个。
3. 在 124 份文档的规模下,每种文档类型 4 到 10 分以内的差距都属于噪声。
4. 这次运行成本约 39 美元。每次启动的清单都在仓库中,唯一的例外是第二次启动的清单,在归档前被覆盖了。
5. 有两家返回置信度数的供应商未列入表格。他们的条款禁止进行基准测试。我们于 7 月 12 日请求授权,此后未收到任何回复。
下一步:如果获得授权,将与那两家供应商进行第二轮测试;同时会基于 OpenAI 模型的 token 概率,为其添加一列置信度。
对已发布的输出重新打分是免费的,且不需要 API 密钥。欢迎提问。
"}