对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」
AI资讯 2026-08-03 15:52
+6635 阅读

最近,有个很有意思的现象。


在山西的一个小镇里,出现了一个让人印象很深的场景:村民们戴着 GoPro,正在为大厂采集具身智能的训练数据。在山东泰安,村民们在社区的居家场景采集点,录制叠衣服、打扫卫生等家庭场景的视频数据。


「人类历史上规模最大的数据采集行动」已经拉开了帷幕。


具身就像一次全新的工业革命,而数据则是新兴智能时代的基础资源。


各大具身智能赛道的参与者都在向「现实世界」这座取之不尽的数据金矿中寻求原始的数据资源,甚至已经将数据采集卷入了「人民战争的汪洋大海」。


模型、算力、数据,是具身智能公认的三座大山。


当越来越多的钱和人涌向「数据采集」时,按照全民参与的比例,完成一亿小时的人类数据采集,理论上一年就够了。


可这依旧无法满足行业的需求,「数据荒」甚至愈发严重。这中间的矛盾在哪?


答案很简单,但又很复杂:一切问题的核心在于数据质量。采得多,不代表采得好。真正能喂进模型的数据,始终是稀缺品。


这两年,把「数据质量」挂在嘴边的公司越来越多,可真正拿得出方案、能在市场上跑通商业闭环的却寥寥无几。际数科技是其中少有的一个。它闯出来的一条路,恰恰是这条赛道上的新范式。


机器之心与际数科技的三位联合创始人进行了深度访谈,为这个「数据越多,但可用数据越少」的时代两难,找到了一个新答案,一条新路径。


「这就好比,我们本来要用互联网广袤的语言语料去训练大模型,让它涌现出智慧,」周源博士打了个比方,「结果却请一堆中学生写命题作文,喂给模型。这两个效果,天差地别。」


际数决定把质量判断本身做成模型打造了高质量空间智能数据基础模型,让数据在进入下游训练之前,就能被理解、衡量和筛选。这也是他们区别于所有采集厂商、仿真厂商和具身厂商的地方。


两个金字塔:颠覆性的质量观念


周源博士用空间数据行业七年的经验告诉我们:真正能进入模型、对性能和泛化产生改善的数据,从来都是一个质量问题,数量在这里帮不上忙。


当所有人都在数量的汪洋里往前冲时,际数科技却非常罕见地关注了一个几乎没什么人在意的地方:数据,是否可信、是否可用、是否可验收、是否可复用。


过去几年,它一直默默打磨技术、在客户需求中积累经验,做成了数据质量这个细分领域的头号玩家


我们一直认为,数据质量是一种「自上而下」的金字塔:数据工程的本质其实就是模型工程,是一件结果导向的事。


对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」


也就是说,质量是被结果倒推出来的。评判数据质量好坏的最终标准,是模型的表现。模型表现好,就说明数据的表现没有问题。


际数团队的世界观完全不同,因为他们是一支测绘背景的团队


门道在于,测绘要解决的是空间数据的定位、空间关系的误差和确定性问题,它必须产出确定性极高、精度极高、误差极小的成果。所以测绘从一开始,就把数据当成一个误差问题、一个质量问题来对待


为什么这么偏执?因为测绘的成果往往决定了建筑的稳定性,质量不能靠下游效果来评定。


「对空间数据的处理,一定是在上游、在采集端和处理端就把质量问题消灭掉。」


这是一种「自下而上」的世界观:不等下游动手,直接在数据端拦住质量问题,让下游拿到一个极度确定的数据集,性能、标准、质量都可评估、可见、可复用。


CTO 叶文凯博士讲到,数据质量是一个共性问题,「如果是单一公司或个体来探究数据质量问题的分布,它所有车型、传感器配置、技术栈都非常一致,熵非常小,就很难泛化出对广泛质量问题的认知。」


而这个问题只能由第三方来做。无论是具身模型还是智驾模型,每家公司从数据素材到模型本体,往往都有一套封闭、自洽的技术体系。


数据质量并不从属于某一种本体。它所涉及的问题与误差,天然跨越不同模型、不同硬件和不同应用场景,因而具有高度的共通性。际数仅在智驾领域就已经服务过二十多家客户,广泛接触过不同传感器组合和不同技术路线中的数据问题。正是这种跨客户、跨系统、跨算法范式的实践积累,让际数能够跳出单一方案,识别数据质量背后的普遍规律


越是封闭的单一玩家,越不可能真正解决质量这个通用问题。际数作为中立第三方,反而站在了最合适的位置上。


一个自上而下,一个自下而上,决定了际数和行业里其他玩家走上了两条完全不同的路。


一张图、一把尺、一个飞轮


际数对数据质量有深刻的理解,三板斧解决问题:一张图、一把尺、一个飞轮。


  • 「一张图」用测绘技术建立了精准的空间数据,对哪些因素会对质量产生正负影响,做预测和评估;
  • 「一把尺」是际数的误差检测模型,精度更高、信息更完整的场景基座,衡量一套观测体系在特定场景里会出现什么误差、哪些能修正;
  • 「一个飞轮」积累的是不同传感器、数据产品和交付场景中的质量问题与质检经验。专家判断被逐步转化为质量模型参数,用于守住最终交付质量。


这些共同构建了际数科技在数据质量领域的技术护城河


从一颗火星石头,到一座质量因子库


在访谈中我们得知,周源和叶文凯两位联创有一位共同的导师,空间信息领域大拿李荣兴教授。李荣兴是 NASA 火星探测漫游者任务的参与科学家,长期从事行星制图与漫游者定位研究,后来回到同济大学任教。


故事发生在多年前。NASA 火星车勇气号和机遇号登陆后,因火星环境与地球测试条件不同,轮速计定位误差每天接近百米;纯视觉方案受限于地表特征稀少,也只能降到约五十米。


李荣兴团队没有继续堆算法,而是分析每块石头带来的定位误差,为不同地标分配权重,最终将误差降至一米。原本设计寿命只有 90 个火星日的机遇号,最终服役约十五年、行驶超过 45 公里。这套「寻找稳定地标控制误差」的方法,后来也被用于祝融号、嫦娥任务和极地冰盖项目。


「其实到现在我们总结,它本质上就是一个质量贡献的因子库。」周源说。


简单来说,质量贡献因子库,是针对场景中可能出现的物体,会对数据质量产生影响、对不同的传感器产生影响,进行定性和定量分析的数据库。


举几个简单的例子:玻璃、白墙这类高反射无纹理物体会严重干扰视觉的定位和构图;树叶这类特征多变的物体,帧间差别很大,不是好的定位特征;而雪糕桶这种视觉友好的物体,高反材质却会让激光产生多路径效应、测距失准。


掌握了这些因子,就能很轻松地分析出不同环境下能的数据质量问题。


对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」

GData Quality Factor Library (QFLab),超亿帧多模态数据积累,经由专家质检甄别千余种高质量因子。


因子库本身是一个模型,它训练的,是「观测结果」与「观测真值」之间的差异。


际数有着其他数据企业无法比拟的优势:能够采用相比于数据采集更高阶的测绘技术,为场景构图定位确定真值。


这套「观测减真值」的误差量化范式,正是测绘学科区别于纯数据驱动质量评估的地方:它有一个高于被测系统的、独立的真值来源。


对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」

多模态数据处理流程,quality-aware 模型感知场景内的可靠锚点,经由 4D 重建形成时空自洽的多模态传感数据关联,进而促进下游仿真生成任务的处理效率和处理效果。


这正是来自测绘背景的技术团队的精髓和竞争力:提前把数据质量问题解出来。目前在智驾领域,际数的因子库已经覆盖五千多公里场景,面向激光雷达、视觉、惯导和 GNSS 定位分别做了质量因子的积累。


大量未过检数据是宝贵的财富


但数据质量从来都不是定性的,在不同任务场景下有不同定义。大量人类主观判断的因素,反而是做好数据质量中最难的部分。


2024 年,智驾行业提出端到端方案,其本质是行为克隆(Behavior Cloning),通过观测结果和人类行为,学习人是对车的操控。这给了叶文凯启发:质量控制的本质和这件事惊人地像,能不能通过对原始数据和交付成果的观测,学习人类的判断行为,训练出一个模仿人做质检的模型?


简单来说,际数把质检人员的判断行为完整留存下来,用人的判断路径来训练质量模型,这是非常创新的一步。


这与现在的 harness 工程中 skill 的理念不谋而合,持续将不可量化的能力持续沉淀为流程、经验和技巧。让质检员不只给出「过」或「不过」,还要留下为什么,记录进一条专门设计的流水线,并加入自然语言和标签。


对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」

多模态数据处理动态工作流,质量因子库持续集成人类质检专家经验,一方面提供不同场景下的质量因子 KV 参考,另一方面推动质量模型飞轮闭环。


质量模型在 2025 年底完成训练,2026 年 Q1 试用、Q2 性能趋于稳定,表现得与人类非常接近。如今际数内部的算法流程已经变了:各垂类模型或算法的推理结果先经质量模型评估、暴露问题,有问题就返工,形成闭环。人和质检模型一旦产生分歧,二次检核基本都是质量模型胜出


从这点来看,际数科技完全有能力直接去做具身智能的端到端训练,但难能可贵的是,他们选择了用强大的技术力去深耕数据质量这条路。当我们问道这个问题的时候,周源博士说:「假如说我要去做具身,数据质量问题肯定重要。既然不论怎样我都得解决数据质量问题,我不如专心的把数据质量问题解决好。」


就像叶文凯博士说的,「我们形成了一个认知,直接去发现 A 到 B 的一个路径。和判断某个点离 B 有多远,是两种难度 Level 的问题。」这一思路既延续了测绘学中通过局部观测逐步逼近目标的经典方法论,也与现代机器学习中的残差思想不谋而合:相比一次性求解全局路径,更关注当前状态与目标之间的 “差距”,并据此持续校正、迭代逼近。


有意思的是,这套质量模型「吃」的数据,恰恰是别人扔掉的那些。


行业里的数据使用极其奢侈。具身采集一百小时,真正送进训练的可能只有十到二十小时,中间是一个巨大的数据漏斗。以抓握动作为例,精度要求亚厘米级的精密操作,超过就丢弃,可这条数据只是对这个具体任务失效了,拿去训练精度要求没那么高的通用行为,其实还能用。


过检数据只符合某个具体分布,不过检的数据反而丰富广泛,能揭露设备故障、语义歧义、场景问题、操作不规范等共性问题。「过的数据对某个具体任务有价值,不过的数据对评估整个具身更有价值。」际数就是拿这些「有质量问题的数据」去喂自己的模型。


「就跟炼油一样,」周源笑道,「炼石油时沥青本是要丢弃的废物,可后来发现它能铺路、能做塑料、还能发电。数据正着用、反着用,都能创造价值。」


独一无二的技术背景


可以说,测绘行业的背景,构成了际数科技在空间数据质量上的底气。


用测绘的精度,重新定义空间智能的数据底座。


有人会问:测绘面对的东西相对静态,具身面对的是动态、有交互的世界,这套经验真能迁移吗?


周源的回答是,测绘从来不只是刻画静态基准,它一直有一个更大的挑战,就是了解和预测世界的变化,这套「变化检测」的方法论,让他对如今火热的世界模型格外亲切。关键在于:先刻画一个极精准的静态状态,再去感知变化,难度会大幅下降。这在智驾里已被验证,有了很好的静态基座,再去做车辆检测、行为和轨迹识别都有显著提升。


叶文凯出身华为,历经完整自动驾驶的技术路线演进与量产交付实践。


华为智能驾驶研发经历让他深刻认识到:复杂系统开发中,最重要的往往不只是代码本身,更是那些在长期实践中不断积累、沉淀下来的问题与测试用例。此后,他将这一认知带入际数的数据工作中,持续把真实场景中的问题经验转化为可复用、可迭代的数据质量能力。


他从智驾和具身的对比里看到,具身智能从传感器配置到模型感知范式均尚未收敛,对应的数据需求也呈现出高度异构、难以统一的面貌。但可以预期,未来具身数据的演进将经历从数据匮乏、数据泛滥到高质量场景数据精筛的阶段性跃迁。


他甚至有一个大胆的说法:质量本身可以成为一种模态。


「大家说视觉、语言、动作(VLA),我觉得可以是视觉、语言、质量、动作。」因为质量会直接影响行为:抓握时如果测距误差有二十公分,机器人只会继续往前伸;精度到五公分以内,它才能明确做出抓取动作。


际数对这套体系的护城河有着清醒的判断:真正难以被复制和逾越的,是长期沉淀形成的质量认知与专家经验。


「时间其实是最友好的壁垒。」即便是有钱有人的大厂进场,投更多人、更多设备,也绕不开把一个个场景的质量问题实测、磨出来的过程。「质量因子库」正是这类经验的具象化载体。在当前 AI 辅助人类协作的模式下,人最不可替代的价值,正体现在对具体问题的经验判断与认知沉淀上;而这些认知也能够跨越人员与任务,实现共享、复用与持续迭代。


稳定的商业路径


际数的三位联合创始人,命运都被「数据」牵动着。


CEO 周源是武汉大学测绘工程博士、同济大学博士后,师从李德仁院士,武汉大学与俄亥俄州立大学联合培养,曾参与 NASA/JPL 火星车空间定位与制图,参与主持过多项国家重大项目与国家标准制定,获中国测绘科技进步奖一等奖。负责公司战略方向与空间智能质量基础模型定位。


CTO 叶文凯是同济大学测绘与遥感博士,同济大学与佐治亚理工联合培养,师从李荣兴院士,曾参与南极冰川研究等国家重大科研项目,曾在华为、极氪从事智能驾驶研发,熟悉场景数据建模与智驾数据闭环。负责技术体系搭建与产品实现。


联合创始人邹小弟,有 20 年以上汽车行业经验,前博世中国销售总监、前百度 IDG 销售总监。负责商业化与项目交付。


「一个做数据,一个卖数据,一个用数据。」周源在项目里见过太多数据上的问题,邹小弟在智驾方案销售中感受到质量对交付的痛点,叶文凯则直接是智驾厂商的数据用户,亲身体会过大量资源都耗在等数据上。


「我们三个人加在一起,能够看到整个行业。」从生产、销售到使用,三个不同位面的人看到了同一件事:空间数据的质量问题对下游的伤害有多大,这是一个共性需求。


负责商业化的邹总把际数的路径总结为从「以质取胜」到「复售」。


早期公司小,客户凭什么信一家小公司?靠质量。在智驾业务里,他们盯着帧准率和元准率这两个客户最看重的指标:行业早期一般定在 95%,后来提到 98%,而际数在成立之初就做到接近 99% 以上。


量少,但客户愿意为「质」买单。在这个基础上,际数用工程、算法和数据基座能力构建起高价值场景基座,客户以付费订阅模式接入,几年下来资产像滚雪球一样越滚越大,由此衍生出第二种模式:高质量数据集的定制。目前已有约十家客户付费采购并实现复售。


「大量公司是客户说什么就做什么,有点像来料加工。我们的逻辑不一样。」


际数的差异化在于「漏斗」的概念:他们会站在客户算法模型的角度,从规划采集的第一步一直陪客户走到数据进模型训练,每个环节怎么控制场景质量、切片质量、清洗质量、标签质量。


几个数字颇能反映这套打法的健康度:客户转化率在 80% 以上,验收通过率基本 100%,回款基本按时全额到账。客户群体也从早期的算法公司,今年开始转向 OEM 车企为主。


2024 年,一家头部智驾算法企业找到际数科技生产生产一批高精度车道感知数据,每组数据包括 7 路环视相机、1 路激光雷达和 1 路 GNSS 观测。际数用约 35 天完成需求对齐、POC 及首期 10 万组交付,达成了客户超半年也未能成功的生产,最终同时达到亚像素级反投、3 厘米内空间误差、100% 要素完整率和 99% 以上分类准确率


首期交付后,客户立即追加 60 万组订单;截至 2025 年 10 月,双方六期合作累计交付 395 万组次


更重要的是,际数已经实现了从数据的一次性交付进化成了可持续复用的数据资产。客户技术栈升级后,际数依托完整的场景基座和原子化数据规则,直接重组历史数据,替代重新采集;后续任务中,超过 60% 的历史数据被再次调用,交付周期和成本显著下降。


「假如要选一个最快实现数据飞轮的场景,哪一个会最快?」周源的分析是:家庭。


数据飞轮的实现,一定要有人机的高频交互。智驾为什么能形成飞轮?因为人可以接管汽车,而这个「接管」本身就是极高价值的数据。


物流、工厂虽然能讲很好的商业模式,但它们是纯自动化的过程,一旦需要人类干预就证明失败了。家庭则不同。家庭对智能化设备的包容度非常高。


「能选到一千个家庭部署机器人,初步的飞轮就有了。」飞轮一旦转起来,不停有人类输入进来纠正,初步的智能就只是时间问题,这正是行为克隆能跑通的地方。作为前置上游的第三方基础设施,际数的场景和数据优势在这个兵家必争之地最能体现价值。


结语:具身时代的精炼厂


际数科技的名字本身是个谐音梗,既搞技术又搞科技;更深一层,「际数」隐含着探求数据边界、拓展数据价值的含义。


我们知道,全球自动驾驶数据标注市场在 2025 年约为 50 亿美元,年复合增长率超过 25%;具身智能数据市场预计在 2026 年达到 10 亿美元,并有望于 2030 年突破 100 亿美元。


按照当前的数据漏斗与采集成本估算,要获得一亿小时有效训练数据,可能需要采集上百亿小时的原始数据,投入高达数百亿甚至数千亿元。


质量不只是一个绕不开的痛点,更是撬动数据有效率的一根杠杆。在价值 3000 亿的数据规模下,只要能将数据合格率提升 10%,就是高达 300 亿的市场价值的释放。


自动驾驶是现在时,具身智能是未来时。场景在变化,模型在迭代,但对物理世界的精确刻画、对多模态时空数据的可靠对齐,是可以跨越赛道、反复复用的底层能力。


工业时代需要石油,但原油只有经过精炼,才能真正成为工业血液;智能时代需要数据,而空间数据同样需要一套精炼基础设施。随着智能革命向前推进,数据正在成为整个行业的基础设施,高质量的数据则决定了这套基础设施能够把行业带多远。


际数科技把百年测绘对误差的偏执,变成了具身智能时代一把丈量数据的尺子,一座建立在数据资源上的精炼厂。


文章来自于"机器之心",作者 "冷猫"。

1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

添加客服微信openai178,进AITNT官方交流群