刚刚落幕的2026世界人工智能大会(WAIC)针对人工智能安全的讨论被推到了前所未有的高度。大会《主席声明》明确提出,"要筑牢安全底线、防范滥用恶用,确保人工智能始终处于人类控制之下"。
这一顶层共识的落地,在物理智能的赛场显得尤为迫切。
此前,行业讨论的重心大多围绕机器人动作流畅度、世界模型参数规模、舞台演示效果展开。但绝大多数人忽视了一个致命隐患:可观的任务成功率,并不等价于系统具备可靠的物理安全保障。
背后是不同行业容错率的问题:大模型输出一段错误文字,影响仅限于信息层面;具身机器人一旦感知或者决策出错,后果直接映射到现实物理空间,碰撞、设备损坏接踵而至,严重时还会威胁人身安全。更现实的难题是,单纯依靠成功率,无法区分两种作业模式:按照规范安全完成任务,或是突破边界、伴随碰撞勉强达成目标。
这也折射出行业普遍面临的落地难题:众多演示性能优异的机器人系统,难以满足工厂、商用场景严苛的常态化运行要求。产业亟需一套可量化、具备工程落地性的可信评估范式。
对齐人工智能治理的顶层导向,针对上述产业痛点,Xspark AI(无界智航)联合清华、北大、港大MMLab、港科广等多所顶尖高校,发布重磅综述论文(全文 37 页):Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels。
主页:
https://xsparkai.com/sparklab/towards-trustworthy-eai/
arXiv: https://arxiv.org/abs/2607.26121
依托团队在具身智能评测体系长期积累的学术研究与世界模型自动驾驶量产实践经验,该工作系统性提出可信具身智能标准化定义、四层技术支撑框架以及 TEI T0-T5 六级可信分级体系,为物理智能的评估体系增添全新维度。
早在行业形成广泛共识之前,Xspark AI 便将可信能力作为具身系统研发的核心主线。此次研究产出综述理论成果的同时,团队正全速推进学术标准定义、系统架构承接、全栈技术落地的完整闭环,依托原生具身中枢系统与自研全链路技术底座,实现可信具身智能从理论范式到工程量产的落地验证。

1.1 破除核心误区:模型对齐 ≠ 具身安全
目前行业的主流认知是只要完成大模型的算法对齐、价值观对齐,就能实现机器人安全可控。综述明确指出,这套逻辑并不适用于物理实体智能。数字 AI 的安全,聚焦文本、逻辑、内容合规;而具身智能的安全,是感知、规划、执行、交互、兜底、部署的端到端系统安全。单纯的上层模型对齐,无法覆盖物理交互层面的受力、空间、碰撞、失衡等底层风险。
论文给出全新核心定义:可信具身智能的终极目标是“持续安全成功”。即机器人需要在环境、系统持续变动的条件下稳定执行指定任务,全程将风险控制在可接受边界内。任务完成能力与全流程风险管控必须双向达标、并行成立,缺一不可。只追求任务成功率、忽视过程安全性,是当前所有落地瓶颈、安全事故、量产受阻的根本根源。
在此基础上,研究精准拆解出制约行业规模化落地的三大底层失效鸿沟,也是绝大多数机器人无法商用的核心症结:
语义 - 物理鸿沟:高层语义规划与真实物理世界约束脱节。模型能读懂人类指令、规划任务路径,但无法精准理解物理边界、材质属性、受力极限、空间约束,频繁出现“逻辑可行、物理违规” 的决策偏差。
动作 - 后果鸿沟:机器人可完成标准化动作序列,但无法预判物理交互的连锁后果。模型只会执行流程,不懂风险推演,对挤压、过载、碰撞、失衡等隐性危险缺乏预判能力。
跨层不可组合性:感知、规划、执行、风控各模块独立优化、单点最优,但单层性能优秀,无法叠加出整机安全。系统存在大量跨层漏洞与协同盲区,风险、假设会在各层级间传导扩散,导致端到端可信无法落地。

针对三大核心痛点,综述搭建模型层、系统层、证据层、部署层四层协同可信支撑体系,四层框架相互依存、缺一不可,各层明确分工:模型层输出带不确定性校准、内置安全偏好的动作方案;系统层依托感知、计算、硬件防护实现动作授权与故障隔离;证据层通过评测、溯源、验证为可信等级提供完整佐证;部署层依靠运行监控、人工干预、事件响应长期维持可信资质。综述明确核心结论:具身安全无法依靠单一模型、单一算法、单一模块实现,必须全链路、多层级、体系化联动防御。

1.2 TEI T0-T5 分级体系:对标自动驾驶,建立行业通用可信标尺
为了让抽象的“具身可信” 变成可落地的工程标准与产业准则,综述对标自动驾驶 SAE 成熟分级范式,推出行业首个TEI T0-T5 六级可信分级体系,覆盖 T0 无可信能力至 T5 可持续高阶可信完整谱系。
体系从任务能力、安全管控、系统兜底、证据充分性、部署治理五大核心维度,全方位量化机器人可信水平,并设立两条刚性判定规则,彻底规避行业评价漏洞:第一,木桶效应定级:整机可信等级由系统最薄弱环节决定,杜绝“局部亮眼、整体虚高” 的演示假象; 第二,动态实时降级:可信等级不是静态证书,会随场景切换、模型漂移、监控故障、证据缺失实时调整,适配真实复杂落地环境。
同时综述详细界定了每一级的能力边界与适配场景:


这套分级体系,揭露了两个重塑产业格局的关键真相:
一是通用大模型堆叠,无法实现高阶可信。仅依靠通用模型算力与泛化能力,缺少独立安全监控、动作回退、全链路验证机制的机器人,最高仅能达到 T2 低可信等级,无法满足工业与商用准入标准,这也是多数网红演示机器人难以量产的核心原因。
二是体系化安全架构,优先获得落地资格。具备完整分层风控、系统兜底、全场景验证、部署治理的垂类具身方案,即便模型参数并非极致顶尖,也可稳定达成 T4 高阶可信等级,具备规模化商用的核心资质。
对整个产业而言,TEI 分级的落地或许具备里程碑意义:它终结了行业标准混乱、安全能力无法量化、落地风险无法评估的迷茫,为技术迭代、场景准入、供应链选型、资本估值提供了统一、权威的评估标尺。
作为本次综述的产业牵头落地方,Xspark AI 并不满足于仅提出学术理论体系。团队以打造可落地的高阶可信具身智能系统为目标,全力搭建对齐 TEI 可信框架的 “慢脑 - 快脑 - 脊髓” 中枢系统,分层实现全局风险前置预判、触觉驱动精准执行、毫秒级独立安全兜底,通过自身技术能力从工程层面将这套分级标准转化为可交付、可量产的可信具身智能系统。为此,团队坚持内功先行,深耕底层技术,搭建了全链路自研的 infra 体系。
在评测层面,自研具身智能标准化评测基础设施与仿真、真机一体化评测工具链,可全方位量化机器人鲁棒性与极端工况风险处置能力,为TEI T0-T5分级提供标准化、可复现的实证依据,解决行业安全能力无法量化验证的痛点,同时依托长期与全球多家顶尖模型团队共建评测体系的独家迭代经验反哺自研模型训练方案,摆脱迭代“开盲盒”的低效试错路径。
在数据层面,依托联合创始人丁文伯教授团队在触觉技术领域的扎实积累搭建闭环可信数采基座,通过TOCO-A、MARC-A、MOQA-P、FIDA-L四大标准化模块,实现多模态数据拆解、对齐、质检、失效补采的全流程规范迭代,累计沉淀数千小时高精度全掌触觉数据(行业最大规模),弥补纯视觉感知的物理交互短板;搭配自研AIGC全模态数据增广能力,高效生成长尾、极端、高风险场景样本,破解真实场景数据稀缺的训练瓶颈。
在感知层面,团队深耕触觉编解码、跨模态融合等底层软硬件技术,前瞻性研发新一代多光谱传感器,打破传统接触式感知局限,可无接触捕捉力态、位姿、材质、碰撞等十维交互信号,为端侧系统毫秒级安全兜底与实时风控提供硬件支撑。
在模型层面,基于自建触觉数据底座瞄准SOTA级打造触觉融合模型(VTLA+TWAM)“快脑”。通过专属3D自中心空间实现视触精准融合,触觉独立数据流,常态下双模态协同增效、极端感知缺失场景下可单流独立作业,大幅提升机器人作业精度与复杂工况容错能力,将TEI体系对机器人持续安全、稳定作业的核心要求落实己任。
随着可信 AI 成为产业共识,具身智能赛道或将逐步告别 “唯演示、唯成功率” 的粗放发展阶段,转向标准化、安全导向、具备规模化落地潜力的新周期。此次,由 Xspark AI 联合多所高校推出的 TEI 可信分级体系,尝试补上行业长期缺失的标准化评估标尺,提供一套可量化、可验证、可横向对比的可信评估思路,启发行业跳出单纯比拼单点性能的内卷。Xspark AI 也将持续参与这套开放框架的迭代与行业生态共建,和产业各方共同探索统一的可信评价准则,推动具身智能从实验室演示场景,稳步走向安全可控、可规模化商用的阶段。
文章来自于“Z Potentials”,作者“Z Potentials”。