机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026
AI技术研报 2026-08-31 10:22
+7971 阅读

机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026


S²-VLA 引入信念状态和自适应动态门控,仅用2B参数、7GB显存,长程操控超越7B模型。


过去一段时间,Scaling Law 在具身智能里被看得很重。为了让机械臂完成复杂的搬运、对准和组合,多数工作把视觉-语言-动作(VLA)模型做到 7B 甚至 8.5B。参数变大后,语义理解和场景识别确实更强了,但长程操控里的不稳定问题并没有随之消失。


很多大参数量 VLA 在执行到第 10 步或更后面时会出现突然失败。核心原因是累积误差放大(Cumulative Error Propagation):早期哪怕只有毫米级定位偏差,也会在后续步骤中逐步放大,最终导致抓取失败或动作中断。参数量大了,语义理解确实更强,但模型在动作后半程还是很难及时纠正偏差。


华东师范大学与上海交通大学团队提出的 S²-VLA 针对这个问题做了改进。工作由谢志鹏、韩宗益(共同一作)、赵静(通讯作者)和孙仕亮等完成。


他们没有继续堆参数,而是加了信念状态和自适应动态门控,让模型能按当前阶段调整注意力。结果是:2B 参数量的模型在 LIBERO-Long 上达到 96.4% 成功率,超过了多数 7B 甚至 8.5B 的模型。


机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026

论文链接:https://arxiv.org/pdf/2606.27872


下面我们从机制和实际表现来看它具体怎么做的。


01

静态注意力:

为什么微小偏差会一路放大


先看传统 VLA 在长程任务里常见的失败模式。


在解耦式 VLA 里,上层策略头把视觉和语言特征映射成控制指令。多数方法用的是静态特征融合(Static Fusion):视觉、语言和动作历史的权重比例,在整个任务里一直固定不变。视觉、语言语义和动作历史的权重一旦定下来,就不会随执行进度改变。


机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026


这在短任务里问题不大,但在长程序列中会暴露两个明显缺陷。


第一,早期如果出现毫米级定位偏差,模型无法及时提高视觉权重来纠偏,误差会逐步累积,最终导致任务失败。


第二,子任务切换时,缺少对高层意图的动态调整,模型容易偏离当前指令,动作中断或卡在半空。


静态融合相当于全程用同一套“注意力配比”去应对不同阶段的需求。需要精细对准时,视觉权重不够;需要切换目标时,意图权重又上不去。结果就是误差一旦出现,就很难在后续步骤里被压下去。


S²-VLA 会随阶段调整:需要精准对准时,就提高视觉权重来纠偏;到了任务切换时,再提高意图权重,把目标重新锁定。


机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026


02

核心机制:

信念状态 + 三路自适应注意力


为了实现阶段自适应的注意力分配,作者把架构分成两个主要部分:


机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026


信念状态(Belief State)


模型用一个很轻量的循环网络,实时接收上一时刻的动作历史和关节传感器反馈。


它不直接输出动作,只在内部维持一个信念状态(Belief State),用来判断“现在走到哪一步了”和“有没有出现偏差”。


这套状态不需要人工标注阶段标签,完全靠端到端预测下一个动作的损失来驱动,在潜空间里自己学会估计任务进度和执行质量。


训练时只优化最终动作预测,信念状态作为中间表征被间接监督,因此能自发形成对“进度”和“偏差”的感知,而不依赖额外的阶段标注。


三路自适应注意力(SSGAA Module)


信念状态提供当前阶段的信号后,SSGAA 模块把策略头的特征融合拆成三条平行通道:


  • 局部视觉通道(Visual Cross-Attn):接 VLM 的低层视觉 Token,负责精细空间定位和对准;
  • 全局意图通道(Intent Cross-Attn):接高层语义 Token,负责子任务规划和目标理解;
  • 动作自注意力通道(Action Self-Attn):在预测的未来多步动作间建立时序关系,保持轨迹连贯。


信念状态会生成动态门控权重(gating weights),根据当前阶段决定三条通道各占多少比重。


需要高精度定位时,视觉通道权重上升;需要切换子任务时,意图通道权重上升;在平稳移动阶段,动作自注意力通道占主导。


消融实验显示,把门控加在策略头中间层(比如第 12 层)效果最好,既能保持特征稳定,又能保留自适应能力。


03

31 步里的注意力变化:

和关键动作帧对齐


实际执行时,三路门控权重会随任务阶段明显变化。作者把 31 个推理步骤的门控曲线和关键动作帧对齐后,就能看出具体规律。


机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026


以“把芝士盒和黄油都放进篮子里”为例,作者画出了 31 个推理步骤的三路门控权重曲线,并和关键动作帧对齐。


瞄准与定位阶段(Aim target / Locate,关键帧 4、9、21、26)绿色曲线(视觉门控权重)明显升高。末端执行器接近目标时,模型提高视觉权重,做更精细的空间定位。此时如果继续用固定比例,毫米级偏差很容易被带到后续抓取步骤;提高视觉权重后,纠偏更及时。


抓取与子任务切换阶段(Grip / Put / Task change,关键帧 7、16、23、30)红色曲线(意图门控权重)升高。夹爪闭合、物体放入篮中,或从第一个物体转向第二个物体时,模型提高高层意图权重,保证子任务切换不中断。


这一阶段如果意图权重不足,模型容易“忘记”下一个目标,动作链条就会断掉。


稳态平移阶段(关键帧之间的过渡期)蓝色曲线(动作自注意力)保持较高水平,主导轨迹生成,主要靠时序关系保持运动平滑,减少对无关视觉细节的计算。此时不需要过高的视觉或意图权重,把计算留给动作连贯性更划算。


从这些对齐结果能看出,2B 的 S²-VLA 能超过多数更大的模型,关键就在于注意力不再一成不变,而是会按阶段把算力分到更需要的地方。


04

动态注意力、分层解耦与端侧效率


S²-VLA 的做法,和这两年空间智能、世界模型方向的讨论比较贴近,主要体现在三点。


随任务阶段调整注意力,而不是全程固定


空间智能相关讨论里常提到:物理世界的模型不能只是静态看图,而要在时间和空间变化中,把注意力动态分到几何细节和逻辑关系上。


传统 VLA 的静态融合缺少这一点。S²-VLA的信念状态 + 动态门控,相当于在机械臂控制里做了类似的事:接近物体时提高局部视觉权重,任务切换时提高意图权重。注意力随执行状态变化,而不是预先锁死。


把高层语义理解和低层控制分开


不少工作(包括 Yann LeCun、Yilun Du 等人的讨论)都在推动把“看”(高层语义)和“动”(低层控制)解耦。用一个大单体模型去直接拟合所有关节角度,成本和鲁棒性都不理想:参数量大、训练贵,而且一旦早期出错,后续很难自我纠正。


S²-VLA的路径比较直接:底层 VLM 负责预训练带来的语义和几何表征;策略推理用轻量信念状态,根据控制反馈调节注意力门控。 这对应了当前常见的分层解耦思路,也让小模型有机会在长程任务上表现得更稳定。


端侧可用的显存和吞吐


实验室成功率重要,但实际部署更看成本和响应速度。


S²-VLA推理显存约 7GB,吞吐量 80.8 Hz(同类 7B 模型通常只有几 Hz),对家电或工厂场景来说,这意味着不需要把大模型塞进服务器再远程控制,响应延迟和部署门槛都会低不少。这对以后从实验室走到实际应用,会更有参考价值。


05

结语:参数量之外,

更需要阶段自适应的调度


S²-VLA的价值不只是把成功率再提高几个点。它直接说明:长程操控里,单纯加大参数量不够,还需要能按阶段调整注意力的机制。


参数量大,确实能带来更强的语义理解和世界知识。但长程动作稳不稳,更要看能不能在对的阶段,把算力分到对的地方。


静态融合把所有阶段当成同一种需求来处理,误差一旦出现就容易被放大;动态门控则让模型在需要纠偏时多看视觉,在需要切换时多看意图,在平稳移动时多维持动作连贯。


实际部署时,家电或工厂场景很难依赖大型服务器。能在端侧显卡上以约 7GB 显存、80Hz 量级运行的方案,对落地更有参考价值。


参数规模当然还是重要的,但在长程物理交互里,能不能按阶段灵活调度资源,同样关键。对具身智能和Agent系统而言,阶段自适应的调度能力,或许比单纯把模型做大,更具长期价值。


文章来自于"AI科技评论",作者 "张璐"。

1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群