大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26
AI技术研报 2026-09-09 14:49
+8962 阅读

自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。


这样造成的偏差,又会成为后续生成的上下文,最终累积成整句语义偏移。


vivo AI Lab研究团队把问题进一步追到强化学习的“更新规则”上,并提出CAPO-SLT(Confidence-Aware Policy Optimization for Sign Language Translation),在不更换视觉编码器与奖励函数的前提下,让强化学习阶段的手语翻译生成更稳、更忠实。


从沟通无障碍到数字包容:手语翻译为什么重要?


手语不是把口语逐字换成手势,而是拥有自身语法、空间表达与非手部信息的视觉语言。自动手语翻译要把连续的视频或姿态序列转换为自然语言,让手语使用者与不懂手语的人能够跨越语言模态直接交流。它连接的不只是两种表达方式,也是现实世界与数字服务之间的一道接口。


在公共服务、医疗沟通、教育课堂、应急信息、客户服务、职场协作和在线视频等场景中,专业手语翻译资源并不总能随时覆盖。可靠的自动翻译技术可以补充人工服务,为信息获取、内容生产与双向沟通提供更及时的支持,并推动无障碍能力从少数专门场景走向日常产品。


社会价值对应着更高的可靠性要求:“流畅却译错”往往比明显的不通顺更难察觉。一个关键词、否定关系或事件主体的偏移,就可能改变整句话的含义。因此,手语翻译不仅要追求指标提升,更要忠实于视觉证据并保持生成稳定。


大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

同样是正优势词元,统一裁剪无法区分其置信度;CAPO按旧策略置信度分配不同的更新上限。


手语翻译模型“看懂”之后,为什么还会“说错”?


自动手语翻译同时面对模态差异、时间粒度差异和语言结构差异:手部动作可能非常细微,相近手势容易混淆,动作边界并不总是清楚,表情、口型等非手部线索也可能不完整。近年来,研究重点多放在视觉—语言对齐上,让模型先学会把动作与文字放进同一个语义空间。


但“对齐得好”并不等于“生成得稳”。翻译是自回归过程:模型生成一个词,再把它连同此前内容用于预测下一个词。强语言先验会让某些续写听起来很自然;一旦它们没有得到视觉证据充分支撑,流畅反而可能掩盖错误。


强化学习本可直接根据整句质量优化模型,却又引入新的噪声:奖励通常在句子层面给出,优势值却要分配到每个生成词上。模型知道“这一整句总体更好或更差”,但未必能准确判断究竟是哪个词做对了、哪个词造成了偏移。


症结:所有词共用同一把“限速器”


PPO、GRPO等策略优化方法会限制新旧策略的概率比,避免单次更新迈得太大。传统上限是固定的:所有“正优势”词元共享同一个裁剪范围。这个规则简单有效,却忽略了词元之间截然不同的状态。


旧策略已经高度确信的词,可能只是语言先验下的“顺口选择”,继续大幅放大其概率容易强化错误路径;旧策略概率较低、但获得正优势的词,可能正是值得纠正和探索的方向,却被同一上限压住了更新空间。


CAPO并不把“高置信度”当成“语义正确”的证明。旧策略概率只被当作控制更新幅度的信号,用来回答:这个词已经被旧模型偏好到什么程度,还需要多大的增幅?


解决思路:让每个词拥有不同的更新上限


对于正优势词元,CAPO根据旧策略为该词分配的概率动态设置上裁剪边界。旧策略置信度越高,上限越接近保守范围;置信度越低,则保留更大的正向更新空间。论文将基础上限设为0.2、最大放宽到0.3


这并不是压制高置信度词。高置信度且获得正优势的词依旧会被强化,只是不被不必要地过度放大。对于负优势词元,CAPO进一步为损失幅度设置上限,降低句级奖励噪声把个别词“罚得过重”的风险。


大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

先建立跨模态表征与翻译能力,再用CAPO约束强化学习阶段的词元级更新。


从姿态到句子:模型是怎样训练出来的?


  • 监督初始化:从视频提取全身姿态关键点,拆分为面部、身体、左手和右手四组;用ST-GCN建模空间关节关系与时间运动信息,并学习视觉—文本共享语义表示。
  • 强化学习微调:对同一段手语采样多条候选译文,综合BLEU-1、BLEU-4、ROUGE-L与BERTScore计算句级奖励,再得到组内相对优势。
  • 置信度感知更新:对正优势词元使用随旧策略置信度变化的上限,对负优势词元限制过大的损失,在不改变奖励与主干网络的情况下稳定更新。


中文侧使用CSL-News进行大规模预训练,再在CSL-Daily上监督微调、强化学习与评测;英文侧使用YouTube-ASL预训练,并在How2Sign上验证美国手语翻译。论文还在WLASL2000上进行孤立词识别评估。


结果:仅用姿态输入,中文手语三项指标均取得表中最佳


大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26


在CSL-Daily测试集上,与此前同样只使用Pose输入的Geo-Sign相比,三项指标分别提升2.93、1.260.64分;与Pose-only的Uni-Sign相比,则分别提升4.96、3.073.67分。论文对比表还包含同时使用Pose与RGB的方法,而CAPO-SLT在仅用姿态的情况下仍拿到三项最高值


大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

CSL-Daily主结果。CAPO-SLT仅使用Pose输入;红色为表中最佳结果,蓝色为第二名。


跨语言与辅助任务


在How2Sign上,CAPO-SLT仅使用Pose,取得41.4BLEU-1、15.2BLEU-4和34.9ROUGE-L;相较同样使用Pose的Uni-Sign,分别提升1.0、0.70.6分。在WLASL2000上,Per-Instance与Per-Class准确率分别为63.77%61.91%,说明姿态表征在另一类手语理解任务上仍保持竞争力。


消融实验:增益来自哪里?


研究团队让SFT、GRPO、DAPO和CAPO共用同一监督检查点、同一奖励与训练设置,只替换策略优化规则。相较DAPO,CAPO的三项指标分别提升0.30、0.500.67分。移除负优势上限后,结果降至58.48/28.03/57.80;把反比例置信度映射换成相同范围的线性映射,BLEU-4与ROUGE-L分别下降0.730.60分。


“听起来对”与“意思真的对”,差别就在几个关键词


没有CAPO时,模型会把“我分别介绍这几位同事”翻译成“我是一个由几个人组成的团队”;把“天黑了,我害怕”译成“天黑了,我睡着了”;还会把“这部电影的女演员很漂亮”改写成“这部电影讲的是女演员的爱情故事”。这些句子都算流畅,却替换了谓词、实体关系或事件含义。


加入CAPO后,这三组译文均恢复到与参考答案一致或语义等价的表达。剩余错误主要是局部遗漏、时间表达偏差或轻微措辞差异,而不是整句意义彻底翻转。


大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

绿色为正确表达,红色为错误或缺乏视觉支持的内容。


训练曲线也给出同一方向的证据


GRPO的平均熵先快速下降,随后在训练后期重新上升,反映策略不确定性再次增加;CAPO则在早期下降后逐渐稳定,没有出现突然的熵坍塌,也没有后期明显反弹。置信度感知裁剪让词元级更新更受控,与方法希望改善的“生成阶段稳定性”一致。


大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

GRPO(上)与CAPO(下)的策略熵和KL散度。CAPO的熵在早期下降后趋于稳定。


从“对齐”走向“稳定生成”


CAPO-SLT的价值不在于再叠加一个更大的视觉编码器,而在于把关注点从“模型有没有看懂动作”延伸到“模型怎样把理解稳定地说出来”。当奖励来自整句、更新却发生在每个词时,给所有词相同的更新上限未必合理;旧策略置信度提供了一个无需额外模型、可直接计算的控制信号。


这种设计也具有工程上的可移植性:CAPO不修改视觉主干和奖励函数,只替换策略优化中的裁剪规则。对于已经具备监督初始化和PPO/GRPO式强化学习流程的手语翻译系统,它提供了一条相对低侵入的稳定化路径。


局限与下一步


CAPO在美国手语翻译上的增益比CSL-Daily更温和。当前奖励完全依赖参考译文,将BLEU、ROUGE-L等重叠指标与BERTScore结合,仍难完整覆盖合理改写、篇章级充分性和细粒度语义偏好。未来,团队计划探索学习式偏好模型或面向手语翻译的专用语义评估器。


论文标题:《CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation》
作者:Ling Zhou、Yuhao Chen、Lin Cheng、Chengwen Yao、Donghui Sun、Xiaoxin Chen。Ling Zhou 与 Yuhao Chen 为共同一作,Donghui Sun为通讯作者。
论文链接:https://openreview.net/pdf?id=l4bCsrSkYx


文章来自于"量子位",作者 "vivo AI Lab团队"。

1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

添加客服微信openai178,进AITNT官方交流群