登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球
AI技术研报 2026-08-24 15:38
+8334 阅读

顶会可以年年开,但这本期刊不是每个实验室都能进的。


《Science Robotics》是国际机器人领域公认的顶级期刊,由《Science》母刊旗下出版,影响因子长期位居机器人学科首位。能在这本刊物上发表成果,意味着研究经过了同领域最严格的同行评审,代表当前最前沿、最具突破性的技术进展。


今年 8 月,《Science Robotics》推出人形机器人专题特刊,汇聚了全球人形机器人领域的最新研究成果。本期特刊全球仅收录三家人形机器人公司平台 —— 加速进化、宇树、波士顿动力,代表了全球人形机器人研究的最前沿阵列。


登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球


在这期特刊中,清华大学自动化系赵明国教授团队联合字节跳动 Seed、中国农业大学发布了一篇论文,题为《Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots》(学习视觉驱动的人形机器人反应式足球技能)。该论文提出了一套视觉驱动的反应式足球技能学习框架,让人形机器人仅依靠机载视觉,在动态环境中连续完成找球、追球、调整步态和多方向射门。支撑这项研究的真机验证平台,是加速进化的人形机器人。


登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球


  • 论文链接:https://www.science.org/doi/10.1126/scirobotics.aed1152
  • 项目主页:https://humanoid-kick.github.io/


这项工作没有停留在某一个动作或单项指标上,它把视觉感知、状态估计、双足运动和物理接触放进真实足球任务,还进入 RoboCup 赛场,在持续变化的环境和真实对抗中接受检验。


二十二年的技术接力


2004 年,赵明国带领学生成立清华火神机器人足球队。次年,他们带着自行研制的机器人参加 RoboCup。早期机器人只有约 50 厘米高,行走缓慢,比赛时还需要保护人员防止摔倒。此后的二十多年里,火神队几乎每年参赛,机器人逐渐长到一米以上,学会自主起身、快速奔跑和大力射门。


足球场也成为团队长期检验视觉、决策、运动控制和整机可靠性的试验场。视觉识别慢了多少毫秒,落脚点偏了多少厘米,机器人在哪个方向容易踢空,都能在真实对抗中直接呈现。团队再把问题带回实验室,修改算法,下一场比赛继续验证。这种循环持续了二十多年。


赵明国长期从事类脑计算与机器人控制研究。他参与研制的「天机芯」类脑芯片及无人自行车研究曾登上《Nature》封面,并入选 2019 年度中国科学十大进展。从类脑计算到机器人足球,他关注的始终是感知、判断和行动如何在同一系统中连续运行。


随着岁月流转,火神队的成员一届届更替。加速进化创始人程昊曾是火神队第三任队长,从清华毕业后历经互联网创业的锤炼,以及在字节跳动担任飞书产品副总裁的履历积累,2023 年,这位对机器人念念不忘的队长选择重新出发,创办「加速进化」。曾经在火神队并肩作战的多名成员也纷纷加入,以初创团队的身份,再次开启了一场关于机器人的共同征程。论文第一作者王与时,则来自火神队的新一代。


从 2004 年火神队创立,到 2026 年论文登上国际顶刊,这是一场跨越二十二年的技术接力。


让机器人在噪声中看见并反应


这篇论文试图解决一个困扰学界多年的问题:在充满噪声、延迟和遮挡的真实环境里,人形机器人如何做到看见即反应


人类踢球时,视觉和动作几乎同时发生。眼睛追踪足球,大脑判断距离与方向,身体持续调整重心和落脚点。即使足球短暂被挡住,人也能根据此前的运动轨迹预判它接下来可能出现的位置。


机器人需要用摄像头、算法和关节控制完成这套过程,难度却大得多。摄像头拍到的画面可能因剧烈运动产生模糊,目标检测存在噪声和延迟,足球还可能跑出视野或被遮挡。同时,双足机器人还得维持平衡,并在几十毫秒内决定下一步落脚位置。感知、定位、决策、运动和物理接触被压缩进一个连续任务,任何环节慢半拍,机器人都可能踢空或摔倒。


传统方案通常把这一过程拆成多个模块。视觉系统识别足球并估计位置,决策模块选择动作,运动控制器再驱动机器人执行。这套方法方便调试,但也容易产生误差和延迟的逐级传递,并且在完美仿真中训练出的策略,到了真实世界可能因光照、噪声、遮挡而出现明显性能下降。


赵明国团队提出一套统一的感知 - 运动强化学习框架。核心思路是将视觉感知与运动控制置于同一个优化目标下进行端到端训练。


登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

视觉驱动的加速进化机器人控制系统概览。


研究团队首先建立了一套虚拟感知系统


他们让真实机器人在不同距离和视角下观察足球,累计采集约一小时的数据,再与动捕系统记录的真实位置进行对照,由此得到位置噪声、检测成功率、更新频率和延迟等感知特征。


这些特征随后被带入仿真。足球距离越远,位置噪声越大;相机视野会随机器人头部姿态变化。即使足球出现在视野中,也可能因为运动模糊等原因检测失败。视觉系统以约 25Hz 更新,平均延迟约 116 毫秒。


视觉短暂中断后,控制器还需要根据此前的信息继续判断足球的位置和运动趋势。为此,论文设计了编码器 — 解码器架构


策略会读取过去 50 帧、约一秒的历史观测,再将这些信息压缩为 64 维隐藏状态。训练阶段,解码器会尝试从隐藏状态还原足球真实位置和机器人动力学参数。这项辅助任务帮助策略完成视觉去噪,也让它能够在足球短暂消失后继续估计目标位置。


负责输出动作的 Actor 只能使用真实机器人能够获得的部分观测,训练阶段的 Critic 则可以访问仿真环境中的完整状态,为策略优化提供额外信息。解码器和 Critic 在部署到真机后都会被移除。


为了让动作更加自然,团队还引入了对抗运动先验 AMP。训练数据包括约 76 秒的人类全向行走动作和 30 秒脚弓射门动作数据。判别器负责判断机器人动作与人类示范的接近程度,强化学习策略继续围绕追球和进球优化。


镜像对称约束进一步帮助机器人掌握左右脚射门,避免收敛到单侧踢球。最终,找球、追球、调整落脚点和射门被放进同一个策略,控制器以 50Hz 输出关节位置指令。


登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

策略形成的五类动作模式,包括左右脚射门、直行和左右转向。彩色轨迹为策略生成动作,灰色点为人类参考动作。


训练过程中还涌现出不少自主行为


足球接近视野边缘时,机器人会主动转头和转身,把球重新移回视野。在球场边缘找不到足球,它通常先朝向场地中心,再扩大搜索范围。


步态也会随足球距离变化。距离较远时,机器人采用较慢的步频,每个步态周期约 0.7 至 0.8 秒,以维持稳定观察;接近足球后,周期缩短到 0.3 至 0.4 秒,通过更短、更快的步伐微调落脚点。


当球门位于身后,策略甚至会生成一种旋转钩射动作,机器人以支撑脚为轴转身,另一条腿从侧面将球勾向球门,省去重新站位的时间。


这些变化最终也反映在实验数据上


射门前一秒内,原始视觉观测中的足球位置误差为 0.344 米,经过策略内部状态估计后,误差降至 0.186 米,降幅约 46%。在仿真中,当视觉检测被短暂中断 0.3 秒时,机器人的触球成功率仍超过 90%,进球率超过 50%。面对静止足球,学习策略从启动到触球通常只需约 1.5 秒,传统规则系统需要约 2 至 5 秒,最高耗时降幅达到 64%。


登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

学习策略与当前 RoboCup 先进规则策略的对比。(A、B)机器人在不同接近角度下,从启动到触球所需的时间,以及这一过程中的最大角速度。机器人初始处于静止状态,距离足球 1.5 米。阴影区域表示标准差,每个方向测试 5 次。(C、D)规则策略控制机器人向前方(0°)和后方(180°)踢球时的典型动作。(E、F)学习策略可以将接近足球与射门连成一个连续动作。


真机测试中,机器人在前场位置的成功率达到 80% 至 90%,后场达到 60% 至 70%,测试过程中没有摔倒。面对滚动足球,当球速低于每秒 0.5 米时,策略仍能保持超过 50% 的成功率,真机实验也呈现出相似趋势。


登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

图注:面对滚动足球的反应式射门。(A)足球横向滚动时,机器人快速侧移并完成射门。其中,(i)展示机器人与足球的运动轨迹及对应的双脚触地模式,(ii)展示机器人的连续动作。(B)足球滚向机器人后方时,机器人快速转身并射门。(i)和(ii)展示的内容与(A)相同。(C)不同球速下的踢球成功率、进球率和触球用时。仿真结果以柱状图表示,每种球速测试 8192 次;真机结果以三角形标记表示,每种球速测试 10 次。误差棒表示仿真测试结果的标准差。


这套策略还作为运动技能模块进入清华火神队的完整比赛系统。2025 年,火神队获得 RoboCup 成人组人形联赛和世界人形机器人运动会冠军,两项赛事累计打进 76 球,仅失 11 球。2026 年,团队又在 RoboCup Large Size 比赛中成功卫冕。


走向下一代具身平台


学习策略能够从仿真直接部署到真机,算法只是其中一环。关节响应是否一致,控制周期是否稳定,传感器和计算单元能否按时输出结果,都会影响最终表现。任何底层误差,都可能在高速运动中被放大。


论文中的真机实验使用了加速进化的人形机器人平台。实验没有对本体进行专门改造,足球信息来自头部机载相机,感知与控制都在板载计算单元上运行。这说明,国产量产人形机器人已经可以承载世界前沿的具身智能研究,研究者能够把主要精力放在算法上,再将训练结果部署到真实硬件。


加速进化与火神队的关系,也由此从人才传承延伸到技术平台。


今年 7 月,加速进化发布新一代旗舰平台 Booster T2,专业版搭载 NVIDIA Thor 芯片,端侧算力达到 2070 TFLOPS,是目前双足人形机器人领域算力最领先的平台。配套的 Booster Studio 将仿真训练、算法开发和真机部署整合进同一个开发环境。


8 月 19 日,Booster T2 在世界机器人大会正式亮相,展示高爆发动作首秀。三天后,80 台 Booster T2 在机器人运动会开幕式上完成无中心自主协同,在大地书写 BEIJING、运动会会徽与三个赛项的图标,没有遥控,没有口令,80 个独立决策的「大脑」在同一时刻达成协同。80 台机器人的算力总和约达 17 万 TFLOPS,构成一个正在行走的算力集群。


单机感知闭环、多机协同变阵,背后依赖的是同一套底层能力:稳定的本体、实时的端侧计算、精准的运动控制。能力的边界,随着平台的迭代在持续扩展。


从 50 厘米高、需要人扶着才能站稳的早期机器人,到今天在千平球场上自主踢球、在开幕式上列阵书写的 Booster T2,二十二年的积累,正在以越来越大的规模呈现,人形机器人也由「会动」一步步走向「能用」,从单机行动到群体协作


参考链接:

https://www.science.org/journal/scirobotics


文章来自于"机器之心",作者 "杨文"。

1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

添加客服微信openai178,进AITNT官方交流群