
中国机器人的AstraTennis时刻中国机器人的AstraTennis时刻来了。8月22日第二届世界人形机器人运动会开幕中央广播电视总台面向全球直播。当镜头扫过赛场全场的呼吸仿佛都停滞了。球网两侧一边是人类网球名将另一边是一台人形机器人。这一刻标志着中国技术创新迎来足以载入史册的具身智能奇点。全球第一场真正意义上的人机网球对战正式开打世界首次人机对战网球赛一上来就是精彩的人机混合网球双打。令人意外的是银河星仔的表现非常精彩它步法矫健根据需要迅速前后移动打得十分流畅。而且星仔和人类搭档非常默契地形成了一前一后的站位全力应战对面的对手。接下来由网球名将郑洁和银河通用机器人开展了全世界第一次人机对战的网球单打比赛。无论是正拍还是反拍机器人都和人类打得有来有回。然后郑洁决定上点难度打出一个月亮球。结果在被对手左右调动的过程中机器人不小心摔了个四脚到底。出乎意料的是下一秒它居然立刻调整姿势站了起来。而面对郑洁的切削和旋转机器人的判断居然也很不错。终于郑洁知道不能放水了开始左右前后分点调动机器人出人意料地完成一个精彩的跨步赢得现场喝彩。比赛结束机器人的表现让所有人欢呼。整场比赛里屈膝、抛球、转体这些动作全都由人形机器人自己完成。而且发球时速达到一百多公里留给它的反应时间只有零点几秒它却几乎没有掉链子。这台机器人正是来自银河通用。十年前AlphaGo赢了李世石。十年后国产机器人与网坛顶尖运动员同台竞技。如果说AlphaGo证明AI能征服数字世界那么今天银河通用的国产机器人证明AI能扛住物理世界的极限压力测试。它第一次从代码里站了起来在真实的对抗中奔跑、挥拍、博弈甚至摔倒后自己爬起继续战斗。如此精彩的具身智能AstraTennis时刻被全球同时见证中国机器人的AstraTennis时刻为什么这场网球赛能引起全球科技圈的巨大地震因为网球是对具身智能极致的压力测试。由于反应时间只有零点几秒这项运动同时将机器人的感知、决策、全身运动控制和实时博弈能力逼到了物理极限。而且打网球比下围棋对AI来说难得多。毕竟AlphaGo面对的是19路网格上361个确定的交叉点对手落子后它有几十秒甚至几分钟来推演下一步。那是数字世界的博弈解空间虽大但边界清晰规则恒定。整个世界是静态的、离散的AI对此一览无余。虽然这道题的解空间比宇宙原子数还多但对AI而言这也不过是道难度更大的「数学题」。但网球场不一样。球以每小时一百多公里的速度过来落点受旋转、风、场地摩擦影响每一拍的物理参数都不重复。机器人必须在几百毫秒内完成感知、预测、决策、全身协调同时保持自己不摔倒。对手是打活人会骗机器人还会变节奏。这就是莫拉维克悖论的现场版。1988年卡内基—梅隆大学移动机器人实验室主任汉斯·莫拉维克就指出过「让计算机在智力测验或下跳棋时表现出成人水平的表现相对容易但要赋予它们一岁儿童在感知和行动方面的技能则困难甚至不可能。」三十多年过去前半句早已兑现但后半句却很难实现。所以这次网球赛真正的意义要远远大于「机器人会不会打球」。它问的是这一次AI究竟能不能从数字世界走出来把感知、决策、运动控制和实时博弈在真实物理环境里闭环跑通AI不能止步于思考而是要完成从认知决策到全身执行的完整闭环。这一次中国企业率先交卷了赛场上银河通用机器人的表现实在令人惊艳。发球、正手、反手、底线调动、网前截击这些单项能力在比赛里全部出现了而且全都是超常发挥。而双打考验就更大了。机器人和人类队友同场要实时判断谁去接这个球、谁补位动态调整打法和。所以它要理解的不只是球还有队友下一步想干什么。高速攻防里还出现了极限救球的场面。摔倒之后机器人自己站起来继续打。很多人第一反应是这些单项动作之前机器人不是做到了吗投篮、踢球、跑百米过去两年人形机器人的视频里似乎什么都有。但其中最大的差别在于网球是两个玩家在对抗。跑步的环境是确定的网球的每一拍都是对手临时出的新题。跑步可以一个动作练一万遍网球没有两个完全一样的来球。能在对抗中站住才是真正的智能。大脑和小脑第一次装在同一个模型里背后支撑这一切的是银河通用自研的具身智能大模型「银河星脑」AstraBrain。它最大的亮点之一就在于架构选择。过去行业里的主流做法是分层一个「大脑」模型负责理解任务、做高层决策一个「小脑」模块负责实时运动控制两者之间用接口传递指令。这种架构的弊端也很直接大脑想得再清楚传到小脑已经慢了半拍小脑动作再标准不知道大脑为什么要它这么动。更隐蔽的问题是信息断层。大脑下指令的时候不知道此刻自己的重心压在哪条腿上、右臂还有多少发力余量小脑执行动作的时候不知道这一拍是想调动对手还是想直接得分。两边各自最优合起来却是一个「想得到做不到」或者「做得到想不到」的系统。在打网球这种任务上稍微慢半拍结果就是输球。银河星脑的做法是把大脑层任务理解与战术决策、小脑层高动态全身运动控制和神经控制集成在同一个模型里。按银河通用的说法这是全球首个模型能同时负责「想清楚」和「做出来」中间不再有信息损耗。从网球这个任务倒推这可能是唯一的解法。战术决策离不开对自己身体极限的实时感知运动控制也离不开对战术意图的理解两者本来就不该分家。从不完美的人类数据里学在虚拟球场里对打一千万次架构之外的另一个问题是这个模型怎么练出来的机器人领域的一个传统难题就是——没有数据。语言模型可以吃掉整个互联网的文本机器人没有这样的互联网。真机采一小时动作数据要一小时还要人盯着还会摔坏硬件。这也是为什么过去几年具身智能的进展总是慢于大家的预期。这背后离不开银河通用核心技术平台「银河星坊」 的支撑。接下来分两个步骤。第一步是从「不完美人类数据」里学。人类打网球的动作数据可以采动作捕捉、视频、穿戴传感器都行。但人类的动作本身不标准业余选手的确很业余有多余动作。而职业选手的动作最大化个人运动素质别人做不来而且每个人的身高臂展关节角度都跟机器人对不上。传统模仿学习要求示范数据干净、对齐、高质量这种要求在人类数据上几乎不可能满足。银河星坊数据平台要做的就是从这堆带噪声、不对齐、良莠不齐的示范里提炼出有用的先验什么时候该启动挥拍的大致节奏身体重心怎么转移真正学会其中的运动规律。这一步的价值在于冷启动。机器人不用从随机乱动开始摸索它一上来就大概知道「打网球长什么样」。第二部就是进虚拟网球世界。在仿真环境里多个智能体互相对打。不是一个机器人对着发球机练而是若干个策略各自演化、互为对手。一方学会了压边线另一方就被迫学会横向大范围移动一方学会了放小球另一方就被迫学会快速上网。在这海量的虚拟博弈中奇迹发生了——「技能涌现」。工程师没有教过它怎么滑步救球但在无数次没接到球的失败后模型自己「领悟」了极限伸展的姿态。工程师没有写下倒地后起身的硬代码但在虚拟世界摔了千万次后模型自己「学会」了如何调动全身电机重新站立。技能无需手工设计出在对抗压力下AI学会自学。最后当这些在虚拟世界中练就神功的「灵魂」被无损迁移到物理世界的真实机器人躯体中时一个网球大师就此诞生放在整个机器学习的谱系里这条路走在两个极端中间。纯模仿学习的天花板是示范者的水平人类教练教不出超过自己的学生而且人类示范里根本没有「摔倒后怎么爬起来继续打」这种数据。纯强化学习从零开始探索在网球这种动作空间巨大、奖励稀疏的任务上搜索成本高到不现实而且容易学出一些人类完全看不懂的怪异动作能赢球但不像打球。先用人类先验打底再用自主进化拔高。这本身不算新AlphaGo当年也是先学人类棋谱再自我对弈。新的地方在于十年前这套方法在棋盘上跑通十年后它第一次在需要身体的任务上跑通。某种意义上这正是AstraTennis与AlphaGo之间最迷人的技术呼应。AlphaGo的时代智能在棋盘上思考而这一次智能开始进入物理世界。这绝不仅是一场网球赛。这个AstraTennis时刻证明在碳基与硅基共生的新纪元里中国力量开始创造更多奇迹。原文链接刚刚全球首场人机网球赛开战机器人极限救球让郑洁看呆了-36氪