小米机器人造出“全能选手“:靠真实操作录像教会做任何家务 这项由小米机器人团队完成的研究以预印本形式发布于2026年7月16日论文编号为arXiv:2607.15330有兴趣深入了解的读者可通过该编号查询完整论文。如果你家里有一个机器人你最希望它能做什么叠衣服、收拾书包、把散落在沙发上的玩具整理进收纳箱这些听起来平常的事情对机器人来说其实极其困难——不是因为机器人力气不够而是因为它根本不知道面对一个从未见过的房间、一件从未碰过的物品时手该怎么动。小米机器人团队花了大量时间和精力试图彻底解决这个问题。他们构建了一个名为Xiaomi-Robotics-1的系统而这个系统背后的核心秘密是超过10万小时的真实人类操作录像。要理解这件事的分量可以换个角度思考10万小时相当于一个人不睡觉地连续工作超过11年。这些录像记录的不是在实验室里精心布置的场景而是在家庭、餐厅、办公室、工厂、户外等各种真实环境里人拿着特制的手持抓夹装置一种叫做UMI的工具像手套一样让人在操作物体时自动记录手的动作完成各种任务的过程。这套数据集涵盖超过1700个不同场所、240万个操作片段、260种以上的任务类型是目前机器人领域规模最大的真实操作数据集之一。一、为什么机器人学不会随机应变要搞清楚Xiaomi-Robotics-1解决了什么问题先得理解机器人为什么那么难教。教一个小孩叠衣服你只需要示范几次孩子就能举一反三——今天叠蓝色T恤明天换成红色毛衣他照样能做。但机器人不行。传统的机器人培训方式就像给一个人死记硬背菜谱告诉它在哪个位置抓、往哪个方向移动、放到什么高度只要场景稍微变化整套动作就全部失效。这背后的核心矛盾是收集机器人训练数据既贵又慢。让机器人真正在现场操作来录制数据需要真实的机器人硬件、需要人在旁边操作遥控器、需要反复调试、还需要大量重复试验。更糟糕的是这样收集来的数据高度重复总是同一套任务、同一批场景机器人学到的经验非常狭窄。小米团队的突破在于换了一个思路既然机器人的手不好用那就先用人的手来收集数据。UMI装置让普通人手持操作就能生成高质量的动作数据不需要真正的机器人在场。这个方法让数据收集的效率提升了数倍也让数据的多样性彻底爆发。二、从录像到理解给每段视频打上说明书收集了10万小时的操作录像之后下一个难题是机器人看这些录像能学到什么单纯让机器人看录像模仿就像把一个完全不认识字的人扔进图书馆他能看到每一页纸却根本不知道上面写的是什么意思。机器人需要的不只是动作画面还需要理解这段动作在做什么。传统做法是让人工来给每段录像写说明这段视频里人把红色的盒子从桌上拿起来放进了背包。但面对10万小时的录像这种人工标注完全不可行——如果每小时标注需要1小时那就需要10万小时的人力差不多等于50个人不休息地工作整整一年。小米团队开发了一套自动打标签的流水线。他们首先把每段录像切割成固定长度的小片段然后用一个已经很懂图像和语言的大模型Qwen3.5-27B一个能看图说话的AI来自动描述每个片段里发生了什么状态变化——不是简单地说手在动而是具体描述一只手抓着一块白布正在擦拭桌面或者两只手把一条黄色毛巾对折收叠起来。为了让这套流水线能以足够快的速度运转工程师们设计了一个生产-消费并行架构一组处理器专门负责把录像切成小片段存到内存里另一组同时把这些片段送给AI打标签两组互不干扰、同时工作。凭借这套设计整整10万小时的录像只用了大约两周时间就完成了全部标注。有了这些语言描述机器人在训练时就不再只是机械地模仿手的动作而是学习当我收到某种语言描述的目标时应该产生什么样的动作序列使场景从当前状态变成目标状态。这是一个质的飞跃机器人开始学会把语言和动作联系起来。三、两阶段培训先博览群书再专项训练Xiaomi-Robotics-1的训练分为两个明确的阶段两者之间的关系就像培养一个厨师的过程。第一阶段叫做预训练。在这个阶段机器人并不急着学怎么用机器臂而是先靠着那10万小时的UMI录像广泛吸收各种场景下的操作经验。预训练的目标是让模型形成一种通用操作感知——知道在各种情况下手或者类似手的工具应该怎么动才能让物体从一个状态变化到另一个状态。这就像一个未来的厨师先在全球各地旅行品尝各种菜肴了解食材的特性而不是急着拿起锅铲。第二阶段叫做后训练。这时候团队拿出了另一批数据超过1万小时的真实机器人操作录像。其中包括他们自己收集的超过7200小时的移动机械臂和双臂机器人数据覆盖多种家庭场景超过1000小时的UMI数据但这批数据配的是人类日常说话时会用的指令比如把黄色运动鞋放到鞋架上而不是状态描述此外还有来自开源社区的Bridge V2、RT-1、DROID等数据集。后训练的目标是让模型完成两个适配一是把在UMI手持夹上学到的操作技能迁移到真正的机器人手臂上二是把在状态描述语言下学到的能力对接到人类平时对机器人说话时用的那种命令式语言。这两个适配都非常重要——没有第一个机器人手臂不会动没有第二个你对机器人说帮我把书包收拾好它根本听不懂。在后训练中团队还用Qwen3.5模型对人工切割的视频片段重新标注指令语言确保这批数据里的语言风格和真实人类与机器人对话时保持一致。同时他们过滤掉了所有静止片段——就是那些机器人什么都没做、只是待着不动的部分避免模型学到不动这个无效行为。四、大脑的构造两个专家组成的团队Xiaomi-Robotics-1的内部结构也颇有设计感。它采用了一种叫做混合变换器Mixture-of-Transformers的架构可以理解为由两个功能不同的专家模块合作完成任务。第一个模块是视觉语言模型基于Qwen3-VL构建。它的工作是接收摄像头拍到的当前画面和操作人员给出的语言指令然后理解现在是什么情况要做什么。除了理解这些信息它还会直接预测一批候选的动作方案——但这些方案更像是草稿而不是最终决策。第二个模块是扩散变换器DiT专门负责生成最终的动作序列。它接收视觉语言模型处理过的信息缓存加上机器人当前的关节状态然后通过一种叫做流匹配的技术从一片随机噪声出发逐步生成精确的动作序列。这个过程就像雕刻家从一块毛坯大理石开始一刀一刀削掉多余的部分最终呈现出精准的雕塑。具体来说推理时只需要5步迭代就能完成这个雕刻过程。两个模块之间有一个细节处理值得关注视觉语言模型生成的那些候选动作方案被特意屏蔽在扩散变换器的注意力范围之外。团队发现如果让扩散变换器看到这些草稿它会偷懒——直接复制视觉语言模型的结论而不去认真地从视觉和语言信息中自己推导动作。这个防止偷懒的设计让最终的动作质量明显提升。模型一共有三个尺寸2B版本参数总量约26亿5B版本约51亿10B版本约105亿。不同尺寸分别对应不同的计算资源需求和性能水平可以根据实际硬件条件选择。五、越大越好数据和模型规模带来的提升研究团队用一系列严格的实验验证了Xiaomi-Robotics-1在规模上是否真的越大越好。在数据规模方面他们用5B版本的模型分别在12.5%、25%、50%和100%的约2万小时UMI数据上训练然后在同一批留出的测试数据上评估动作预测的准确度用均方误差衡量数字越小越好。结果非常清晰随着数据量的增加预测误差单调下降。特别是当数据只有12.5%和25%时模型的误差曲线会先下降后上升——这是典型的过拟合现象意思是数据太少模型把那点数据记得太死到新场景就不灵了。而当数据达到50%和100%时误差曲线全程下降且100%数据的下降速度更快说明模型还没有吃饱继续加数据仍然能持续提升。在模型规模方面他们把2B、5B和10B三个版本都在同一批2万小时数据上训练结果同样是规模越大、误差越小。不过一个有趣的现象是三个尺寸之间的差距比数据规模之间的差距要小。这说明在现阶段数据量是更重要的瓶颈——模型已经足够大但数据还不够多。更关键的发现是预训练阶段的规模效益会直接传导到后训练阶段的实际表现。团队测试了一个极具挑战性的指标在从未见过的新环境里机器人不经过任何额外练习直接完成任务即开箱即用的成功率。结果显示用100%预训练数据初始化的模型开箱即用成功率达到75%而没有经过任何UMI预训练、直接从Qwen3-VL权重开始的模型成功率只有26%。仅仅用12.5%的预训练数据成功率就直接翻倍到53%。在模型规模上10B版本的开箱即用成功率达到79%显著优于5B的75%和2B的61%。六、四个任务的真机测试团队设计了四个贴近真实家庭场景的任务用来在真实机器人上测试开箱即用能力而且测试环境和训练环境完全不同——不仅房间不一样就连具体的物品也是从没见过的新款。第一个是鞋子整理。机器人需要把一双黄色运动鞋拿起来放到鞋架的指定位置。这个任务看似简单但鞋子形状不规则、质地特殊抓握需要相当精确的力度控制。第二个是背包收拾。这个任务分成多个步骤先拉开拉链然后把一个小汽车模型放进去再把一个红色罐头放进去再放一个蓝色小包最后把拉链拉上。这是一个多步骤、需要记住顺序的任务。第三个是桌面整理。机器人需要把桌上的几件零散物品太阳镜、牙膏、黄色固体胶、一个苹果分别放到指定的容器和位置同时还要遵从具体的语言指令比如把苹果放到木质托盘上。第四个是沙发整理。机器人需要把沙发上的红色毛绒玩具、小玩具车、白色衣物、黑色裤子分别放到收纳箱并把一个靠垫放正。在10B模型的开箱即用测试中鞋子整理的成功率高达92%背包收拾和桌面整理分别为75%和89%沙发整理为77%。这些数字放在当前的机器人研究中属于相当高的水准特别是考虑到测试环境和物品完全是模型从未见过的。七、用极少的数据快速学会新任务开箱即用能力验证了模型的通用性但机器人还需要一个重要能力用少量数据快速适应全新的、更复杂的任务。团队设计了四个全新的、在整个训练数据集中从未出现过的任务用来测试这种适应能力。第一个是手机装箱。机器人需要用双手配合把手机放进箱子再把说明书放进去然后盖上盖子。这个任务需要两只手的精细协调难度较高。第二个是衣物入洗衣机。这是一个移动操作任务分为五步打开洗衣机门、把装有衣物的篮子移到洗衣机门口、把衣服从篮子转移到洗衣机里、拿走篮子、关上洗衣机门。整个流程跨越较大空间需要多步骤记忆和执行。第三个是打印机加纸。机器人需要抓取一叠纸把它递给另一只手双手交接然后把纸的一端塞进打印机纸盒再把整叠纸完全推入最后把两只手臂归位。纸张是高度柔软易变形的材料操控难度极大。第四个是箱子收纳。机器人需要根据语言指令把桌上的多个指定物品依次放进箱子考验的是语言理解和物品识别能力。测试分两种数据量低数据设定每个任务平均不到10小时的训练数据高数据设定总计144小时。对比的基准是两个同类顶级系统π0.5Physical Intelligence公司开发和Xiaomi-Robotics-0小米上一代系统。在低数据设定下Xiaomi-Robotics-1的平均成功率达到75%远超π0.5的40%高数据设定下这个优势进一步拉大平均成功率达到85%。在打印机加纸这个最难的任务上Xiaomi-Robotics-1在低数据设定下成功率达到70%而最好的对比方法只有20%——差距是3.5倍。在衣物入洗衣机任务上π0.5因为经常卡在打开洗衣机门这一步而失败Xiaomi-Robotics-0在低数据设定下根本无法完成全流程而Xiaomi-Robotics-1在低数据设定下就达到了80%的成功率和96%的进度得分进度得分衡量的是虽然没完成但做到了哪一步。八、四大模拟基准测试的全面领先除了真机测试团队还在四个权威的模拟测试平台上进行了评估与当前最顶尖的系统进行了横向比较。RoboCasa是一个模拟厨房环境的基准包含24种日常厨房任务测试时使用的是训练中从未出现过的物品款式和部分全新的厨房风格。Xiaomi-Robotics-1在这个基准上的平均成功率达到74.5%超过了之前最好的World2Act系统72.6%也超过了NVIDIA的GR00T N1.666.2%。RoboCasa365是RoboCasa的升级版把任务数量从24种扩展到365种场景超过2500个物品超过3200种还特别设计了从未见过的复合任务评测——也就是把模型以前学过的简单技能组合成新的复杂任务考验真正的泛化能力。Xiaomi-Robotics-1在总平均成功率上达到57.4%比之前最好的ABot-M0.6系统46.6%高出了10.8个百分点。在最难的未见复合任务分项上Xiaomi-Robotics-1达到32.1%而ABot-M0.6只有7.9%——差距接近4倍说明Xiaomi-Robotics-1具备了将已学技能灵活重组的能力。VLABench是一个更加注重语言理解和泛化的基准包含100种任务类别和超过2000个物品特别设计了多种分布偏移测试指令中包含隐含的人类意图、跨类别物品迁移、常识推理、以及材质和外观的变化。在这个基准上Xiaomi-Robotics-1的平均成功率达到59.1%明显超过ERVLA53.2%和π0.548.1%。特别值得一提的是材质变化测试也就是相同物品换了颜色或纹理后机器人还认不认得——Xiaomi-Robotics-1的成功率达到62.6%比最好的对比方法高出15.2个百分点展现了极强的视觉鲁棒性。RoboDojo是目前最全面的综合评测基准之一包含超过42种模拟任务覆盖五个维度泛化能力换物品换场景还能做吗、精度精细操控、长时序多步连续操作、记忆需要记住之前状态、开放理解开放性语言指令。Xiaomi-Robotics-1的总平均得分为20.07而之前最好的Hy-Embodied-0.5-VLA只有13.07平均成功率为13.93%而前者为8.80%。在五个维度中Xiaomi-Robotics-1在泛化、精度、长时序、开放四个维度均排名第一只有记忆维度略低于Hy-Embodied-0.5-VLA——因为后者专门在设计上加入了历史观测记忆机制而Xiaomi-Robotics-1在RoboDojo测试中完全没有使用历史观测信息。说到底Xiaomi-Robotics-1这个系统的意义不仅仅在于它在各种测试上拿了第一。更深远的价值在于它系统地验证了一件之前在机器人领域存在很大不确定性的事情规模真的有效。在大语言模型领域大家已经接受了数据越多、模型越大、性能越好的规律但在机器人领域因为数据收集太难这个规律一直没有被充分验证。小米团队的这项工作用10万小时的数据和从2B到10B的模型对比实验给出了一个相对清晰的答案机器人也遵循同样的规律而且预训练阶段的规模效益会直接传递到真实机器人的实际操控表现。这对整个行业的启示在于收集真实、多样、大规模的操作数据可能是机器人走向通用化最值得投入的方向之一而不是不断设计更聪明的算法来弥补数据的不足。当然这项研究也存在一些尚未解决的问题在记忆型任务上的短板、在完全开放式指令下的表现仍有提升空间而且目前的测试主要集中在家庭室内场景户外或工业场景的表现还有待进一步验证。对于普通人来说这项研究可能距离你家里真正出现一个能帮你叠衣服、收拾书包的机器人还有相当一段距离。但它让这个距离变得更短了一些也让这件事变得更加可期。有兴趣深入了解的读者可以通过arXiv:2607.15330查阅完整论文小米团队也承诺会开放代码和模型权重。QAQ1Xiaomi-Robotics-1和普通机器人有什么不同A普通机器人通常只会在特定环境执行固定任务换个场景就失灵了。Xiaomi-Robotics-1经过10万小时真实操作数据训练能在从未见过的新环境里直接完成任务还能用极少数据快速学会全新任务灵活性远超传统方案。Q2UMI装置是什么为什么用它来收集数据AUMI是一种手持抓夹装置人拿着它操作物体时装置会自动记录手的动作轨迹。它的优势是不需要真正的机器人在场普通人就能在家、在餐厅、在户外随时随地收集数据成本低、场景多样、可大规模部署解决了机器人数据收集既贵又慢的核心难题。Q3Xiaomi-Robotics-1目前能在真实家庭里用吗A目前还处于研究阶段还不是可以直接买到家里用的消费级产品。但真机测试显示它在鞋子整理、桌面整理等家庭任务上成功率已达75%到92%研究团队也计划开放代码和模型未来商业化落地的路径正在逐步清晰。