【arXiv 2025】LIBERO-PRO:超越记忆化的鲁棒公平 VLA 评测基准|从VLA鲁棒评测视角 摘要本文解读 arXiv 2025 论文《LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization》。该论文提出LIBERO-PRO 即插即用评测基准通过融合物体属性、初始状态、指令、环境四维正交扰动与任务级组合扰动系统检验 VLA 模型是否真正理解任务其特别之处在于扰动任务保持逻辑自洽且物理可执行。实验表明标准 LIBERO 上成功率超过 90% 的 OpenVLA / Pi0 / Pi0.5在位置与任务扰动下崩塌到 0.0%证明高分主要源于训练布局记忆而非真实理解为具身智能 VLA 评测提供了更公平、可复现的标准。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQLIBERO-PRO 和原始 LIBERO 有什么不同为什么位置扰动会让模型成功率从 90% 以上跌到 0物体属性和语义指令扰动为什么几乎不掉分LIBERO-PRO 如何保证扰动后的任务仍然可执行新模型可以直接在 LIBERO-PRO 上报告成绩吗作者希望社区怎么做参考链接论文基本信息项目内容标题英文LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization标题中文超越记忆化的鲁棒公平 VLA 评测基准作者Xueyang Zhou, Yangming Xu, Guiyao Tie, Yongchao Chen, Guowen Zhang, Duanfeng Chu, Pan Zhou, Lichao Sun机构华中科技大学 · 清华大学 · 武汉理工大学 · 里海大学会议arXiv 2025arXivarXiv:2510.03827项目网站GitHub: Zxy-MLlab/LIBERO-PRO扰动数据集见 Hugging Face: zhouxueyang/LIBERO-Pro背景与动机LIBERONeurIPS 2023已经成为 VLA 评测的事实标准——几乎所有近期 VLA 论文OpenVLA、Pi0、Pi0.5、UniVLA 等都在其上报告成绩而 RLBench、CALVIN、RoboCasa、BridgeData 等机器人操作基准共同构成了这一领域的基础设施。但 LIBERO-PRO 的作者发现LIBERO 评测协议存在一个根本缺陷测试任务与训练任务几乎完全相同只差肉眼不可见的微小扰动——评测只能反映模型在训练邻域内的插值能力无法衡量分布外泛化这让记忆冒充了理解。从形式化角度看LIBERO 的测试任务 $\mathcal{T}$ 与训练任务 $\mathcal{T}$ 仅差初始物体位姿的微小扰动$R_0 \approx R_0$而指令、环境、物体与成功判据全部相同$ll,\ \mathcal{W}\mathcal{W},\ \mathcal{O}\mathcal{O},\ GG$。模型学的到底是 $\pi:(o,l)\to a$ 的真理解还是固定场景的轨迹记忆作者给出四类实证观察视觉幻觉——目标物体被替换或移除模型仍抓空气或抓错物体指令失效——指令换成乱码 fdsgfdsgsd模型执行同样的轨迹位置脆弱——物体位移超过 0.2 单位抓取成功率归零缺乏组合——两个子任务各自成功合成长指令必失败。在相关工作层面已有研究开始质疑 LIBERO 高分背后的泛化能力Exploring Limits of VLA、Intention-Execution Probing、Task Reconstruction 等指出 LIBERO 成绩不可迁移Safe-MultiTask、Adversarial VLA 等应激测试提出了更强评测但缺少系统化的多维扰动框架。LIBERO-PRO 的差异化定位是首个沿四正交维度加组合扰动系统化扩展 LIBERO 的即插即用基准且扰动任务保持逻辑自洽与物理可执行。从历史视角看附录 DVLA 评测走过了 2020–2022 年 RLBench / CALVIN 语言条件操作基准、2023 年 LIBERO 终身学习知识迁移基准、2024–2025 年 OpenVLA / Pi0 / Pi0.5 模型爆发报告 LIBERO 成绩 $$90\%到 2025 年 LIBERO-PRO 四维扰动评测戳破记忆化泡沫的完整脉络。评测即基础设施LIBERO-PRO 的即插即用扩展让后续 VLA 论文可直接报告其成绩扰动评测暴露的失败模式可指导数据增广与鲁棒训练规范效应推动社区放弃可被记忆刷分的评测协议。图 1五类动作解码范式的 VLA 模型LIBERO 上 70%LIBERO-PRO 上大幅下滑研究主线从问题到结论图 10LIBERO-PRO 研究主线问题 → 动机 → 设计 → 方法 → 实验 → 结论Mermaid 流程图基准/方法设计任务形式化将任务建模为三元组 $\mathcal{T}(l,e,G)$其中环境 $e(\mathcal{W},\mathcal{O},R_0)$ 由场景、物体集合与初始位姿构成扰动算子 $\phi_k$ 生成变体 $\mathcal{T}^{(k)}\phi_k(\mathcal{T})$。LIBERO-PRO 定义五类扰动物体属性扰动$kO$改变颜色 / 纹理 / 尺寸保持语义等价初始配置扰动$kR$改变绝对 / 相对位置保持物理可放置指令扰动$kL$语义改写保留意图任务级改写换目标环境扰动$kE$改变背景 / 光照 / 纹理不影响任务可行性任务扰动$kT$换目标物体 / 动作仍属训练分布内。组合规则任务级扰动不参与组合避免产生不可行任务其余扰动类型可自由组合构造多样化的联合分布偏移。图 2LIBERO-PRO 概览五类扰动物体 / 配置 / 指令 / 任务 / 环境与组合规则分类全景图 11LIBERO-PRO 扰动分类全景五类扰动算子及其变体Mermaid 结构树方法细节两类约束保证扰动有效性一是维度内邻域界——$x^{(k)}\in\mathcal{N}k(x)$ 且 $\mathrm{dist}_k(x,x^{(k)})\le\delta_k$扰动幅度受限任务保持逻辑自洽二是任务级分离——$d{TV}(\mathcal{T},\mathcal{T}^{(k)})\epsilon$用全变差距离确保扰动真的改变行为而非换汤不换药。强度扫描通过调节 $\delta_k$ 生成多个扰动档位刻画策略对扰动强度的敏感性曲线。评测基准构建物体变化包括颜色 / 纹理 / 尺度配置变化是保持物理有效的重摆指令变化是改写描述任务变化引入新物体集与新目标环境变化改变背景与光照。一句话概括扰动要够得着改变行为但不越界保持可执行——两个不等式把评测从玄学变成工程。实验设计与结果评测协议附录 E沿用 LIBERO 的每任务50 episodes协议保证结果可比模型为OpenVLA4 个官方 checkpoint每个套件单独训练、Pi0与Pi0.5各 1 个官方 checkpoint。公平性方面仅使用官方权重不做任何重新训练或微调扰动生成器公开支持单维与多维随机组合所有扰动任务均保证逻辑自洽语义上仍是指令所指的任务与物理可执行不产生不可达的初始状态代码、数据与项目主页全部开源。主表四套件libero-goal / libero-spatial / libero-10 / libero-object平均成功率模型Ori原始Pos位置Sem语义指令Task任务级Env环境OpenVLA0.970.000.970.000.68Pi00.920.000.910.000.39Pi0.50.970.210.960.010.53结论≈满分崩塌稳健崩塌分化原始设定平均 $$90\%最高 0.99位置扰动归零、任务扰动归零——模型根本没学会目标在哪和任务是什么。图 3LIBERO-PRO 主结果四套件 × 五类扰动的成功率黑底图结果分析位置敏感性方面位移超过0.2 单位后 OpenVLA 与 Pi0 成功率断崖归零Pi0.5 依赖更大模型与数据勉强撑到0.4 单位后同样归零环境扰动呈现分化——OpenVLA 平均 0.68 相对稳健但 object 套件仅 0.00Pi0 仅 0.39健壮也是选择性的物体属性与语义指令扰动几乎不掉分0.9但位置 / 任务一换就崩这是典型的illusory robustness虚假鲁棒性外观不变就背轨迹与四类失败模式一一对应。图 4位置扰动敏感性曲线位移超过 0.2 单位后成功率归零逐任务结果附录 Blibero-goal 摘要Ori / Pos / Task / Env 四列任务模型OriPosTaskEnvOpen(cabinet, drawer)OpenVLA0.980.000.000.96Open(cabinet, drawer)Pi00.920.000.000.00Open(cabinet, drawer)Pi0.50.960.000.040.92TurnOn(stove)OpenVLA1.000.000.001.00TurnOn(stove)Pi01.000.000.000.00TurnOn(stove)Pi0.51.000.000.000.00单任务满分Ori 0.921.00位置 / 任务扰动全零——每一行都是记忆的直接证据。定性失败案例附录 A / A / F四类系统性失败模式在量化结果之外给出了直观证据。视觉感知幻觉目标物体被换成无关物体沙拉酱 → 字母汤时模型仍按指令抓取错误物体目标物体被移除时模型对着原位抓空气不做在线视觉验证。图 5视觉幻觉 (a)训练集内的沙拉酱训练分布内物体图 6视觉幻觉 (b)物体不在训练集 / 被替换时模型仍执行抓取动作组合性失败子任务 1把碗放到炉子上成功、子任务 2打开炉子成功但组合指令把碗放到炉子上然后打开炉子持续失败——模型重放训练分布中的残缺轨迹无法组装子技能。原子技能的成功不等于组合推理能力。图 7任务扰动两个独立指令各自成功组合指令失败指令理解失效指令替换为乱码 fdsgfdsgsd 时模型照常执行原轨迹——语言输入几乎不参与决策动作由视觉场景回忆驱动。共同根源是策略依赖场景捷径典型布局、物体惯常位置、重复轨迹而非观测-指令对到动作的真实映射。图 8指令理解原始任务 Pick up the salad dressing and place it in the basket图 9指令理解换成乱码 fdsgfdsgsd模型仍执行几乎相同的抓取轨迹结果对比总结图 12LIBERO-PRO 结果对比标准评测 90% 的成绩在位置 / 任务扰动下崩塌Mermaid 流程图关键发现标准 LIBERO 大幅高估模型能力原始设定平均成功率 $$90\%最高 0.99但位置扰动与任务扰动下 OpenVLA / Pi0 全面崩塌至0.0%Pi0.5 也仅剩 0.21 与 0.01。0.2 单位位移阈值物体位置偏移超过 0.2 单位OpenVLA 与 Pi0 成功率断崖归零Pi0.5 撑到 0.4 单位后同样归零——位置敏感性曲线定量刻画了泛化极限。虚假鲁棒性物体属性与语义指令扰动几乎不掉分0.9环境扰动 OpenVLA 平均 0.68、Pi0 仅 0.39object 套件低至 0.00——健壮是选择性的外观不变就背轨迹。四类失败模式与量化结果一一对应视觉幻觉、指令失效、位置脆弱、缺乏组合性共同指向同一根源——策略依赖场景捷径而非任务理解。混淆隔离设计附录 C 的 Oral 信号分析四维正交扰动每次只隔离一个混淆变量配合 $$90\% 到 0.0\% 的反直觉崩塌证据与乱码指令照常执行的反例让记忆 vs 理解的贡献被干净地量化审稿人无法质疑你到底证明了什么。局限性资产范围受限扰动构建于 LIBERO 的物体与场景资产之上视觉外观多样性真实材质 / 光照仍有限。存量模型评测仅评测现有官方 checkpoint未训练抗扰动模型来验证基准的可学习性与上限。约束参数选择$\delta_k$ 与 $\epsilon$ 的取值依赖人工设定缺乏自动化校准流程。作者展望呼吁社区放弃可被记忆刷分的评测协议采纳 LIBERO-PRO 作为更公平、可复现的 VLA 评测标准并发展真正分布外泛化的模型。常见问题FAQLIBERO-PRO 和原始 LIBERO 有什么不同原始 LIBERO 的测试任务与训练任务几乎相同仅初始物体位姿有微小扰动模型可以靠记忆训练布局刷分LIBERO-PRO 沿物体属性、初始状态、指令、环境四维施加系统扰动并支持任务级扰动与组合扰动评测的是真实泛化能力而非记忆。为什么位置扰动会让模型成功率从 90% 以上跌到 0模型学到的是固定场景的轨迹记忆而非任务理解。物体位移超过 0.2 单位后训练分布内的抓取模式失效OpenVLA 与 Pi0 直接归零Pi0.5 也只能撑到 0.4 单位。物体属性和语义指令扰动为什么几乎不掉分这些扰动不改变物体的惯常位置与整体场景布局模型依然可以靠视觉场景回忆典型布局、惯常位置、重复轨迹完成任务——这正是表面稳健实为记忆illusory robustness的证据。LIBERO-PRO 如何保证扰动后的任务仍然可执行通过两类形式化约束维度内邻域界 $\mathrm{dist}k(x,x^{(k)})\le\delta_k$ 保证扰动幅度受限、逻辑自洽任务级分离 $d{TV}(\mathcal{T},\mathcal{T}^{(k)})\epsilon$ 保证扰动真的改变行为。所有扰动任务均保持语义自洽与物理可执行。新模型可以直接在 LIBERO-PRO 上报告成绩吗可以。LIBERO-PRO 是即插即用的扩展基准评测协议沿用 LIBERO 的每任务 50 episodes 标准扰动生成器与数据集全部开源任何新 VLA 模型都能即刻对照报数结果与原始 LIBERO 直接可比。作者希望社区怎么做放弃可被记忆刷分的评测协议采纳 LIBERO-PRO 作为更公平、可复现的 VLA 评测标准并把扰动评测暴露的失败模式转化为数据增广与鲁棒训练的信号发展真正分布外泛化的模型。参考链接arXiv:2510.03827 — LIBERO-PRO 论文原文GitHub 项目主页Zxy-MLlab/LIBERO-PRO代码与扰动生成器Hugging Face 扰动数据集zhouxueyang/LIBERO-ProLIBERO: Benchmarking Knowledge Transfer for Lifelong Robot LearningNeurIPS 2023OpenVLA: An Open-Source Vision-Language-Action ModelCoRL 2024Pi0: A Vision-Language-Action Flow Model for General Robot ControlarXiv 2410.24164CALVIN: A Benchmark for Language-Conditioned Policy LearningarXiv 2112.03227World Model for Robot Learning surveyarXiv 2605.00080给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件