尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
opd02
第二章 RLinf + OpenVLA-OFT 中 OPD 的完整源码机制:Action Token、Teacher Rescoring 与三个 LogProb1. RLinf 当前 OPD Recipe 的基本结构1.1 官方示例RLinf 当前 OPD 文档提供的是:Environment:LIBERO-Spatial;Student:OpenVLA-OFT;Teacher:OpenVLA-OFT;Hardware:1 node × 8 GPUs;Algorithm:OPD。最核心的一句话是:Student 是唯一与环境交互的策略;Teacher 不在 rollout 时生成动作,而是在 rollout 之后,对 Student 已保存的forward_inputs.action_tokens计算 dense token-level log probability。这一点必须牢牢记住。很多后面的源码问题,都可以从这句话推出来。2. 原论文 OPD 与 RLinf Recipe 不能完全混为一谈VLA-OPD 原论文实验 Teacher 是 SimpleVLA-RL 等 expert policy,Student 使用 OpenVLA-OFT initialization;论文 LIBERO 主实验使用 batch size 64、group size 8。RLinf 当前示例则使用:Student checkpoint:RLinf/RLinf-OpenVLAOFT-LIBERO-130-Base-LoraTeacher checkpoint:RLinf/RLinf-OpenVLAOFT-LIBERO-130并要求二者使用同一个:libero_130_no_noops_trajall作为unnorm_key。所以应该区分:原论文:证明算法思想。RLinf:提供一套具体工程实现。3. OpenVLA-OFT 的 Action 到底是不是离散 Token3.1 不能简单说“OpenVLA-OFT 就是离散动作模型”OpenVLA-OFT 原论文实际上强调 continuous action representation、parallel decoding 和 L1 regression。citeturn975741academia80所以不能泛化成:所有 OpenVLA-OFT 都只使用离散 action token。3.2 但 RLinf 当前 OPD 路径确实使用 Action Token Probability在 RLinf 当前 OPD/RL interface 中,OpenVLA-OFT 会输出:Z∈RB×Naction×VZ\in\mathbb R^{B\times N_{action}\times V}Z∈RB×Naction​×V其中:BBB:batch size;NactionN_{action}Naction​:action token positions;VVV:vocabulary size。然后对每个 action position 进行 categorical sampling。源码直接使用:torch.multinomial。turn110452view3所以:RLinf当前OPD概率空间中的Action是离散Token\boxed{\text{RLinf 当前 OPD 概率空间中的 Action 是离散 Token}}RLinf当前OPD概率空间中的Action是离散Token​4. 为什么环境最终执行的却还是连续动作Action Token 只是概率建模表示。例如 Student 采到:yj=31980y_j=31980yj​=31980这个数字不是机械臂真实控制值。源码随后把 token 映射到 action bin,再映射到 normalized continuous value,最后根据 dataset statistics 反归一化。可以理解为:阶段 2:Token 到连续动作阶段 1:离散动作采样阶段 0:模型输出数据模块:Action-Slot LogitsShape: [B, N_action, V]随机模块:Categorical Action Sampling数据模块:Action Token IDsShape: [B, N_action]操作模块:Token-to-Bin Mapping数据模块:Discretized Action Bin操作模块:Bin-Center Lookup数据模块:Normalized Continuous Action
RELATED

相关推荐

Modbus RTU调试总失败?用串口工具抓包,五分钟定位问题

Modbus RTU调试总失败?用串口工具抓包,五分钟定位问题

在CSDN上搜“Modbus调试”,能看到大量求助帖。通信不通、数据不对、时好时坏——问题描述五花八门,但真正有效的排查手段只有一个:抓包看数据。不看数据包就猜问题,等于闭着眼睛修车。这篇文章以Modbus RTU为例,说清楚…

📅 2026/9/30 18:05:35
Redis缓存穿透与击穿实战:从CacheClient工具类设计到面试应答

Redis缓存穿透与击穿实战:从CacheClient工具类设计到面试应答

做后端项目,尤其是把黑马点评这种完整商城项目放进简历的同学,大概率都在 Redis 缓存上栽过跟头。缓存穿透、缓存击穿这两个词,面试官几乎必问,理论背得再熟,落到代码层面很多人是懵的。真正把这两个问题落地解决的&am…

📅 2026/9/30 18:00:34
N.E.K.O.Agent智能体实战:配置Computer Use与Browser Use,让AI猫娘帮你操作电脑和浏览器

N.E.K.O.Agent智能体实战:配置Computer Use与Browser Use,让AI猫娘帮你操作电脑和浏览器

N.E.K.O.Agent智能体实战:配置Computer Use与Browser Use,让AI猫娘帮你操作电脑和浏览器 【免费下载链接】N.E.K.O A catgirl who lives with you in real time — reaching out first, sharing your media, and actually getting things done, powered …

📅 2026/9/30 18:00:34
MORE NEWS

更多资讯

📰

本地AI代理助手如何落地?两级流水线:硬规则前置与模型兜底

本地AI代理助手这个方向,我是从一个小项目开始踩坑的:用Python写脚本,调本地大模型自动整理硬盘里的文档。最初想法很直接——本地跑一个大模型,把所有文件丢给它,让它分类、重命名、提取摘要,测了两天发现…

📰

ComfyUI+PS工作流实战:从可控生成到商业级AI绘画交付

1. 为什么我把 AI 绘画从"在线出图"搬到了 ComfyUI PS 的组合上 先交代一下背景。我接触 AI 绘画的时间不算早,最开始和大家一样,用的是各种在线出图工具和封装好的网页端。说实话,那阵子确实挺兴奋的,输入一段提示词就…

📰

HCL模拟器实操核验:20个H3CNE核心实验通关指南

简介:本资源是一份面向H3CNE认证备考者与网络工程师的系统性实验指导手册,覆盖从基础协议分析到高级路由交换的完整技能链。全书共20章,涵盖IP/TCP抓包分析、Telnet与H3C设备管理、VLAN/Trunk/STP/链路聚合等二层技术,以及DHCP中继…

📰

Java并发编程面试高频考点:线程池、锁与AQS原理全解析

上周有位准备跳槽的朋友找我聊天,说他背了两周的Java面试题,结果被一个“线程池参数”问得说不出话。我问他怎么准备的,他说就是照着网上的八股文背,背完就忘,一追问就露馅。Java并发编程面试题这块,恰恰是…

📰

MCP的stdio和sse的区别:TaoToken统一Key下两种传输方式怎么选

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

WorkBuddy 深度解析:Agent 调度、Skill 开发与 models.json 配置实战

1. 先搞清楚 WorkBuddy 到底是个什么东西1.1 它和普通聊天机器人的本质区别很多人第一次打开 WorkBuddy 的界面,会觉得“这不就是个对话框吗,跟其他 AI 聊天工具有什么不一样”。我一开始也这么想,用了两天之后才发现,把它当聊天机…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬