尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
OPSD 让模型拿标准答案教自己,在学生自己的推理路径上逐 token 纠错
一次 Qwen3-1.7B 训练里GRPO 每题采 8 条轨迹单条上限 16,000 tokenOPSD 只采 1 条上限 1,024 token。前者生成得更多却在前 100 步中有超过一半批次的组内奖励标准差为 0拿不到梯度。如果只看采样预算GRPO 像是投入更足的一方。问题出在奖励结构同组回答要么全对要么全错时每条回答的相对优势都归零。8 条长轨迹已经生成策略却没有可用的更新方向。最终分数把这笔浪费照得更清楚。在三项竞赛数学基准的平均分上Qwen3-1.7B 的 GRPO 峰值是 37.7OPSD 达到 43.4。前者从 500 个训练步骤内选峰值后者只评估到第 100 步。OPSD 的研究问题很具体既然推理数据里已有标准解答能不能让同一个模型一边作答一边借助答案检查自己的每一步教师无需更大只需多看一份学生在推理时拿不到的信息。GRPO 只知道整题对错SFT 又把模型教得更短基于可验证奖励的强化学习很适合数学题。答案容易判定奖励也干净。可它通常只在整条序列结束时给出 0 或 1同一回答中的所有 token 共用一个优势值。模型知道这题错了却不知道错误从哪一步开始。GRPO 还依赖组内差异。只要一组回答奖励相同标准差就是 0梯度信号随之消失。论文在 OpenThoughts 数学子集上观察到这类批次并不少见。直接把标准解答拿来做 SFT 也不稳。训练时模型沿专家轨迹前进推理时却要处理自己生成的前缀两个分布并不一致。更麻烦的是这批参考解答偏简洁。三个 Qwen3 规模在同一数据上做 SFT 后三项基准平均分都低于基础模型测试时的推理长度也缩短了。传统在线策略蒸馏能避开这两个问题轨迹由学生自己生成教师在轨迹上提供逐 token 分布。但通常还要准备一个独立、往往更大的教师模型。OPSD 改掉了这项依赖。同一个模型分成两种上下文标准答案只给教师看OPSD 没有复制出两个不同的模型。学生策略和教师策略共享参数区别只在输入上下文教师策略以问题和参考解答为条件学生策略只以问题为条件二者由同一个参数化语言模型实例化。式中x表示问题y⋆ 表示对应的参考解答其中可以包含思维链θ表示共享语言模型的参数。下标T与S分别标记教师策略和学生策略。占位符 · 表示完整的词表随机变量因此两式给出的是下一 token 条件概率分布而非某一个 token 的概率条件符号 ∣ 右侧列出已知上下文定义等号 ≜ 表示左侧策略由右侧分布定义。第一式定义教师策略它以特权信息为条件同时接收问题和参考解答。第二式定义学生策略它只能观察问题与推理阶段的输入条件一致。两种策略都是从同一个参数化语言模型中实例化出的条件分布共享参数区别仅在于条件上下文。学生随后从自身策略采样在线轨迹教师沿同一条轨迹逐位置给出下一 token 分布训练时梯度只通过学生策略的 logits 反向传播。给定推理数据集研究者从同一 LLM 实例化学生和教师两种策略。学生只看问题并生成在线轨迹教师额外看到参考解答在学生前缀的每个位置给出下一 token 分布。损失沿学生轨迹最小化两种分布的逐 token 散度梯度只回传到学生 logits。这里有个容易误解的实现细节教师并不重新生成一份答案。提示词虽然要求它理解参考解答后再作答实际训练只用一次前向传播评估学生轨迹。参考解答通过预填充进入教师上下文教师随后为学生已走过的路径打分。主实验还把教师固定在初始策略上。学生用 LoRA 更新教师保持训练开始时的参数避免两个目标一起漂移。所谓“自己教自己”指的是同一底座模型在不同信息条件下形成两种策略不是让正在变化的模型追逐另一个同步变化的副本。风格词的 KL 比数学词高 6 到 13 倍必须单独裁剪OPSD 最终采用正向 KL让学生匹配教师在整个词表上的分布。全词表监督比只看实际采到的 token 更密但很快暴露出一个怪问题最大的分歧不一定来自数学。在“学生关闭思考模式、教师开启思考模式”的配置下Qwen3-1.7B 的风格词平均 KL 为 0.85数学词是 0.144B 对应 0.92 和 0.108B 对应 0.79 和 0.06。像 wait、think、therefore 这类连接和反思用词能贡献远高于数字、运算符和数学关键词的损失。如果直接把这些值相加模型会把大量更新花在模仿语气上。论文对每个位置、每个词表项的散度贡献设置裁剪阈值再求和。这个点式裁剪压住重尾风格信号图 4 显示它能阻止 Qwen3-1.7B 在 AIME24 上的后期性能下滑。生成模式也不是随意选的。四种师生思考模式组合中关闭思考模式的学生搭配开启思考模式的教师数学词上的 KL 信号最强下游成绩也最好。学生负责给出较直接的在线轨迹教师借助参考解答和思考模式提供更细的分布监督。三个模型规模都赢过 GRPO1.7B 的增幅最大主实验使用 Qwen3-1.7B、4B 和 8B 的指令模型训练数据是 OpenThoughts 数学子集最多 30,000 个带推理过程的问题与解答。评测覆盖 AIME 2024、AIME 2025 和 HMMT 2025每道题采样 12 次温度为 1.0最大生成长度为 38,912 token报告 Avg12。模型方法AIME24AIME25HMMT25平均Qwen3-8BBase (Instruct)75.865.643.961.8 SFT72.364.242.959.8 GRPO76.468.946.764.0 OPSD77.870.845.864.8Qwen3-4BBase (Instruct)74.966.442.261.2 SFT70.262.343.458.6 GRPO75.668.144.462.7 OPSD76.468.346.163.6Qwen3-1.7BBase (Instruct)51.536.723.137.1 SFT48.436.322.735.8 GRPO51.138.323.737.7 OPSD57.243.929.243.4三个 Qwen3 规模在 AIME24、AIME25、HMMT25 上的 Avg12%平均值为三项基准的均值。OPSD 取前 100 步内每隔 20 步评估的最佳检查点GRPO 取 500 步内峰值。1.7B 模型最能说明差距。OPSD 把三项平均分从基础模型的 37.1 提到 43.4较 GRPO 高 5.7 分。4B 和 8B 上OPSD 的平均分分别是 63.6 和 64.8也都高于对应的 GRPO。SFT 的结果方向相反。8B、4B、1.7B 的平均分分别从 61.8、61.2、37.1 降到 59.8、58.6、35.8。论文把它归因于参考答案过于简洁微调后模型在测试阶段也缩短了推理。这个解释有生成长度观察支撑但仍属于作者归因没有单独的因果实验。在相同有效训练批次下Qwen3-1.7B 的 OPSD 每条生成上限为 1,024 tokenGRPO 为 16k。相同步数内OPSD 使用更少的生成 token并在三项基准上领先GRPO 前 100 步超过一半批次的组内奖励标准差为 0无法产生梯度。训练配置把预算差异写得很直白两者有效批次都是 32学习率同为 5e-6LoRA rank 都是 64。GRPO 每题生成 8 条、每条最多 16,000 token训练 500 步OPSD 每题生成 1 条、最多 1,024 token训练 100 步。论文实验使用 8 张 A100 或 H100并开启梯度检查点和 Flash Attention 2。这里不能把 token 节省直接换算成同等比例的训练成本。OPSD 要保存每个位置的全词表 logits峰值显存更高教师侧也需要前向计算。论文证明的是采样 token 和训练步数更省不是完整系统成本按 128 倍下降。正向 KL、1,024 token 和全词表分布都经过消融正向 KL 在 Qwen3-1.7B 的 AIME25 上最稳。基础分是 36.7第 50 步升到 43.9第 100 步仍有 41.1。反向 KL 在第 100 步降到 35.0JSD 为 39.0。主实验因此使用正向 KL。把学生生成上限从 1,024 增加到 4,096也没有在 AIME24 和 AIME25 上带来一致收益。作者的解释是早期 token 更像推理分叉点前缀足够长后后续 token 对教师越来越容易预测新增监督的信息量下降。这个解释与曲线相符论文没有直接测量每个位置的因果贡献。全词表蒸馏则确实比采样 token 目标更强。在 Qwen3-4B、蒸馏长度 2,048 的对比中全词表方法在 AIME25 和 HMMT25 的 pass8 分别为 84.1、60.0采样 token 方法为 82.1、57.3。代价仍是显存全词表 Softmax 要在每个位置保留词表级分布。OPSD 适合有标准解答的数据开放任务还没有证据这套方法最适合已经有问题与参考解答的数据。标准答案不再只是终局标签而是教师上下文里的特权信息学生仍沿自己的轨迹采样因此训练信号既贴近推理分布又能落到每个 token。它也没有凭空增加模型能力。论文明确提醒如果题目超出模型的理解阈值教师即使看见标准解答也未必能给出有意义的监督。课程学习可能有帮助但还没有实验结果。证据范围目前很窄。实验只覆盖数学推理和 8B 以下模型没有验证代码、开放式写作或多轮智能体。当前目标也没有显式使用学生答案是否正确的信号裁剪阈值未做系统调优。所有结果来自论文和作者代码本文章未独立复现实验。对于手里已有高质量参考解答、又不想维护独立教师模型的团队OPSD 给出了一条可测试的路径。复现时应同时盯住组内奖励标准差、不同 token 类别的 KL、生成长度和逐检查点成绩。若任务没有稳定的参考答案或底座模型看不懂解答这个训练信号就失去了前提。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
RELATED

相关推荐

【2026年百度暑期实习/秋招- 7月30日-后端AI Coding-第二题- 余数游走】(题目+思路+JavaC++Python解析+在线测试)

【2026年百度暑期实习/秋招- 7月30日-后端AI Coding-第二题- 余数游走】(题目+思路+JavaC++Python解析+在线测试)

题目内容 给定一个长度为 nnn 的整数序列 a1,a2,…,ana_1,a_2,\dots,a_na

📅 2026/9/8 14:31:41
Docker 超全基础操作速查手册|镜像 / 容器 / 数据卷常用命令汇总

Docker 超全基础操作速查手册|镜像 / 容器 / 数据卷常用命令汇总

Docker 是当下后端、运维开发必备的容器化工具,日常开发、服务器部署几乎离不开镜像拉取、容器启停、数据持久化等基础操作。很多新手刚接触时容易混淆各类命令参数,每次使用都要翻文档。本文整理 Docker 三大核心模块:镜像 Image、容器 Cont…

📅 2026/8/23 1:50:08
xbox moonlight 串流方案

xbox moonlight 串流方案

这是一个纯文本的---->拥有XBOX的人有福了,有了XBOX有了ALL;哈哈当然这是不绝对的,目前有一个这样的问题,我有一个TV,but我不能解码H265(可能其他的也解码不了),导致我的moonligh根本使用不了&#xff0…

📅 2026/9/15 11:07:39
MORE NEWS

更多资讯

📰

Atlas 300V 24G部署YOLOv8实战:从环境搭建到推理优化

最近帮一个视频分析项目组把YOLOv8检测服务从GPU迁移到Atlas 300V上,整个过程折腾了快两周,踩了不少坑。现在项目已经稳定跑了一个多月了,趁热把这块推理卡的真实表现、环境搭建流程和部署YOLO的完整方案写出来。如果你正准备用Atlas 300V 24…

📰

Skill 用 qwen-plus,模型通道走 TaoToken 行不行

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

云端量化平台双均线策略实操:Python量化新手半小时跑通全流程

很多朋友学Python量化,第一反应是先去装Python、配VSCode、学爬虫,折腾一圈下来,发现连“策略代码长什么样”都还没见过。其实像iQuant这类云端量化平台,早就把环境搭建、行情数据、回测引擎这些脏活累活全包了,你只需…

📰

基于深度学习与注意力机制的智能合约漏洞检测实战解析

简介:这套基于深度学习的智能合约漏洞检测毕业设计资源,面向区块链安全方向的学生与开发者,围绕LSTM、BLSTM及BLSTM注意力机制构建检测模型,解决智能合约代码漏洞自动识别问题。压缩包共1428个文件,涵盖1388个sol合约样…

📰

2025年六款文生图工具中文提示词横评:语义理解与文化意象还原实测

中文提示词在文生图工具上的表现,这两年变化非常快。2023年那会儿,我拿一句“一只戴着草帽的橘猫蹲在江南水乡的石桥上,背景是烟雨朦胧的乌篷船”去测主流工具,十张里有八张会把“草帽”和“乌篷船”揉成一团,猫倒是画…

📰

量化多市场数据统一:跨市场策略回测的7个隐藏坑与解决方案

做量化这行,多数人一开始都特别自信,觉得数据源嘛,挑个行情全的、更新快的就行。A股用免费接口拉一拉,美股用现成库抓一抓,单市场策略跑得挺顺,连回测曲线都漂亮得让人想直接上实盘。但只要你开始把策略从单…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬