
这项由微软研究院联合清华大学、北京大学研究人员共同完成的研究于2026年7月发表在预印本平台arXiv上论文编号为arXiv:2607.18110。感兴趣的读者可以通过该编号检索到完整论文。**一个关于打分与辅导的故事**假设你正在备考一门写作课有两种老师可以选择。第一种老师每次看完你的作文只给你打一个分数7分。你拿到这个7分完全不知道哪里写得好、哪里写得差只能凭感觉再写一遍期待下次分数能高一点。第二种老师不只给分还告诉你你的文章用词重复太多很好这个词出现了五次可以换成更具体的描述另外你的论据太抽象如果能加上一个真实的生活场景会更有说服力……同样是评估你的作文这两种老师的反馈价值天差地别。这个打分老师与辅导教练的区别正是微软研究院这篇论文想要解决的核心问题。研究团队提出了一个叫做体验学习Experiential Learning简称EL的新框架把AI训练过程中那个只会打分的评委升级成了一个能给出实质性指导的教练。**一、AI是怎么学习的以及问题出在哪里**要理解这项研究先得了解目前大语言模型就是ChatGPT、Claude这类AI是怎么变得越来越聪明的。AI在经过基础训练之后还需要经历一个打磨阶段让它的回答更符合人类的期望。其中一种主流方法叫做强化学习——原理其实和训练宠物有点像做对了就给奖励做错了就扣分AI会慢慢朝着得高分的方向进化。在这个过程中需要有人来评判AI的回答好不好。由于人工评估太慢太贵研究人员想出了一个聪明的办法让另一个AI来当评委这个评委AI被称为LLM-as-a-JudgeAI担任裁判。评委AI会根据一套评分标准给被训练的AI的每一条回答打一个分数比如1到10分。被训练的AI就根据这些分数来调整自己争取下次得更高分。这套方法在有明确答案的任务上效果很好。比如数学题——答案要么对要么错分数能准确反映表现。但问题在于现实中很多任务并没有唯一的标准答案。一篇旅游攻略、一段创意文案、一份建议信——这些回答的质量牵涉到好多维度事实是否准确、表达是否清晰、逻辑是否连贯、风格是否得体……当评委AI把这些复杂的评估最终压缩成一个数字——比如7分——大量有价值的判断信息就白白浪费了。更麻烦的是很多质量不同的回答会得到相同的高分比如都得了9分但其中一篇其实在某些细节上明显更好。在分数层面这两篇回答对AI来说完全一模一样训练就陷入了瓶颈。这就像你参加一个烹饪比赛裁判只告诉你这道菜75分却不告诉你是调味出了问题还是火候没掌握好。你只能一遍遍做菜猜原因进步速度当然快不起来。**二、把评委变成教练体验学习的核心思路**微软研究院的团队提出的解决方案用一句话概括就是与其让评委AI把评估结果压缩成一个冷冰冰的数字不如让它把那些评估过程中产生的真正有价值的分析转化成可供学习的经验知识。以文章开头那个摩洛哥旅游攻略为例。评委AI读完之后它其实内部已经分析了很多东西这篇文章反复用很棒这个词来形容一切缺乏具体描写而在描写集市的那段话里把气味、声音和视觉感受结合在一起的写法很成功让人有身临其境的感觉。在原来的方式下这些分析全部被丢弃只留下最后的7分。在新的体验学习框架里评委AI转变角色成为LLM-as-a-CoachAI担任教练它会把这些分析提炼成可以迁移的经验建议比如描述场景时应该调动多种感官而不是堆砌形容词把抽象的感受落地成具体的细节读者才能产生共鸣。这些建议不是针对这一篇文章的一次性修改意见而是适用于类似写作任务的通用策略。这份经验知识会被提供给一个教师模型教师模型在获得这些经验指导后会产生一套更好的回答模式。被训练的AI称为学生模型需要让自己的输出更接近这个教师模型从而把这些经验真正内化进自己的参数里。整个过程就像一个学生看着教练示范然后反复练习直到把技巧变成本能——等到真正上场时教练不需要在旁边指导学生已经把经验变成了自己的能力。**三、信息带宽为什么一个数字和一段文字差距如此巨大**研究团队还用了一个信息理论的视角来解释为什么这种方法有效这个解释本身就很有启发性。把问题转换成信息传输来思考从评委AI到被训练AI每次评估能传递多少有用信息一个1到10的整数分数理论上最多能携带约3.3比特的信息量——大概相当于区分不到10种不同情况的信息。就算用更精确的浮点数表示也不过16比特左右。而体验学习中教练AI生成的经验知识通常有几百到上千个词。以1024个词为例从一个15万词汇量的语言模型里选出来的这段文字理论上能携带的信息量高达17600比特——是一个数字分数的5000多倍。当然研究团队也诚实地说明这个5000倍是理论上限不代表实际有效信息量就真的多了5000倍——就像一本1000页的书实际传递的有效知识不一定比一篇精华10页的论文多5000倍。但这个对比确实说明了一个根本性的问题用一个数字作为学习信号从一开始就把绝大部分有价值的反馈信息掐断了。这种信息带宽的差异在训练进入后期阶段会显得尤为关键。当AI已经能写出相当不错的回答几乎每次都能得到9分或10分的时候分数已经无法区分这些回答之间的细微差别了——就像所有优等生都得了满分你就没法知道他们各自的强项在哪里。而经验知识依然能捕捉到这些微妙的差异帮助AI在已经很好的基础上继续精进。**四、实验是如何设计的结果怎么样**研究团队用两个不同系列的AI模型来测试这套方法一个是阿里巴巴的Qwen3-8B另一个是开源社区的OLMo-3-7B。为了排除偶然因素他们还分别用两种不同的教练来提供反馈一种是用AI本身来给自己当教练另一种是用OpenAI的GPT-4o这个更强大的商业模型来担任教练。训练数据来自一个叫WildChat-IF的数据集包含7500条真实用户的对话请求覆盖各种各样的开放性任务。每条请求都配有GPT-4o预先生成的评分标准把回答质量分解成多个可以独立检查的维度。训练完成后研究团队不只看训练集上的表现更重要的是检验在完全没见过的新任务上效果如何。他们选了四个独立的评测平台AlpacaEval v2.0、WildBench、ArenaHard v2.0以及CreativeWritingV3创意写作专项测试。这四个平台的题目和训练数据完全不同是真正检验有没有学到可迁移能力的硬指标。结果相当一致在几乎所有测试场景和所有模型组合下体验学习的表现都超过了传统的强化学习打分方式。以Qwen3-8B模型为例用自己当教练时强化学习在AlpacaEval上的胜率是37.3%而体验学习达到了40.0%在WildBench上强化学习得分18.4体验学习达到21.8。这些差距在AI训练领域算是相当显著的提升。更有意思的是一个对比实验研究团队专门拿训练集的一部分数据在训练完成后评估两种方法在这些见过的题目上的表现和在新题目上的表现进行对比。结果发现强化学习在训练集上的分数提升约1.7分实际上高于体验学习约1.3分但在新题目上体验学习的提升2.0分明显超过强化学习1.1分。这个现象揭示了一个很重要的规律强化学习在训练集上表现得更好但这种好有一部分是通过学会迎合评分系统的偏好来实现的并不是真正提升了能力。换句话说AI学会了考试技巧而不是真正的知识。这在学术上被称为奖励黑客reward hacking就像学生专门研究出题规律、背答题套路来应付考试而不是真正理解了知识。体验学习因为学的是可迁移的经验策略而不是奔着一个具体分数去优化所以反而在陌生题目上表现更稳健。**五、细节很重要哪种经验知识效果最好**研究团队做了一系列精细的对比实验来搞清楚经验知识到底该是什么形式效果才最好。他们对比了四种不同的方式。第一种叫完整评语就是把教练AI输出的所有文字——包括逐条分析每个评分维度的内容——原封不动地全部塞给教师模型。第二种叫仅提供标准不给任何具体反馈只把评分的维度告诉教师模型让它参照标准来回答。第三种叫多选题式让教练AI从9个预设的改进方向中选一个比如提升事实准确性或者加强创意表达这样反馈信息量和打个1到10的分数差不多。第四种就是体验学习的默认方式教练AI从评估过程中提炼出可迁移的通用策略而不是针对这次回答的具体修改意见。测试结果显示默认的体验学习方式在专项评测WildChat得分68.6和通用能力评测IFEval准确率68.8%上都表现最好。完整评语和仅提供标准这两种方式虽然也提升了专项分数但通用能力分数下降了——原因在于评审性质的文字会让教师模型产生一种批改习惯AI在学习时连带着学进去了这种模式在完全不同类型的任务上就会显得不对劲。多选题方式因为信息量太少提升空间有限和前面关于信息带宽的分析完全吻合。此外研究团队还发现如果让教师模型随着训练进行而迭代更新——也就是每轮训练结束后让当前的学生模型成为下一轮的教师——专项分数会进一步提升从80.0到80.7但通用能力会明显下降原因是模型在专注训练某类任务时慢慢遗忘了其他领域的能力。解决办法是在训练数据里混入一部分来自其他领域的普通提示让模型时不时复习一下这样就能在提升专项能力的同时把通用能力的损失控制在可接受范围内IFEval从74.9恢复到79.9。**六、一个小型玩具实验用数学模型说明问题的本质**为了更直观地展示打分方式和分布式引导方式在根本原理上的差异研究团队还专门设计了一个简化的思想实验。设想一个教练AI心目中有一个理想分布代表对每种回应方式的偏好程度形状类似一座双峰山——有两个高峰代表两种各有优势的好回答风格。现在把这个连续的偏好分布压缩成5个等级的分数类似打1到5分就会发现一个问题处于同一个分数档次的所有回答在分数层面变得完全无法区分哪怕实际上有些更靠近峰顶、有些更靠近谷底。AI在训练时只能学到一个阶梯状的近似分布——能大致区分好差但摸不清楚微妙的偏好。而如果直接用分布本身来引导AI——也就是体验学习的方式——AI学到的分布形状就能更接近那个双峰的真实形态把细微的偏好差异也保留下来。对于像数学题这样只有对错之分的二值目标两种方式效果相差无几但对于涉及多个质量维度、好回答本身就有多种不同风格的开放任务这种细节上的差距就会变得不可忽视。**七、这项研究和其他方法有什么不同**研究团队在论文里也花了篇幅梳理了这套方法和其他相关工作的区别帮助我们理解它在整个研究版图中的位置。把AI的评估反馈转化成文字形式来使用这个想法本身并不是全新的。此前已经有研究者尝试让AI反思自己的错误、把批评意见存进外部记忆库或者在强化学习中加入文字反馈等。但这些方法大多有一个共同的局限最终的训练信号依然落在一个标量分数上文字分析只是辅助手段信息瓶颈并没有从根本上突破。体验学习的核心区别在于它完全绕过了分数这个环节。学习信号不是你得了7分而是根据这次评估以下是适用于类似任务的通用策略……学生模型要学的是向一个被经验知识指导后的教师模型靠拢而不是最大化某个具体分数。这在目标上是本质不同的追求更高分会让AI学会讨好评分系统而向教师分布靠拢则让AI学会更接近人类真实偏好的回答方式。研究团队还强调这套方法的另一个好处是教练AI在训练结束后就不再需要了。经验知识已经内化进了学生模型的参数里部署时不需要额外调用任何辅助模型不影响运行效率。**八、局限性与未来方向**研究团队对于这项工作的边界保持着清醒的认识。体验学习解决的是反馈信息带宽问题但它并不能解决教练本身是否靠谱的问题。如果教练AI本身存在偏见或者评估能力有限这些问题通过更丰富的文字表达同样会传导给学生模型只是传导方式变了。此外生成经验知识本身也是有成本的教练AI需要处理更复杂的提示生成更长的输出。好在研究团队的分析表明相比于整个训练流程中采样回答、调用反馈模型的总成本这部分额外开销相对较小。未来可以探索的方向包括如何让经验知识的提炼过程更精准、如何在更多类型的任务上验证效果以及如何设计更好的迭代学习机制让AI随着经验积累不断进化。说到底这项研究传递的核心信息很朴素教学不只是给学生打分还要告诉他们为什么。把这个道理用到AI训练上带来的是切实可测量的性能提升以及对死记硬背考试套路这种投机行为的有效抑制。当AI的学习方式越来越接近人类从经验中成长的方式它在面对新问题时也就更有可能给出真正有价值的回答而不只是一个能让评分系统满意的答案。这对于那些依赖AI处理创意写作、咨询建议、个性化内容等复杂任务的普通用户来说意味着AI助手的质量上限可以被真正拉高而不只是在已有的水平上反复打转。有兴趣深入研究这套方法的读者可以通过arXiv编号2607.18110查阅完整论文研究团队也在aka.ms/el-code提供了代码实现。---QAQ1体验学习和传统强化学习在AI训练上有什么区别A传统强化学习让AI的评委把所有评估结果压缩成一个数字分数AI只根据这个分数来调整自己的行为。体验学习则让评委把评估过程中的分析提炼成可迁移的经验建议AI通过学习被这些建议指导后的教师模型来提升自己。本质区别在于前者追求更高分容易学会考试技巧后者学的是通用策略在没见过的新任务上表现更稳定。Q2体验学习中的经验知识具体长什么样A经验知识是教练AI从评估一次具体回答中提炼出来的通用建议通常是几条可以迁移到类似任务的策略性指导比如描述场景时要调动多种感官而不是堆砌形容词或每个限制说明后面都应该给出替代方案。它不是针对那一次回答的具体修改意见而是适用于同类任务的可复用规律长度通常在几百词左右。Q3体验学习为什么能减少AI训练中的奖励黑客问题A奖励黑客指AI学会迎合评分系统的偏好而不是真正提升回答质量就像学生专门背题型套路应付考试。体验学习完全绕过了分数环节AI的优化目标是让自己的输出更接近被经验知识指导后的教师模型的分布而不是最大化某个具体分数。没有了可以钻空子的数字目标AI就更难通过表面的模式匹配来欺骗评分系统学到的能力也因此更真实。