注册并分享邀请链接,可获得视频播放与邀请奖励。

meng shao (@shao__meng) “Meta RAM 团队提出 RL-XAR:用专家对齐评分标准消灭 AI Slop RL-XAR (Reinforcement L” — TopicDigg

meng shao 的个人资料封面
meng shao 的头像
meng shao
@shao__meng
加入 November 2023
0 正在关注    0 粉丝
Meta RAM 团队提出 RL-XAR:用专家对齐评分标准消灭 AI Slop RL-XAR (Reinforcement Learning from eXpert-Aligned Rubrics):用少量高质量人类文本作为“标准答案”,自动优化出一套能把专家写作和 AI 写作区分开的评分细则,再以此作为奖励信号做 RL。在 Qwen3.5-27B 写作模型上,该方法让 AI 写出的论文段落和故事续写在盲评中大幅击败原版人类专家文本(胜率 89%–95%),首次把“可验证任务上的超人 RL”推进到了写作这类不可验证任务。 问题:为什么写作是 RL 的洼地 ? RL(如 GRPO)之所以能在数学、代码上取得超人表现,核心前提是奖励可验证——答案对不对可以自动判定。但写作没有这种判据: · 最大似然预训练的天花板就是训练数据本身的质量。模型学的是“复现语境的平均水平”,而不是超越它。 · RLHF 的奖励模型继承标注者的品味上限。奖励模型从普通标注者的偏好排序中学出来,普通标注者自己写不出、也未必能稳定识别出专家级的文字质量。 结果是模型产出大量低质量写作,也就是 "AI slop"。 关键诊断:现成的 LLM 评判者本身就是“slop 同谋” 在一个“隐去论文某一段落(摘要/引言/相关工作/结论),让模型补写”的任务上: · 成对比较(pairwise judging):LLM 评判者在 63.5%–84.6% 的情况下把模型输出排在人类专家之上; · 普通 LLM 生成的评分标准:100% 偏向模型。 也就是说,如果直接拿主流 LLM 当裁判做 RLHF/RLAIF,你训练出来的只会是“更受 LLM 裁判青睐的 slop”。奖励信号本身就是坏的,而且坏得系统化。 方法:RL-XAR 的四步循环 既然普通评分标准分不清人类和模型,那就专门优化出一套分得清的。 1. 构造对照数据:取专家人类文本,切成“上下文 + 续写”对(如论文其余部分 + 被隐去的段落); 2. 生成竞品:让模型写同题续写,预期是 slop; 3. 元优化评分标准:用一个强 LLM 作为元优化器(如 Kimi-K2.6),反复修订一个“评分标准生成提示词”,目标是最大化人类得分与模型得分之差,且明确要求“为了真实的质量原因拉开差距,而不是抓住表层特征”。meta-prompt 有长度上限,迫使标准收敛、去冗余; 4. 用学到的评分标准跑 GRPO,训练写作者,然后回到第 3 步迭代,直到人类—模型分差消失(模型已经“好到分不出来”)。 作者认为,这与 GAN 同构:写作者像生成器,评分标准像判别器,二者交替对抗优化,直到判别器失效。妙处在于:判别器不需要人工标注偏好,只需要免费存在的专家文本作为锚点。 学到的评分标准到底在奖励什么? 这部分是方法真正“理解写作”的证据,而非玄学: · 普通评分标准退化成逐条内容清单,逐点检查该段是否提到某方法、某结果,实际上是在奖励每一段都写成“微型全文摘要”; · 元优化后的标准奖励的是:段落本位(sectional ownership,每段只做段内该做的事,不越界)、克制的取舍(disciplined selection)、经济性(economy)、精准的段内细节而非覆盖面; · 元优化器明确修正了早期标准的三类误判:因专家合理省略而扣分、把压缩摘要当流畅性加分、把表面润色当功力。 主实验结果 实验统一以 Qwen3.5-27B 为写作模型,训练时由 Qwen3.8-2.4T-A95B 担任裁判、Kimi-K2.6 担任元优化器,最终评估则换用 GPT-5.6,避免自评偏袒。 三个写作领域的表现一致向好。 · 论文段落补写(S2ORC 561 篇 CS 论文,2,243 个训练样本)效果最强:3 轮 RL-XAR 后,模型在最严评分标准下拿到 9.60/10(人类专家为 10),超过所有参测前沿模型;人类盲评中专家仅胜 2 局,模型 16:2(89% 胜率)胜出。 · 故事续写(古腾堡计划普利策/诺贝尔奖作者作品,2,290 个样本,经 13-gram 重复过滤排除记忆泄漏)得分从 2.8 升至 8.2,超过 Claude 5 Opus 的 6.8;盲评 19:1(95% 胜率)。 · 维基百科段落(特优/优级条目,1,187 个样本)增益最小:从 2.7 升至 4.0,仍落后于 GPT-5.6 的 7.9;作者归因于训练裁判在该任务上太弱,再次印证裁判上限决定写作上限。 消融实验:哪些成分在起作用? · 裁判质量是命门:换 Qwen3.5-27B 当裁判,人类—模型分差在故事任务为 −0.55、维基为 −0.39;弱裁判直接把奖励信号搞反。 · 元优化器要够强:Kimi-K2.6 和 Opus 5 能找到正向分差,更弱的 Muse Spark 1.1 找不到。 · 专家文本的成色决定上限:按论文质量分桶,分差分别为 +1.39(高)/ +0.95(中)/ +0.37(低),喂什么水平的专家,就学到什么水平。 · 评分标准跨裁判可迁移:在 GPT-5.6 和 Muse Spark 1.1 上同样有效,说明学到的是真实写作规律,不是对某个裁判的过拟合。 · 必须约束长度:不加长度约束时模型写出 2–3 倍长度的文本来“刷”评分标准(副作用是模型把大量思维链花在数字数上)。 · 多轮迭代评分标准防止对单轮标准过拟合;用 GRPO 在线共同训练评分标准(故事 2.8→6.0)是有前景的下一步。
显示更多