OPSD 让模型拿标准答案教自己,在学生自己的推理路径上逐 token 纠错

发布时间:2026/7/31 2:44:19
OPSD 让模型拿标准答案教自己,在学生自己的推理路径上逐 token 纠错 一次 Qwen3-1.7B 训练里GRPO 每题采 8 条轨迹单条上限 16,000 tokenOPSD 只采 1 条上限 1,024 token。前者生成得更多却在前 100 步中有超过一半批次的组内奖励标准差为 0拿不到梯度。如果只看采样预算GRPO 像是投入更足的一方。问题出在奖励结构同组回答要么全对要么全错时每条回答的相对优势都归零。8 条长轨迹已经生成策略却没有可用的更新方向。最终分数把这笔浪费照得更清楚。在三项竞赛数学基准的平均分上Qwen3-1.7B 的 GRPO 峰值是 37.7OPSD 达到 43.4。前者从 500 个训练步骤内选峰值后者只评估到第 100 步。OPSD 的研究问题很具体既然推理数据里已有标准解答能不能让同一个模型一边作答一边借助答案检查自己的每一步教师无需更大只需多看一份学生在推理时拿不到的信息。GRPO 只知道整题对错SFT 又把模型教得更短基于可验证奖励的强化学习很适合数学题。答案容易判定奖励也干净。可它通常只在整条序列结束时给出 0 或 1同一回答中的所有 token 共用一个优势值。模型知道这题错了却不知道错误从哪一步开始。GRPO 还依赖组内差异。只要一组回答奖励相同标准差就是 0梯度信号随之消失。论文在 OpenThoughts 数学子集上观察到这类批次并不少见。直接把标准解答拿来做 SFT 也不稳。训练时模型沿专家轨迹前进推理时却要处理自己生成的前缀两个分布并不一致。更麻烦的是这批参考解答偏简洁。三个 Qwen3 规模在同一数据上做 SFT 后三项基准平均分都低于基础模型测试时的推理长度也缩短了。传统在线策略蒸馏能避开这两个问题轨迹由学生自己生成教师在轨迹上提供逐 token 分布。但通常还要准备一个独立、往往更大的教师模型。OPSD 改掉了这项依赖。同一个模型分成两种上下文标准答案只给教师看OPSD 没有复制出两个不同的模型。学生策略和教师策略共享参数区别只在输入上下文教师策略以问题和参考解答为条件学生策略只以问题为条件二者由同一个参数化语言模型实例化。式中x表示问题y⋆ 表示对应的参考解答其中可以包含思维链θ表示共享语言模型的参数。下标T与S分别标记教师策略和学生策略。占位符 · 表示完整的词表随机变量因此两式给出的是下一 token 条件概率分布而非某一个 token 的概率条件符号 ∣ 右侧列出已知上下文定义等号 ≜ 表示左侧策略由右侧分布定义。第一式定义教师策略它以特权信息为条件同时接收问题和参考解答。第二式定义学生策略它只能观察问题与推理阶段的输入条件一致。两种策略都是从同一个参数化语言模型中实例化出的条件分布共享参数区别仅在于条件上下文。学生随后从自身策略采样在线轨迹教师沿同一条轨迹逐位置给出下一 token 分布训练时梯度只通过学生策略的 logits 反向传播。给定推理数据集研究者从同一 LLM 实例化学生和教师两种策略。学生只看问题并生成在线轨迹教师额外看到参考解答在学生前缀的每个位置给出下一 token 分布。损失沿学生轨迹最小化两种分布的逐 token 散度梯度只回传到学生 logits。这里有个容易误解的实现细节教师并不重新生成一份答案。提示词虽然要求它理解参考解答后再作答实际训练只用一次前向传播评估学生轨迹。参考解答通过预填充进入教师上下文教师随后为学生已走过的路径打分。主实验还把教师固定在初始策略上。学生用 LoRA 更新教师保持训练开始时的参数避免两个目标一起漂移。所谓“自己教自己”指的是同一底座模型在不同信息条件下形成两种策略不是让正在变化的模型追逐另一个同步变化的副本。风格词的 KL 比数学词高 6 到 13 倍必须单独裁剪OPSD 最终采用正向 KL让学生匹配教师在整个词表上的分布。全词表监督比只看实际采到的 token 更密但很快暴露出一个怪问题最大的分歧不一定来自数学。在“学生关闭思考模式、教师开启思考模式”的配置下Qwen3-1.7B 的风格词平均 KL 为 0.85数学词是 0.144B 对应 0.92 和 0.108B 对应 0.79 和 0.06。像 wait、think、therefore 这类连接和反思用词能贡献远高于数字、运算符和数学关键词的损失。如果直接把这些值相加模型会把大量更新花在模仿语气上。论文对每个位置、每个词表项的散度贡献设置裁剪阈值再求和。这个点式裁剪压住重尾风格信号图 4 显示它能阻止 Qwen3-1.7B 在 AIME24 上的后期性能下滑。生成模式也不是随意选的。四种师生思考模式组合中关闭思考模式的学生搭配开启思考模式的教师数学词上的 KL 信号最强下游成绩也最好。学生负责给出较直接的在线轨迹教师借助参考解答和思考模式提供更细的分布监督。三个模型规模都赢过 GRPO1.7B 的增幅最大主实验使用 Qwen3-1.7B、4B 和 8B 的指令模型训练数据是 OpenThoughts 数学子集最多 30,000 个带推理过程的问题与解答。评测覆盖 AIME 2024、AIME 2025 和 HMMT 2025每道题采样 12 次温度为 1.0最大生成长度为 38,912 token报告 Avg12。模型方法AIME24AIME25HMMT25平均Qwen3-8BBase (Instruct)75.865.643.961.8 SFT72.364.242.959.8 GRPO76.468.946.764.0 OPSD77.870.845.864.8Qwen3-4BBase (Instruct)74.966.442.261.2 SFT70.262.343.458.6 GRPO75.668.144.462.7 OPSD76.468.346.163.6Qwen3-1.7BBase (Instruct)51.536.723.137.1 SFT48.436.322.735.8 GRPO51.138.323.737.7 OPSD57.243.929.243.4三个 Qwen3 规模在 AIME24、AIME25、HMMT25 上的 Avg12%平均值为三项基准的均值。OPSD 取前 100 步内每隔 20 步评估的最佳检查点GRPO 取 500 步内峰值。1.7B 模型最能说明差距。OPSD 把三项平均分从基础模型的 37.1 提到 43.4较 GRPO 高 5.7 分。4B 和 8B 上OPSD 的平均分分别是 63.6 和 64.8也都高于对应的 GRPO。SFT 的结果方向相反。8B、4B、1.7B 的平均分分别从 61.8、61.2、37.1 降到 59.8、58.6、35.8。论文把它归因于参考答案过于简洁微调后模型在测试阶段也缩短了推理。这个解释有生成长度观察支撑但仍属于作者归因没有单独的因果实验。在相同有效训练批次下Qwen3-1.7B 的 OPSD 每条生成上限为 1,024 tokenGRPO 为 16k。相同步数内OPSD 使用更少的生成 token并在三项基准上领先GRPO 前 100 步超过一半批次的组内奖励标准差为 0无法产生梯度。训练配置把预算差异写得很直白两者有效批次都是 32学习率同为 5e-6LoRA rank 都是 64。GRPO 每题生成 8 条、每条最多 16,000 token训练 500 步OPSD 每题生成 1 条、最多 1,024 token训练 100 步。论文实验使用 8 张 A100 或 H100并开启梯度检查点和 Flash Attention 2。这里不能把 token 节省直接换算成同等比例的训练成本。OPSD 要保存每个位置的全词表 logits峰值显存更高教师侧也需要前向计算。论文证明的是采样 token 和训练步数更省不是完整系统成本按 128 倍下降。正向 KL、1,024 token 和全词表分布都经过消融正向 KL 在 Qwen3-1.7B 的 AIME25 上最稳。基础分是 36.7第 50 步升到 43.9第 100 步仍有 41.1。反向 KL 在第 100 步降到 35.0JSD 为 39.0。主实验因此使用正向 KL。把学生生成上限从 1,024 增加到 4,096也没有在 AIME24 和 AIME25 上带来一致收益。作者的解释是早期 token 更像推理分叉点前缀足够长后后续 token 对教师越来越容易预测新增监督的信息量下降。这个解释与曲线相符论文没有直接测量每个位置的因果贡献。全词表蒸馏则确实比采样 token 目标更强。在 Qwen3-4B、蒸馏长度 2,048 的对比中全词表方法在 AIME25 和 HMMT25 的 pass8 分别为 84.1、60.0采样 token 方法为 82.1、57.3。代价仍是显存全词表 Softmax 要在每个位置保留词表级分布。OPSD 适合有标准解答的数据开放任务还没有证据这套方法最适合已经有问题与参考解答的数据。标准答案不再只是终局标签而是教师上下文里的特权信息学生仍沿自己的轨迹采样因此训练信号既贴近推理分布又能落到每个 token。它也没有凭空增加模型能力。论文明确提醒如果题目超出模型的理解阈值教师即使看见标准解答也未必能给出有意义的监督。课程学习可能有帮助但还没有实验结果。证据范围目前很窄。实验只覆盖数学推理和 8B 以下模型没有验证代码、开放式写作或多轮智能体。当前目标也没有显式使用学生答案是否正确的信号裁剪阈值未做系统调优。所有结果来自论文和作者代码本文章未独立复现实验。对于手里已有高质量参考解答、又不想维护独立教师模型的团队OPSD 给出了一条可测试的路径。复现时应同时盯住组内奖励标准差、不同 token 类别的 KL、生成长度和逐检查点成绩。若任务没有稳定的参考答案或底座模型看不懂解答这个训练信号就失去了前提。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻