今日概览
- DiffusionOPSD在20种设置中19种居首:它把图像终点奖励转成当前策略轨迹上的逐步去噪目标,最高领先最强对手44.0%,训练GPU时长减少40%和63%。
- 记忆问答提分未换来满意度提升,直接问答准确率从19.7%升至70.1%,但真实对话能否适时、自然地引用记忆才与体验相关。
- OPDVR让逐token建议服从任务级验收。在线蒸馏提供密集指导,可验证奖励守住正确性,两类信号在当前策略轨迹上协调。
- TorchMorph补上GPU流水线的形态学断点:22个批量算子支持多达八个空间维度,避免CPU往返悄悄抵消端到端加速收益。
重点关注
图像生成 终点打分再准,也教不会每一步怎么去噪?
扩散模型偏好对齐有个关键断层:图像级奖励能判断最终结果好不好,却无法直接告诉中间去噪预测该往哪里改。DiffusionOPSD把奖励梯度转成围绕当前预测的正负目标,再让模型通过自蒸馏学习这些显式监督信号,相当于把模糊的终点评价拆成每一步都能执行的修改建议。更有意思的是,它使用当前行为策略实际生成的轨迹来取样状态,让训练目标紧贴模型真正会访问的生成路径,减少「训练时学一种状态、生成时遇到另一种状态」的错位。摘要披露的控制实验还揭示了一个容易忽略的问题:目标在理论上带来的改进越大,经过一次训练更新后实际兑现的收益未必越大,因此目标设计和模型能否学进去需要分开评估。在两个扩散模型、十个评估器组成的20种设置中,该方法有19种取得最佳最终留出集得分,最高领先最强对手44.0%;相比DiffusionNFT,训练GPU时长分别减少40%和63%。这些结果让「在当前策略轨迹上制造可学习目标」成为一条很值得关注的后训练路线,不过具体画质、多样性及跨奖励泛化表现仍需看全文确认。
要点: 做扩散模型对齐时,别只优化奖励函数,还要检查奖励能否转成中间步骤可学习的目标;on-policy轨迹能降低监督数据与真实生成路径的错位,适合需要持续迭代偏好的团队;评估新方法时应分开看目标本身的潜力与单次更新后真正兑现的收益
原文:On-Policy Self-Distillation in Diffusion Models
评测 问得出来的记忆,未必聊得出来
四个月、40名用户、1,872次会话和7种记忆条件揭示了一个反直觉结果:直接问答准确率从19.7%升到70.1%,用户满意度却没有变化。原因可能在于,直接问答只测试「被问到时能否取回」,真实对话还要求系统主动判断何时相关,并把旧信息自然地融入回应。更夸张的是,在模型和上下文固定时,同一系统直接问答得分达到78.8%,实际对话中却只引用了7.9%的相关事实,相差近71个百分点。摘要结果显示,自然融入记忆与满意度相关,而直接问答无关,不过这仍是关联而非因果,需要看全文确认具体控制方式。做记忆产品的团队因此应该把「何时提及、怎样提及、是否改善交互」纳入核心评测,而不是继续单押事实召回率。
要点: 直接问答高分不能证明记忆功能改善了真实体验;评测应覆盖相关性识别和自然融入,而不只是事实取回;上线前应观察记忆引用是否提升满意度,并警惕生硬或多余的主动提及
训练优化 老师给建议、结果来验收,能让训练信号不再互相打架吗?
大模型后训练常卡在两种不完整的反馈上:可验证奖励只告诉模型答案对不对,却难以指出每一步该怎么改;在线蒸馏能提供逐token指导,却可能让模型继承老师的错误上限。OPDVR尝试在当前策略生成的轨迹上协调两者:先根据整条轨迹是否正确重写蒸馏的隐式奖励,再用ReLU门控让正确轨迹获得非负奖励、错误轨迹获得非正奖励。这样,老师的分布仍提供密集建议,但建议必须服从任务的硬验收,而且不需要额外引入权重或切换阈值。摘要显示,该方法可直接接入GRPO等策略梯度算法,并在六个推理基准上持续优于标准在线蒸馏,不过具体提升幅度仍需看全文确认。对训练团队而言,真正值得借鉴的不是把两种损失放在一起,而是让逐步指导与最终正确性在模型自己的轨迹上保持方向一致。
要点: 稀疏奖励可用逐token蒸馏补足,但老师的建议必须接受最终正确性约束;组合训练时应优先检查两类信号是否同向,而不是反复调损失权重;OPDVR无需新增超参数且可接入GRPO,值得在现有推理后训练管线中做对照实验
原文:On-policy Distillation with Verifiable Reward
训练优化 真正拖慢GPU训练的,可能是一个「预处理」算子
训练流水线已经跑在GPU上,不代表它真的实现了端到端加速:一次形态学处理若只能调用CPU实现,就要把张量搬出设备再搬回来。TorchMorph补的是这个基础设施缺口,提供22个可直接处理批量张量的算子,并支持多达八个空间维度,覆盖传统工具常缺失的三维场景和复杂结构元素。它的接口刻意贴近SciPy,已有流程理论上只需少量修改就能迁移。相比单线程SciPy基线,灰度形态学的吞吐量最高提升约1100倍,精确欧氏距离变换最高约350倍,但这些数字不能直接等同于整体训练提速。更实际的价值是消除设备往返这个系统断点;最终收益仍取决于形态学算子在真实流水线中的调用频率和数据规模。
要点: 排查训练瓶颈时不要只盯模型内核,设备间的数据搬运也可能抵消加速收益;涉及批量、三维或复杂结构元素的视觉任务,可评估将形态学处理留在显卡上的收益;论文给出的高倍加速基于单线程CPU对照,是否改善端到端训练仍需用真实流水线验证
原文:TorchMorph: CUDA-accelerated Morphological Transforms
也值得关注
- {Agent} 把工作记忆与经验记忆分层,让长程Agent按当前状态调用技能,而非反复吞下完整历史 — Recuris探索递归式经验演化。链接
- {检索} 搜索Agent若只在终点拿到成败反馈,错误可能早已层层累积 — CAFE让轨迹内反馈与搜索策略共同演化。链接
- {检索} 多轮搜索的测试时扩展不能只相信模型自身置信度 — 轨迹是否真正取得证据,也应参与结果聚合。链接
- {推理加速} 稀疏、量化与低秩近似单独使用都会撞上精度—效率墙 — Compression Trinity考察三者能否互补而非叠加误差。链接
- {评测} 心理咨询中的短回应可能比信息密集的长回答更能传达倾听 — LLM评测需要区分「说得少」与「帮助少」。链接
- {代码智能} 从模型生成的错误代码反推测试用例,可同时补强验证器与密集奖励 — 这条路线直指测试覆盖率对代码RL奖励质量的限制。链接
- {评测} 深度研究报告的引用错误不一定来自最终写作者 — 按多Agent环节定位忠实性与引用召回问题,更有助于修复系统。链接
- {训练优化} 三值权重的低秩适配试图避免先反量化再合并 — 目标是在微调极低比特模型时保住原有的效率前提。链接
- {多模态} 没有原始训练数据,也可用改进的随机遮挡图像承载多教师知识 — IDeaL借此检验数据自由蒸馏需要多少真实视觉结构。链接
- {安全对齐} 把护栏前移到工具执行前并细化至步骤级,更接近可部署防线 — StepGuard同时显式权衡安全与任务效用。链接
- {AI for Science} 几何学习的不确定性协方差需要同时满足等变性与正定约束 — 这让张量预测的置信度也遵守与输出一致的几何结构。链接
今日观察
DiffusionOPSD、OPDVR和错误代码驱动的测试合成指向同一个训练设计问题:反馈究竟应该以多细的分辨率进入学习过程。终点信号擅长确认整条轨迹是否朝着正确方向前进,却难以定位具体该改哪一步;状态级、步骤级或token级信号能够提供修改坐标,但也更容易诱导模型迎合局部代理指标。关键不是用密集奖励取代稀疏奖励,而是让两者形成制衡:中间反馈负责分配信用、缩小搜索范围,可验证终点负责校准方向并阻止局部目标漂移。实践中,先逐段审计训练轨迹,找出奖励无法定位责任的位置,再为这些缺口补充对应粒度的监督,同时保留独立、可验证的终点验收作为锚点。

