今日概览

  • 特权信息可能让自蒸馏性能下降:DAPD用双路径与双来源锚定限制不可复现的教师行为,在Qwen3-4B多项任务上平均提升2.00分。
  • 提前暴露未来轨迹会污染驾驶推理监督,Deferred Exposure先让模型选择候选轨迹,再用真实轨迹验证,避免教师为既成结果补写理由。
  • 成熟自回归模型可低成本迁移到扩散解码。 DiffusionGemma使用不到原模型10%的训练token预算,单张H100吞吐约1500token/s。
  • 语义RGBA图层让生成结果可以继续编辑;UniWorld-Design将对象作为独立资产交付,在Crello基准上降低37%的逐图层RGB误差。

重点关注

训练优化 特权信息越多,学生反而学得越差

教师掌握更多信息,竟可能让自蒸馏后的模型性能下降。问题不只是能力差距,而是「特权幻觉」:教师依赖训练时可见的额外信息做出正确行为,学生却在推理时拿不到这些信息,仍被训练得仿佛它们存在。DAPD用双路径锚定加入一条由学生自身条件构成的桥梁,只在信息相匹配的路径间对齐教师与学生,避免把学生无法复现的行为硬塞过去;再用双来源锚定进行双向约束,在保留正确性监督的同时,降低对特权教师的依赖。摘要报告称,该方法在Qwen3-4B的多项任务上平均超过常规在线自蒸馏2.00分,增益还随规模保持,在4B和32B模型上分别达到2.69和2.78分。更值得注意的启示是,后训练不能只问教师「够不够强」,还要检查每个监督信号是否建立在学生推理时可达的信息之上;具体实验设置与代价仍需看全文确认。

要点: 设计蒸馏管线时,应把训练与推理的信息边界列为一等约束;教师依赖学生不可见的信息时,更强监督也可能制造不可复现行为;双锚点的价值在于同时保留正确性指导,并限制知识转移在学生可达范围内

原文:DAPD: Dual-Anchored Policy Distillation


机器人 先看答案再写理由,自动驾驶模型真的学会决策了吗?

把车辆的真实未来轨迹提前交给教师模型,监督任务就从「根据当下场景做决策」悄悄变成了「为既成结果补写理由」。论文将这种现象称为轨迹锚定偏差:生成的思维链看似合理,因果上却未必忠实,在需要辨别关键因果关系的场景中还会带来更严重的幻觉。直接隐藏真实轨迹也不够,因为让模型开放式生成轨迹,会把高层决策与精确几何、车辆动力学混在一起。作者因此把规划改造成候选轨迹选择题,并在模型作出选择后才暴露真实轨迹,用它作为强化学习的验证目标;摘要报告称,这能改善驾驶推理,同时维持甚至增强通用视觉能力。对生产自动驾驶训练数据的团队,更重要的检查项不只是解释写得是否流畅,而是标注者在推理时是否提前看见了本应预测的结果。

要点: 审计推理数据时,应检查未来信息是否泄漏进教师上下文;「能解释已发生动作」不能证明模型能从当前场景独立决策;候选轨迹选择可把高层规划与低层轨迹生成解耦,但泛化效果仍需看全文和更多场景验证

原文:Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs


推理加速 DiffusionGemma从成熟模型迁移到扩散解码

扩散式文本生成真正有意思的突破,可能不是一次并行处理256个token,而是成熟的自回归模型可以直接迁移过去。DiffusionGemma以Gemma 4为底座,用不到原模型训练token预算的10%完成两阶段微调,先学习双向去噪,再通过强化学习和采样器蒸馏兼顾质量与效率。报告称,它在单张NVIDIA H100上平均每次前向生成约20个token,吞吐约1500 token/s,并显著快于采用先进推测解码的自回归模型。更有潜力的是,模型仍能以较小性能损失进行自回归生成,为扩散与自回归混合解码留下了空间。不过这仍是实验性开放权重模型,并行处理256个token不等于端到端加速256倍,工程价值还要看质量、迭代次数和硬件利用率能否同时兑现。

要点: 成熟自回归模型可以低成本迁移到扩散解码,不必从零训练;评估推理加速应看端到端吞吐与质量,而不是并行token数量;混合扩散与自回归解码值得做生成基础设施的团队持续关注

原文:DiffusionGemma Technical Report


图像生成 生成模型的下一步,是交付可继续工作的设计稿吗?

扁平图片一旦进入后续设计流程,局部移动、删除和复用都会暴露结构缺失的问题。UniWorld-Design把语义RGBA图层——带透明通道、对应完整对象的独立资产——作为生成、理解和编辑的基本单位,既能从文本生成素材,也能把成图拆成有顺序的完整图层。由于模型学习的是完整对象而非可见像素切片,移走或删除某个图层后,其余内容仍有望保持可用,这有望降低后续修改、复用和代理式编辑的成本。在Crello基准上,它将逐图层RGB误差降低37%,Alpha Soft IoU相对提升34%,但这些指标能否转化为真实设计流程中的时间节省,仍需看全文和实际工作流验证。对做设计工具或内容生产Agent的团队来说,值得重新评估的不是模型能否再多画好一点,而是输出是否保留了足够的结构。

要点: 评估图像模型时,把可编辑性和交付结构纳入画质之外的核心指标;语义RGBA图层有望降低素材修改、复用和自动化协作成本;基准提升值得关注,但真实设计流程中的可用性仍需验证

原文:UniWorld-Design: From Pixel Generation to Layer-Native Design

也值得关注

  • {视频生成} JoyAI-Video-Edit把实时视频编辑改造成无未来帧、无预设时长的因果生成问题 — 重点是在持续编辑长视频时同时维持低延迟、源视频保真与时间一致性。链接
  • {模型架构} AURORA-LM不再为了扩散而过度压缩文本潜变量 — 它联合学习兼顾生成与精确解码的连续语言表示。链接
  • {评测} AgentStream检验自进化Agent的经验能否经受持续变化的任务流 — 流式评测重新审视独立任务上的积累是否仍然有效。链接
  • {多模态} OmniPack在极低token预算下按查询保留跨时空证据 — 压缩器需要判断哪些音视频信息不能丢失。链接
  • {推理} TurnSight用逐轮后见信息为长链工具调用分配训练信号 — 它尝试摆脱整条轨迹只有一个结果奖励的粗粒度监督。链接
  • {训练优化} PCSD用跨位置的持续一致性判断教师信号是否可信 — 目标是避免自蒸馏因单个token的偶然分歧频繁切换监督来源。链接
  • {检索} DocNavRAG让Agent沿文档结构有状态地构造证据 — 它在固定图遍历与无结构工具调用之间提供了另一条路径。链接
  • {检索} RING把外部检索到的知识注入生成模型 — 它尝试以训练和架构成本换取更低的上线延迟与系统复杂度。链接
  • {机器人} Principles of Robot Autonomy从现场部署视角梳理完整自治栈 — 这份综述可作为理解机器人自主性成熟方法与工具的实践入口。链接
  • {可解释性} 字母大小写可能像视觉显著性线索一样调制模型注意力 — Attention is Case-Sensitive提示提示词格式本身也是干预变量。链接
  • {多模态} SEER用查询绑定的局部证据减少空间判断中的实例误选 — 空间关系失败有时并非没认出物体,而是选错了指代对象。链接

今日观察

DAPD、Deferred Exposure、TurnSight与PCSD共同指向同一个后训练审计问题:监督密度增加,并不自动意味着学习信号更好。教师若看过答案、真实未来轨迹或逐轮后见上下文,确实可能产出更完整的解释与更细的反馈,但其中也可能混入学生部署时无法获得的证据、为结果补写的因果链,以及由局部偶然一致性制造的噪声。这样的教师可以在训练日志中显得更聪明,却未必提供学生能够独立复现的策略。

因此,后训练评估不能只看最终奖励是否上升,还要分别检查决策可达性与跨步骤一致性:移除特权信息后,学生是否仍能作出同样选择;把监督放进更长的交互轨迹后,策略是否继续稳定。下一轮构造教师分支时,应为每类答案、未来状态和后见上下文登记明确的可见边界,并加入「移除特权信息后的决策复现率」和「跨步骤一致率」两项独立验证。