深度专题 FEATURES — 2
TourPhysics:单图世界也要懂物理
从一张照片出发,让世界模型分清“换个角度看”和“真的动手改变”。
推测解码闯进RL训练环
让草稿模型跟着策略一起学,NVIDIA 把推测解码推进了长上下文 RL 最昂贵的 rollout 环节。
速览 BRIEFS — 8
PAPER
同一请求,量化后答案会分叉
本应只提速的前缀缓存,在四比特量化下让同一请求更容易走向不同答案。
PAPER
缩放定律也能少做实验
用已有试跑训练“预报员”,把缩放定律从穷举网格改成按需实验。
PAPER
VLA在线强化学习瞄准精细操作
让机器人边做边学,同时校准判断,在精细操作中兼顾成功率与训练效率。
PAPER
视频预训练数据管线走向开放
VidaForge开放视频清洗全流程,让训练数据的取舍终于可追溯、可比较。
PAPER
机器人奖励模型会被改写指令骗过
同一段机器人动作,只换指令说法,部分模型就会把失败改判为成功。
PAPER
MoE专家数可以免训练减半
少调用一半专家,只调整权重缩放;作者称几乎保住测试成绩,无需再训练。
PAPER
扩散语言模型一步写代码
PlaidQ 用连续扩散并行写代码,蒸馏后把数百轮生成压到 16 步,极端时只需一步。
PAPER
LLM如何拼接互相冲突的证据
模型即使识破错误证据,仍可能照单全收;可靠 Agent 不能只靠“先验证再使用”。