深度专题 FEATURES — 3
只用VLM,也能直接操纵机器人
Show-Harness给通用VLM配上一套“机器人按键”,无需重训也能逐步完成抓取与放置。
预训练最优,未必适合微调
一项30B模型研究发现:预训练阶段最亮眼的存档,未必是微调后的最佳起点。
动作中途变了,世界模型也能接住
ActionSplice让世界模型在视频生成途中接住新动作,不必等下一段,也不用回滚重算。
速览 BRIEFS — 9
PAPER
VLA在测试时重学世界规律
机器人换到新场地后,边试边重学当地的物理规律
PAPER
多Agent提示词也能反向优化
AgentGrad用逐个干预找出该改的Agent,再自动归纳提示词修改方向。
PAPER
LLM级联开始计算升级伤害
新路由器不只判断小模型会不会错,还计算换大模型后的净收益。
PAPER
长提示预填充也要赶截止时间
SLOWeave按出字期限动态切分长提示,在少卡顿的同时提高有效吞吐。
PAPER
量化会让模型更固执吗
低比特量化未必放大偏见,却可能让小模型更爱重复同一答案。
PAPER
MoE预填充搬上手机NPU
EStream让手机NPU按需加载MoE专家,以有限内存处理长提示
PAPER
两篇研究重画在策略蒸馏地图
两项研究重审在策略蒸馏:教师概率怎么传,比单点奖励更关键。
PAPER
公共GGUF可能开箱即坏
抽查327个公共量化模型,5个官方制品能运行却完全失效,部署前不能只看文件是否加载。
PAPER
接触感知让VLA先想象再下手
DeCAL把触觉写进机器人的“预演”,让VLA动手前先推测接触变化。