判断两个物体会不会相撞,光靠文字描述轨迹并不直观;人往往会顺手画条线。ReImaGin 就让 AI 这么做:多模态模型——能同时处理文字和图像的模型——在推理途中调用图像生成器,把临时画面当成草稿纸,再观察草图并继续作答。
它的关键不是生成漂亮图片,而是提供一种自由度更高的视觉操作。例如预测碰撞时,模型可以从运动物体前方画出轨迹线,看它先碰到谁;面对多个房间视角,也可以尝试合成平面图。以往的视觉工具调用多依赖目标检测、深度估计等专用模块,每件工具只做固定工作;这里用自然语言指挥同一个生成模型,还能与裁剪、叠加等确定性操作配合。
作者在深度判断、遮挡计数、多视角空间推理等六类任务上测试,并自述该方法持续胜过纯文字推理和固定视觉工具基线:路径追踪任务最高提升 25%,遮挡计数相对提升 40%。研究还用一小批开发样例自动寻找合适的“画法”,多数收益无需人工示范即可保留。不过,中间图像毕竟由模型生成;草图若画错,也可能把后续推理带偏。