一段视频里,球滚下斜坡又突然向上加速。AI能认出“球”和“斜坡”,不等于它知道哪里不对。PhysVista要测的正是这道差距:VLM(视觉语言模型——能同时看画面、读文字并作答的模型)究竟理解了物体如何运动,还是只会识别画面、套用熟悉说法。
它把评测做成“看见—推断—核验”的闭环:先识别物体状态,再判断时间顺序和因果关系,最后给整段动态的物理合理性打分、排序。一个值得注意的设计是,它不仅问“事情有没有发生”,还测尺度层面的差别,例如幅度、数量、位置或比例是否准确;数据同时覆盖真实视频与AI生成视频,后者看起来逼真,却可能出现穿透、重力异常或因果次序错乱。
作者称,多种VLM的实验暴露出物理推理和合理性判断上的明显不足,说明“看懂画面”与“理解物理”之间仍有缺口。不过,现有供稿未给出具体模型得分,因此暂时更适合把PhysVista看作一套更完整的体检框架,而非能力排名的定论。