医生移动超声探头时,画面会随位置和角度改变。要让机器学会自主扫描,通常得给每一帧画面配上当时的探头位姿——也就是位置和朝向。这需要额外的追踪、校准和同步设备,而常规临床视频往往没有这些记录。UltraWorld想绕开这道数据门槛,从“未追踪”的既有视频中学习超声画面如何变化。
它先把视频基础模型改造成超声生成器,再沿3D解剖结构中预设的扫描轨迹,合成带动作条件的视频。随后通过自蒸馏——用同一体系生成的数据反过来训练模型——得到能根据局部画面和探头动作预测后续画面的超声世界模型。其关键设计 AsMap(Acoustic Sampling Map,声学采样图)把探头位姿和成像设置展开成逐像素的3D采样位置、声束方向与深度,让模型不只知道“探头动了”,还知道每个像素将从哪里取样。
作者报告,在9次模拟闭环局部规划中,UltraWorld相较视觉伺服将最终目标距离和方向误差平均降低29%和38%。不过验证仍限于模拟规划;它降低的是对真实视频—位姿配对的依赖,并非完全不使用3D解剖资产来构造训练监督。