你拍下一间塞满桌椅、书本和杂物的房间,普通3D重建往往会交出一个“整体模型”:看起来像房间,但椅子和地板粘在一起,杯子也不能单独拿走。WorldSculpt想解决的正是这个问题。它不只把视频变成立体画面,而是把场景拆成一件件独立的3D物体,再按原来的位置拼回去。这样得到的世界才方便用于游戏、AR/VR、模拟和机器人。
这项工作的价值不只在“拆开”。拥挤场景里,一个物体往往只露出一角,其余部分被挡住。WorldSculpt尝试同时利用多个已知拍摄位置的画面,补全不可见部分,并把每件物体放进同一套空间坐标。以下性能结论和方法细节均来自论文作者,尚无独立复现或第三方评测。
先把世界拆成可拿取的东西
WorldSculpt的输出是一组独立的3D网格。3D网格(mesh)是由顶点和三角形拼出的物体表面数字骨架。桌子、杯子和椅子各有自己的网格,系统才能分别选择、移动或送进物理模拟器。
这叫组合式场景表示:世界不再是一整块不可拆的几何表面,而是一份“物体清单”,其中记录每件东西的形状与位置。所有物体还要共享一个世界坐标系——可以把它理解成整个房间共用的一把三维尺子。否则,各自生成得再完整,也可能无法正确拼回原处。
论文处理的输入并非任意普通视频。它假设系统已经知道相机的内外参数,也就是相机如何成像、拍摄时位于哪里;还需要每件物体在各画面中的实例掩码,以及粗略的三维定位框。实例掩码就是在图像里标出“哪些像素属于这件物体”。论文把获得这些前置信息视为范围之外的问题。
它怎样让多个视角说同一种空间语言?
WorldSculpt以单物体3D生成模型Pixal3D为基础。原版Pixal3D擅长根据一张图片生成一个物体,但一张图没有明确绑定统一的场景坐标,也很难处理不同画面共同提供的证据。
团队保留了这个模型已经学到的“物体通常长什么样”的生成先验——也就是模型从训练数据中形成的形状规律——再增加一条多视图条件通路。
它先为每件物体选择一个锚点视角。推理时,系统优先选物体显露得最完整的一帧。这个视角决定物体正面朝向,并建立一个规范化的立方体空间。系统把其他视角看到的内容都投影进这个立方体,让不同图片中的同一空间位置对齐。粗略定位框如果过紧,立方体还会扩大,直到覆盖所选画面里的物体掩码。
随后,DINOv3从每张图提取视觉特征。这里的“特征”不是像素原色,而是模型对局部外观和结构的数字描述。WorldSculpt把二维特征抬升到三维体素网格中。体素可以理解为3D空间里的像素小方块。多张图投向同一体素后,聚合模块先求平均,再学习哪些视角更值得参考;它不依赖输入顺序,也能接受数量可变的视角。
最后,这组对齐后的三维证据被送入Pixal3D的两个几何生成阶段:第一阶段判断哪些粗网格位置被物体占据,第二阶段补出更高分辨率的形状,再解码成网格。模型主要参数保持冻结,只训练新增的聚合、条件注入模块和LoRA。LoRA是一种轻量微调方法,只增加少量可训练参数来调整已有模型。
这个设计的关键,是把“看见的”和“猜出的”分工:多个视角负责约束可见几何,原有生成先验负责合理补全遮挡处。遮挡就是物体被其他东西挡住,只能看到部分表面。每件物体生成完成后,系统用之前记录的变换把它从规范空间放回世界坐标,全程不把不同物体熔成一个整体。
只学单件物体,为什么能处理拥挤场景?
团队没有用完整场景训练WorldSculpt,而只用规范空间中的单物体数据微调。为缩小干净训练图与杂乱实拍之间的差距,他们逐步给输入制造四类麻烦:二维或跨视角一致的遮挡、非锚点相机位姿误差、物体掩码边缘误差,以及降低分辨率。监督目标仍保持干净。模型因此先学会基本重建,再适应物体只露出一部分、画面很小或定位略有偏差的情况。
作者报告,在Toys4k单物体测试中,视角越多,WorldSculpt总体表现越好,遮挡严重时优势更明显。表中最极端的一组设置里,16视角版本的F-Score为0.929,而TRELLIS多图模式为0.484;F-Score用于综合衡量预测表面与真实表面的匹配程度,越高越好。由于供稿中的表头缺失了具体遮挡比例,这里不能进一步确认该列对应多少遮挡。
在组合场景评测中,WorldSculpt在真实采集的HouseCat6D上取得0.995的F-Score,在合成的Toys4k-Scene上为0.981;同表中次高的ShapeR分别为0.973和0.746。这里的物体直接放进共享世界坐标后比较,没有逐物体重新对齐,因此同时考察了形状和摆放位置。不过,这些仍是作者在自建评测流程中的结果。
数百个物体,重点是规模还是结构?
团队还发布了UE-MeshyScene,用来补足密集场景缺少逐物体真实网格的问题。这个基准由Unreal Engine 5.8渲染,包含机库、废弃城市室内、教堂、办公室、日本学校和沙漠城镇六个环境,共2,299件物体、5,964个视角。单个场景包含93至701件物体,并提供相机位姿、实例掩码、三维定位框、深度图和每件物体的真实网格。
论文称,WorldSculpt在单物体、受控多物体和UE-MeshyScene评测中均优于对比方法,而且场景越拥挤、遮挡越严重,提升越大。更值得关注的并非“数百个”这个规模标签本身,而是它展示了一条不同路线:不训练一个包办整个世界的大模型,而是复用成熟的单物体生成能力,把场景规模问题转化为许多个彼此独立、可以并行处理的物体问题。
作者还展示了把Marble和HY-World 2.0生成的3DGS世界转换成组合式网格场景的案例。3DGS是用大量三维高斯元素表示外观和空间的方式,适合渲染,但其中的物体通常没有天然分开。WorldSculpt因此可能充当一道“拆件工序”,让生成世界从可观看进一步走向可编辑。现有材料只证明了展示过这些案例,并不代表对其他系统普遍兼容,也不构成转换质量保证。
局限与未知
- WorldSculpt依赖相机参数、逐帧物体掩码和粗略三维定位框。论文没有把这些前置步骤纳入核心方法,因此不能据标题推断它能直接接收任何无位姿普通视频。
- 模型分别生成物体,不做跨物体融合或联合形状优化。材料没有披露物体接触、彼此穿插或整体物理一致性如何处理;纹理与材质阶段也被留作未来工作。
- 所有领先结论都来自论文自身。现有材料没有独立复现、统计显著性或真实世界数百物体场景的完整验证,因而“可扩展”目前更适合看作一项有力的可行性展示。