据VAST AI消息,在近期于美国丹佛闭幕的全球计算机视觉顶级会议CVPR 2026上,VAST AI Research有六篇论文入选,其中两篇获评Highlight论文。这些研究集中于3D基础模型与几何可控世界模型两大方向,旨在提升3D内容的几何表征能力,并为模型注入物理世界的几何先验。
LaFiTe: 3D原生高保真纹理生成
该Highlight论文提出LaFiTe模型,将3D纹理建模为稀疏潜在颜色场,以解决现有方法在跨视角一致性与高频细节生成上的难题。其核心方法通过VAE编码器压缩几何与外观信息,并利用修正流模型进行条件生成。实验表明,其纹理重建保真度较基线提升超10 dB PSNR,并可作为独立模块接入现有3D生成管线。
FACE: 高效高保真网格生成
另一篇Highlight论文FACE提出“one-face-one-token”策略,将每个三角面视为单个token,将序列长度缩短9倍,解决了自回归网格生成的计算瓶颈。该框架实现了0.11的端到端压缩比,理论计算成本降低81倍,能生成拓扑规整、可直接交付的网格模型。
GeoSAM2: 基于SAM2的交互式3D零件分割
该方法将3D零件分割重构为多视角2D预测任务,用户仅需在单一视角进行点选或框选即可交互控制。通过LoRA微调、残差融合等关键技术适配SAM2模型,在保持跨视角一致性的同时大幅提升速度。其在基准测试中达到SOTA,推理速度约30秒/模型,适用于零件级编辑等下游任务。
Beyond Reassembly: 含缺失碎片的断裂物体恢复
研究提出了“断裂物体恢复”新任务及首个联合学习模型,旨在处理碎片缺失的真实场景。模型通过mask token关联现有与缺失碎片,并联合优化碎片姿态估计与缺失部分形状预测。在新构建的数据集上,其在旋转误差、平移误差等多项指标上全面优于两阶段基线,可用于文物数字化复原。
Stereo World Model: 相机引导的立体视频生成
该研究提出了首个相机可控的立体世界模型StereoWorld,能够端到端生成立体视频。其通过统一的相机-帧RoPE和立体感知注意力分解两项关键设计,在保留预训练先验的同时建模双目几何。模型在立体一致性、视差精度等方面优于多阶段管线,推理速度提升约3倍,适用于VR渲染与具身智能。
UCPE: 可控视频生成的统一相机位置编码
UCPE提出了一种与相机模型无关的统一编码框架,包含Relative Ray Encoding和Absolute Orientation Encoding两部分,能够一致地编码完整的相机几何。该框架以极少的额外参数(占比不到1%)在多种异构相机下实现精准控制,达到了SOTA水平,可服务于自动驾驶、机器人感知等多种非标准相机配置。
原文:VAST @ CVPR 2026:3D 基础模型与几何可控世界模型的最新研究进展(来源:VAST AI)
