VAST在CVPR 2026发表六项前沿研究,聚焦3D与几何可控世界模型

2026-06-18 14:31:21
来源:AI观察
分享

据VAST AI消息,在近期于美国丹佛闭幕的全球计算机视觉顶级会议CVPR 2026上,VAST AI Research有六篇论文入选,其中两篇获评Highlight论文。这些研究集中于3D基础模型与几何可控世界模型两大方向,旨在提升3D内容的几何表征能力,并为模型注入物理世界的几何先验。

LaFiTe: 3D原生高保真纹理生成

该Highlight论文提出LaFiTe模型,将3D纹理建模为稀疏潜在颜色场,以解决现有方法在跨视角一致性与高频细节生成上的难题。其核心方法通过VAE编码器压缩几何与外观信息,并利用修正流模型进行条件生成。实验表明,其纹理重建保真度较基线提升超10 dB PSNR,并可作为独立模块接入现有3D生成管线。

FACE: 高效高保真网格生成

另一篇Highlight论文FACE提出“one-face-one-token”策略,将每个三角面视为单个token,将序列长度缩短9倍,解决了自回归网格生成的计算瓶颈。该框架实现了0.11的端到端压缩比,理论计算成本降低81倍,能生成拓扑规整、可直接交付的网格模型。

GeoSAM2: 基于SAM2的交互式3D零件分割

该方法将3D零件分割重构为多视角2D预测任务,用户仅需在单一视角进行点选或框选即可交互控制。通过LoRA微调、残差融合等关键技术适配SAM2模型,在保持跨视角一致性的同时大幅提升速度。其在基准测试中达到SOTA,推理速度约30秒/模型,适用于零件级编辑等下游任务。

Beyond Reassembly: 含缺失碎片的断裂物体恢复

研究提出了“断裂物体恢复”新任务及首个联合学习模型,旨在处理碎片缺失的真实场景。模型通过mask token关联现有与缺失碎片,并联合优化碎片姿态估计与缺失部分形状预测。在新构建的数据集上,其在旋转误差、平移误差等多项指标上全面优于两阶段基线,可用于文物数字化复原。

Stereo World Model: 相机引导的立体视频生成

该研究提出了首个相机可控的立体世界模型StereoWorld,能够端到端生成立体视频。其通过统一的相机-帧RoPE和立体感知注意力分解两项关键设计,在保留预训练先验的同时建模双目几何。模型在立体一致性、视差精度等方面优于多阶段管线,推理速度提升约3倍,适用于VR渲染与具身智能。

UCPE: 可控视频生成的统一相机位置编码

UCPE提出了一种与相机模型无关的统一编码框架,包含Relative Ray Encoding和Absolute Orientation Encoding两部分,能够一致地编码完整的相机几何。该框架以极少的额外参数(占比不到1%)在多种异构相机下实现精准控制,达到了SOTA水平,可服务于自动驾驶、机器人感知等多种非标准相机配置。

原文:VAST @ CVPR 2026:3D 基础模型与几何可控世界模型的最新研究进展(来源:VAST AI)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME