跳到正文
AI 图鉴

图生三维与三维重建

从一张或多张照片恢复三维结构

三维专家 #32
输入图像三维

这项能力指什么

输入一张或多张图像,输出物体的三维表示——网格、点云、深度图或可渲染的辐射场。多视图输入时,几何由多张照片的视差共同约束,可信度更高;单图输入时未被拍到的部分只能靠先验推断。与「文生三维」的区别是几何与外观都被输入图像锚定。

技术上如何做到

多视图路线的核心是相机位姿估计加三角化,再优化稠密深度与表面,神经辐射场把场景编码成可微的体积场,用可微渲染对齐输入视图;三维高斯点云把场景表示成一堆带透明度与朝向的椭球,渲染更快。单图路线多靠大规模三维数据训练的先验模型直接预测,或借二维扩散先验做分数蒸馏。

代表产品

3

相关机构

典型用途

  • 文物与建筑的数字化存档
  • 机器人与自动驾驶的空间感知
  • 电商商品的三维化展示
  • 影视与游戏的实景数字孪生

怎么评价它好不好

Chamfer 距离
重建表面与真值表面的平均点距离
F-score
在距离阈值内既不过多也不遗漏的均衡得分
新视角 PSNR / SSIM
从未拍摄的视角渲染,与真实照片的接近程度

边界与难点

  • 单图重建在不可见区域完全是猜测,转动视角后才发现背面凭空生成
  • 反光、透明、无纹理表面难以匹配,重建会大面积失败
  • 输出的尺度与度量不准确,无法直接用于制造或工程测量

背后的概念