图生三维与三维重建
从一张或多张照片恢复三维结构
三维专家 #32
输入图像三维
这项能力指什么
输入一张或多张图像,输出物体的三维表示——网格、点云、深度图或可渲染的辐射场。多视图输入时,几何由多张照片的视差共同约束,可信度更高;单图输入时未被拍到的部分只能靠先验推断。与「文生三维」的区别是几何与外观都被输入图像锚定。
技术上如何做到
多视图路线的核心是相机位姿估计加三角化,再优化稠密深度与表面,神经辐射场把场景编码成可微的体积场,用可微渲染对齐输入视图;三维高斯点云把场景表示成一堆带透明度与朝向的椭球,渲染更快。单图路线多靠大规模三维数据训练的先验模型直接预测,或借二维扩散先验做分数蒸馏。
代表产品
3相关机构
典型用途
- 文物与建筑的数字化存档
- 机器人与自动驾驶的空间感知
- 电商商品的三维化展示
- 影视与游戏的实景数字孪生
怎么评价它好不好
- Chamfer 距离
- 重建表面与真值表面的平均点距离
- F-score
- 在距离阈值内既不过多也不遗漏的均衡得分
- 新视角 PSNR / SSIM
- 从未拍摄的视角渲染,与真实照片的接近程度
边界与难点
- 单图重建在不可见区域完全是猜测,转动视角后才发现背面凭空生成
- 反光、透明、无纹理表面难以匹配,重建会大面积失败
- 输出的尺度与度量不准确,无法直接用于制造或工程测量