文生三维
用一句话生成一个三维模型
三维进阶 #31
输入文本三维
这项能力指什么
输入文字描述,输出三维资产:网格、带纹理的模型或可渲染的三维表示。输出不是图像也不是视频,而是可以从任意视角观察、放进的场景里的几何。与「图生三维」的区别是完全没有参考图,与「文生图」的区别是输出具有真正的第三维。
技术上如何做到
一条路线借二维生成模型做监督:让二维扩散模型给不同视角的图像打分,反过来优化三维表示(如神经辐射场或高斯点云),即分数蒸馏;另一条路线用大规模三维数据直接训练生成模型,一次性或分步输出网格与纹理。输出网格往往还要做重拓扑与减面,才能进入常规渲染与游戏管线。
代表产品
2相关机构
典型用途
- 游戏与影视的道具与场景草模
- 电商商品的快速三维展示
- 工业设计的概念实体化
- 教育与科普的三维示意
怎么评价它好不好
- CLIP 相似度
- 渲染视图与提示词的语义一致度
- Chamfer 距离
- 生成网格与参考网格表面点的平均距离
- 人工评分
- 按形状完整度与纹理质量打分
边界与难点
- 生成的网格拓扑常是破碎的三角面,需要大量重拓扑才能直接使用
- 背面与内部结构靠臆测,转动视角后会出现不合理的空洞与穿插
- 材质、光照与几何没有真正分离,导出到其他引擎后质感对不上