跳到正文
AI 图鉴

文生三维

用一句话生成一个三维模型

三维进阶 #31
输入文本三维

这项能力指什么

输入文字描述,输出三维资产:网格、带纹理的模型或可渲染的三维表示。输出不是图像也不是视频,而是可以从任意视角观察、放进的场景里的几何。与「图生三维」的区别是完全没有参考图,与「文生图」的区别是输出具有真正的第三维。

技术上如何做到

一条路线借二维生成模型做监督:让二维扩散模型给不同视角的图像打分,反过来优化三维表示(如神经辐射场或高斯点云),即分数蒸馏;另一条路线用大规模三维数据直接训练生成模型,一次性或分步输出网格与纹理。输出网格往往还要做重拓扑与减面,才能进入常规渲染与游戏管线。

代表产品

2

相关机构

典型用途

  • 游戏与影视的道具与场景草模
  • 电商商品的快速三维展示
  • 工业设计的概念实体化
  • 教育与科普的三维示意

怎么评价它好不好

CLIP 相似度
渲染视图与提示词的语义一致度
Chamfer 距离
生成网格与参考网格表面点的平均距离
人工评分
按形状完整度与纹理质量打分

边界与难点

  • 生成的网格拓扑常是破碎的三角面,需要大量重拓扑才能直接使用
  • 背面与内部结构靠臆测,转动视角后会出现不合理的空洞与穿插
  • 材质、光照与几何没有真正分离,导出到其他引擎后质感对不上

背后的概念