跳到正文
AI 图鉴

音乐与音效生成

按描述生成一段音乐或音效

语音与音乐入门 #30
输入文本音频

这项能力指什么

输入一段文字描述(可选带歌词或风格参考),输出一段音频,可以是完整歌曲,也可以是环境音或音效。它要同时处理旋律、和声、编曲与音色,比语音合成多出音乐结构这一层。与「语音合成」的区别是输出不属于语言,而是有节奏与调性的音频组织。

技术上如何做到

主流用音频潜空间表示加扩散或自回归生成:先把音频压成离散或连续的 token 序列,再按条件生成,最后解码回波形。训练时用「结构标签」帮助模型掌握前奏、主歌、副歌的段落顺序。歌词与人声则用单独的对齐与合成模块生成,再与伴奏混合成完整混音。

代表产品

3

相关机构

典型用途

  • 短视频与播客的背景音乐
  • 游戏与应用的音效素材
  • 广告与宣传片的配乐
  • 创作 demo 与编曲灵感

怎么评价它好不好

FAD
生成音频与真实音乐的分布距离,越低越好
MOS
主观听感平均意见分
人工偏好
成对比较旋律与编曲的悦耳程度

边界与难点

  • 长曲式结构容易崩,副歌重奏与编曲层次难以自洽
  • 歌词与旋律对齐不稳,咬字含糊,常出现念错或吞音
  • 模仿仍在保护期内的艺人风格存在版权风险,商业使用前需要核实

背后的概念