音乐与音效生成
按描述生成一段音乐或音效
语音与音乐入门 #30
输入文本音频
这项能力指什么
输入一段文字描述(可选带歌词或风格参考),输出一段音频,可以是完整歌曲,也可以是环境音或音效。它要同时处理旋律、和声、编曲与音色,比语音合成多出音乐结构这一层。与「语音合成」的区别是输出不属于语言,而是有节奏与调性的音频组织。
技术上如何做到
主流用音频潜空间表示加扩散或自回归生成:先把音频压成离散或连续的 token 序列,再按条件生成,最后解码回波形。训练时用「结构标签」帮助模型掌握前奏、主歌、副歌的段落顺序。歌词与人声则用单独的对齐与合成模块生成,再与伴奏混合成完整混音。
代表产品
3相关机构
典型用途
- 短视频与播客的背景音乐
- 游戏与应用的音效素材
- 广告与宣传片的配乐
- 创作 demo 与编曲灵感
怎么评价它好不好
- FAD
- 生成音频与真实音乐的分布距离,越低越好
- MOS
- 主观听感平均意见分
- 人工偏好
- 成对比较旋律与编曲的悦耳程度
边界与难点
- 长曲式结构容易崩,副歌重奏与编曲层次难以自洽
- 歌词与旋律对齐不稳,咬字含糊,常出现念错或吞音
- 模仿仍在保护期内的艺人风格存在版权风险,商业使用前需要核实