>_ DevTrendszh

语言

首页

语言

板块

前端 后端 移动端 DevOps AI / ML 游戏开发 区块链 嵌入式 安全
JavaScript

如何在 GPU 上通过文本和参考音频生成带人声的音乐

SongGeneration Studio

像 Suno 或 Udio 这样的云端音乐生成器效果出色,但需要持续订阅、限制积分额度,并且依赖外部服务器。若您想在本地运行类似工具,长期以来几乎没有合适的替代方案。大多数开源神经网络只能生成无人声的短背景样本,或需要复杂的控制台操作。

最近,开发者 BazedFrog 发布了 SongGeneration Studio 项目。这是腾讯 AI Lab 研究人员创建的 LeVo 模型的便捷 Web 界面。该应用通过 Pinokio 安装程序实现一键启动,无需深入了解 Python 和 PyTorch 即可部署。

应用功能

该项目基于生成模型,能够从文本描述和歌词合成完整的音轨。SongGeneration Studio 的 Web 界面将这个引擎转变为一个功能完整的迷你工作室。

内置的主要功能包括:

  • 曲式结构构建器。歌词可划分为逻辑段落:前奏、 verse、主歌、副歌、桥段和结尾。这有助于神经网络构建正确的音乐形式。
  • 详细的风格自定义。您可选择流派(从流行、嘻哈到金属和爵士)、情感基调、节拍速度(BPM),以及人声类型和主奏乐器组合。
  • 从音频文件克隆风格。上传参考曲目后,模型会在创作新歌曲时尝试复制其特征、节奏和整体声音。
  • 多轨道分离。输出不仅有混音轨道,还包含分轨:纯净人声和器乐编曲。
  • 项目管理与导出。所有生成的曲目都保存在内置曲库中。完成的作品可导出为无损 FLAC 格式或带封面艺术的 MP4 视频文件。

分离出纯净的人声和器乐轨道对那些习惯在 DAW(如 Ableton、FL Studio 或 Logic)中精调素材的人很有帮助。样本可以轻松添加效果、修剪或叠加到自己的节拍上。

硬件要求与安装

该项目的主要限制在于资源需求。LeVo 模型对显存要求较高。

您需要配备至少 10 GB 显存的 NVIDIA 显卡。不过,为了稳定生成高质量的长音轨,开发者建议使用 24 GB 显存。硬盘需要约 50 GB 可用空间,因为模型权重本身就占用约 15 GB。

通过 Pinokio 平台部署非常简单:

  1. 启动 Pinokio。
  2. 搜索 SongGeneration Studio。
  3. 点击安装按钮。

安装程序会自动安装所需的 Python 版本、下载依赖项并加载模型权重。完成后点击启动,界面会在浏览器中打开。

生成过程如何运作

启动 Web 界面后,创建歌曲需要四个步骤:

  1. 文本输入与标记。您粘贴歌词并将其分配到歌曲的各个段落。
  2. 风格参数选择。设置流派、情绪、人声和乐器。
  3. 如需要可添加参考音频。上传一段音乐片段有助于锁定所需的声音设计。
  4. 开始生成。计算一条音轨通常需要 3 到 6 分钟。

根据个人观察:人声质量直接取决于文本的节奏结构。如果直接输入没有韵律和清晰节拍的连续文本,神经网络会开始卡顿、拖长元音或吞掉结尾。如果将文本分成整齐的四行诗节,结果会明显更清晰。

任务队列功能也很有趣。您可以一次性准备多个文本变体并发送到后台生成,然后从曲库中选择最佳结果。

局限性及总体印象

该工具目前还无法完全替代录音室录制或专业编曲。人声有时会略显合成感,在 10 GB 显存的显卡上生成过长的文本可能会遇到内存限制。此外,项目还处于早期阶段——仓库约有 550 颗星和约二十个开放 issue。

尽管如此,SongGeneration Studio 正在成为一个出色的快速实验工具。它对独立游戏开发者创建配乐、内容创作者获取无版权问题的背景音乐,以及音乐人快速生成演示创意都很有帮助。

相关项目