GPU上でテキストと参照音声からボーカル付き音楽を生成する方法

SunoやUdioのようなクラウドベースの音楽生成ツールは優れた結果をしますが、定期的なサブスクリプションが必要で、クレジットに制限があり、外部サーバーに依存します。同様のツールをローカルで実行したい場合、長い間実質的に適切な代替手段がありませんでした。ほとんどのオープンソースのニューラルネットワークは、ボーカルなしの短いバックグラウンドサンプルの生成しかできなかったり、複雑なコンソール操作が必要だったりしました。
最近、開発者のBazedFrogがSongGeneration Studioプロジェクトを公開しました。これは、Tencent AI Labの研究者が作成したLeVoモデル用の便利なWebインターフェースです。このアプリケーションはPinokioインストーラーを通じてワンクリックで起動できるようにパッケージ化されているため、PythonやPyTorchの詳細な知識がなくてもデプロイできます。
このアプリケーションできること
このプロジェクトは、テキストの説明と歌詞から完全なオーディオトラックを合成できる生成モデルをベースにしています。SongGeneration StudioのWebインターフェースは、このエンジンを本格的なミニスタジオに変えます。
内部には、いくつかの主要な機能があります:
- 作曲構造ビルダー。歌詞をイントロ、ヴァース、コーラス、ブリッジセクション、ファイナルアウトロといった論理的なブロックに分割できます。これにより、ニューラルネットワークが正しい音楽形式を構築するのに役立ちます。
- 詳細なスタイルカスタマイズ。ジャンル(ポップ、ヒップホップからメタルのジャズまで)、感情的なトーン、BPMでのテンポ、声質、そしてリード楽器のセットを選択できます。
- オーディオファイルからのスタイルクローニング。参照トラックをアップロードすると、モデルは新しい曲を作成する際にそのキャラクター、リズム、全体的なサウンドをコピーしようとします。
- マルチトラック分離。出力は混合トラックだけでなく、クリーンなボーカルと楽器アレンジの個別のステムも提供します。
- プロジェクトマネージャーとエクスポート。生成されたすべてのトラックは組み込みライブラリに保存されます。完成した結果は、ロスレスFLAC形式またはカバアート付きのMP4ビデオファイルとしてエクスポートできます。
isolatedボーカルと楽器を分離できることは、Ableton、FL Studio、LogicなどのDAWで素材を洗練させることに慣れている人にとって便利です。サンプルは簡単にエフェクトで処理したり、トリミングしたり、自分のビートの上にレイヤリングしたりできます。
ハードウェア要件とインストール
このプロジェクトの主な制限はリソースに関連しています。LeVoモデルはビデオメモリ требованияです。
NVIDIA GPUでVRAMが少なくとも10 GB必要になります。ただし、長いトラックを高品質で安定して生成するには、24 GBのビデオメモリを持っていることが開発者のおすすめです。ハードドライブに約50 GBの空き容量が必要です。モデルウェイト自体が約15 GBを占めるためです。
Pinokioプラットフォーム 덕분에システムのデプロイは非常に簡単です:
- Pinokioを起動します。
- SongGeneration Studioを検索します。
- インストールボタンをクリックします。
インストーラーは自動的に必要なPythonバージョンをインストールし、依存関係をダウンロードし、モデルウェイトを読み込みます。完了したら、Startをクリックするだけで、ブラウザでインターフェースが開きます。
生成プロセスの仕組み
Webインターフェースを起動した後、曲の作成は4つのステップで構成されます:
- テキスト入力とマークアップ。歌詞を貼り付けて、曲のブロックに распределитьします。
- スタイルパラメータの選択。ジャンル、ムード、ボーカルの声、楽器を設定します。
- 必要に応じて参照を追加。短い音楽クリップをアップロードすると、希望のサウンドデザインを固定できます。
- 生成を開始。1トラックの計算には通常3〜6分かかります。
個人的な観察から:ボーカル品質はテキストのリズム構造に直接依存します。韻や明確な拍子なしで連続テキストを投げ込むと、ニューラルネットワークはつまずき始め、母音を伸ばしたり、語尾を「飲み込んだり」します。テキストを4行のスタンザに分割すると、結果は著しくクリーンになります。
タスクキュー機能も興味深い働きをします。複数のテキストバリエーションを一度に準備してバックグラウンド生成に送信し、ライブラリから最良の結果を選択できます。
制限事項と全体的な印象
このツールはまだスタジオ録音やプロフェッショナルなアレンジャーを完全に置き換えることはできません。ボーカルがわずかにシンセティックに聞こえることもありますし、10 GBのVRAMカードでの生成は 長すぎるテキストでメモリ制限に達する可能性があります。さらに、このプロジェクトはまだ若く—リポジトリは約550のスターと約20の未解決のイシューがあります。
それでも、SongGeneration Studioは迅速な実験のための優れたツールになりつつあります。サウンドトラックを作成するインディーゲーム開発者、著作権の問題なしにバックグラウンド音楽を取得するコンテンツクリエイター、迅速なデモアイデアを生成するミュージシャンにとって便利です。
関連プロジェクト