>_ DevTrendspl

Język

Strona główna

Języki

Sekcje

Frontend Backend Mobilne DevOps AI / ML GameDev Blockchain Systemy wbudowane Bezpieczeństwo
JavaScript

Jak generować muzykę z wokalem z tekstu i plików referencyjnych na karcie GPU

SongGeneration Studio

Chmurowe generatory muzyczne, takie jak Suno czy Udio, osiągają doskonałe rezultaty, lecz wymagają stałej subskrypcji, ograniczają dostępne kredyty i uzależniają od zewnętrznych serwerów. Jeśli chcesz uruchomić podobne narzędzie lokalnie, przez długi czas praktycznie nie było odpowiednich alternatyw. Większość otwartych sieci neuronowych mogła generować jedynie krótkie próbki tła bez wokaliów lub wymagała skomplikowanych operacji w konsoli.

Niedawno deweloper BazedFrog udostępnił projekt SongGeneration Studio. To wygodny interfejs webowy dla modelu LeVo, stworzonego przez badaczy z Tencent AI Lab. Aplikacja jest spakowana pod jednokliknięciowe uruchomienie przez instalator Pinokio, dzięki czemu możesz ją wdrożyć bez dogłębnej znajomości Pythona i PyTorch.

Co oferuje aplikacja

Projekt bazuje na modelu generatywnym zdolnym do syntezowania pełnego utworu audio z opisu tekstowego i tekstu piosenki. Interfejs webowy SongGeneration Studio przekształca ten silnik w pełnoprawne min studio.

Wewnątrz znajdziesz kilka głównych funkcji:

  • Budowniczy struktury kompozycji. Tekst piosenki można podzielić na logiczne bloki: intro, zwrotki, refren, most i końcowe outro. Pomaga to sieci neuronowej zbudować prawidłową formę muzyczną.
  • Szczegółowa personalizacja stylu. Wybierasz gatunek (od pop i hip-hopu po metal i jazz), nastrój emocjonalny, tempo w BPM, a także typ wokalisty i zestaw instrumentów prowadzących.
  • Klonowanie stylu z pliku audio. Jeśli wgrasz utwór referencyjny, model spróbuje skopiować jego charakter, rytm i ogólne brzmienie podczas tworzenia nowej piosenki.
  • Separacja multitrack. Wynik daje ci nie tylko zmiksowany utwór, ale także osobne ścieżki: czyste wokale i aranż instrumentalny.
  • Menedżer projektów i eksport. Wszystkie wygenerowane utwory są zapisywane we wbudowanej bibliotece. Gotowy rezultat można wyeksportować w bezstratnym formacie FLAC lub jako plik wideo MP4 z okładką.

Separacja izolowanych wokaliów i instrumentów ułatwia życie tym, którzy są przyzwyczajeni do dopracowywania materiału w DAW, takich jak Ableton, FL Studio czy Logic. Próbki można łatwo przetwarzać efektami, przycinać lub nakładać na własny beat.

Wymagania sprzętowe i instalacja

Głównym ograniczeniem projektu są zasoby. Model LeVo jest wymagający jeśli chodzi o pamięć wideo.

Potrzebujesz karty NVIDIA z co najmniej 10 GB pamięci VRAM. Jednak dla stabilnej generacji długich utworów w wysokiej jakości deweloperzy zalecają posiadanie 24 GB pamięci wideo. Potrzebujesz około 50 GB wolnego miejsca na dysku twardym, ponieważ same wagi modelu zajmują około 15 GB.

Wdrożenie systemu jest niezwykle proste dzięki platformie Pinokio:

  1. Uruchom Pinokio.
  2. Wyszukaj SongGeneration Studio.
  3. Kliknij przycisk instalacji.

Instalator automatycznie zainstaluje wymaganą wersję Pythona, pobierze zależności i załaduje wagi modelu. Po zakończeniu wystarczy kliknąć Start, a interfejs otworzy się w przeglądarce.

Jak działa proces generacji

Po uruchomieniu interfejsu webowego tworzenie piosenki składa się z czterech kroków:

  1. Wprowadzenie tekstu i znaczniki. Wklejasz tekst piosenki i rozdzielasz go między bloki utworu.
  2. Wybór parametrów stylu. Ustawiasz gatunek, nastrój, głos wokalisty i instrumenty.
  3. Dodanie referencji w razie potrzeby. Wgranie krótkiego fragmentu muzycznego pomaga utrwalić pożądane brzmienie.
  4. Uruchomienie generacji. Obliczenie jednego utworu trwa zwykle od 3 do 6 minut.

Z własnych obserwacji: jakość wokaliów bezpośrednio zależy od rytmicznej struktury tekstu. Jeśli wrzucisz ciągły tekst bez rymu i wyraźnego metrum, sieć neuronowa zaczyna się gubić, rozciągać samogłoski lub „połykać" końcówki. Jeśli podzielisz tekst na nawet czterowierszowe strofy, wynik wychodzi znacząco czystszy.

Funkcja kolejki zadań również działa interesująco. Możesz przygotować kilka wariantów tekstu na raz i wysłać je do generacji w tle, a następnie wybrać najlepszy wynik z biblioteki.

Ograniczenia i ogólne wrażenia

Narzędzie nie jest jeszcze w stanie w pełni zastąpić nagrania studyjnego ani profesjonalnego aranżera. Czasami wokale mogą brzmieć lekko syntetycznie, a generacja na kartach z 10 GB pamięci VRAM może natrafić na limit pamięci przy zbyt długich tekstach. Dodatkowo projekt jest wciąż młody — repozytorium ma około 550 gwiazdek i około dwudziestu otwartych zgłoszeń.

Niemniej SongGeneration Studio staje się doskonałym narzędziem do szybkich eksperymentów. Będzie przydatne dla niezależnych twórców gier tworzących ścieżki dźwiękowe, twórców treści pozyskujących muzykę w tle bez problemów z prawami autorskimi oraz muzyków generujących szybkie pomysły na dema.

Powiązane projekty