MiniMax opublikował MiniMax-Music3, otwarty model do generowania muzyki z tekstu, którzy w jednym kroku potrafi wytworzyć całą piosenkę trwającą do pięciu minut. Dane wejściowe stanowią teksty z tagami sekcji i szczegółowy opis muzyczny, a wynik to 32 kHz, 16-bitowy stereo WAV gotowy do użytku. Architektura łączy Hybrid-LM, czyli 8-miliardowy globalny model LLM z 0,6-miliardowym modelem lokalnym, ze stosem syntezy opartym na flow matching i Flow-VAE.

Co wyróżnia MiniMax-Music3, to fakt że wszystko zostało opublikowane od razu - wagi modelu, kod do inferencji i trzy udokumentowane ścieżki deploymentu. Oznacza to że nie jest to kolejny research preview dostępny kiedyś w przyszłości, ale rzeczywisty narzędzie które można zacząć używać teraz. Licencja MiniMax-Music3 Community pozwala na użytek komercyjny, choć wymaga wyraźnego wyświetlania nazwy modelu w interfejsie produktu. Organizacje, które zarobią powyżej 20 milionów dolarów rocznie na narzędziach wykorzystujących ten model, będą musiały uzyskać osobną autoryzację od MiniMax.

To otwiera możliwości dla solo creatorów, małych studiów i zespołów mid-market, którzy mogli dotychczas patrzeć na generowanie muzyki jako na nieosiągalny koszt. Model ma potencjał w grach - dla adaptacyjnej muzyki poziomów, w reklamach i branding soniczny, w podcastach, aplikacjach fitness, narzędziach do tworzenia treści UGC i retail audio. Każdy kto będzie hostować generowanie dla innych będzie musiał wdrożyć ochronę przed naruszającą autorskie prawa muzyki, ale ograniczenia techniczne wydają być rozsądne w stosunku do złotego środka między otwartością a odpowiedzialnością.