In einem bahnbrechenden Sprung für Audio-KI hat NVIDIA Fugatto vorgestellt, einen KI-Audiogenerator mit 2,5 Milliarden Parametern, der die Erstellung und Transformation von Klängen neu definieren soll. Fugatto wurde von einem Team aus Forschern für generative KI entwickelt und ist ein vielseitiges Tool, das mithilfe einfacher Text- und Audio-Prompts Musik, Stimmen und Klänge erzeugen und bearbeiten kann. Diese als „Schweizer Taschenmesser für Klänge“ gefeierte Innovation erweitert die Grenzen KI-gestützter Kreativität und ermöglicht es Nutzern, Klänge zu erzeugen, die zuvor noch niemand gehört hat.
Die All-in-One-Lösung für Audio-KI
Während viele KI-Modelle sich auf isolierte Aufgaben wie das Komponieren von Liedern oder die Sprachmodulation spezialisieren, hebt sich Fugatto durch seine beispiellose Flexibilität ab. Von der Erstellung von Musikfragmenten auf Grundlage von Textbeschreibungen bis hin zum Hinzufügen oder Entfernen von Instrumenten aus bestehenden Tracks bewältigt es nahtlos zahlreiche Aufgaben zur Audioerzeugung und -transformation. Die Vielseitigkeit von Fugatto erschließt Potenzial in mehreren Bereichen:
- Musikproduktion: Künstler können Songideen prototypisch umsetzen, mit Stilen experimentieren und Tracks feinabstimmen.
- Werbung: Agenturen können Sprechertexte für lokalisierte Kampagnen mit unterschiedlichen Akzenten und emotionalen Nuancen anpassen.
- Bildung: Sprachlern-Tools könnten die Stimme einer lernenden Person nachbilden – von einem Familienmitglied bis zu einer fiktiven Figur.
- Gaming: Entwickler können Audio-Assets auf Grundlage von Aktionen im Spiel dynamisch verändern oder erstellen.
Emergente Fähigkeiten in der Forschung zur generativen KI
Fugatto nutzt emergente Eigenschaften – unerwartete Fähigkeiten, die aus seinem vielfältigen Training hervorgehen – und ermöglicht es Nutzern, frei formulierte Anweisungen zu komplexen, vielschichtigen Ergebnissen zu kombinieren. So kann das Modell beispielsweise Sprache mit französischem Akzent und einem Hauch von Traurigkeit erzeugen oder akustische Elemente wie ein in Vogelgesang übergehendes Gewitter miteinander verbinden. Durch Feinabstimmung kann Fugatto Aufgaben ausführen, für die es nicht ausdrücklich trainiert wurde, etwa hochwertige Singstimmen aus Text-Prompts.
Die ComposableART-Funktion von Fugatto ermöglicht das Mischen von Anweisungen in Echtzeit und gibt Kreativen eine differenzierte Kontrolle über Attribute wie die Intensität eines Akzents oder tonale Veränderungen. Die Funktion zur zeitlichen Interpolation des Modells erlaubt es Nutzern außerdem, die Entwicklung eines Klangs zu gestalten – etwa indem sie ein Crescendo eines Gewitters kreieren, das in einen friedlichen Chor der Morgendämmerung übergeht.
„Bei meinen Tests“, sagte Rohan Badlani, ein KI-Forscher, der an der Entwicklung des Modells beteiligt war, „hat Fugatto mir oft das Gefühl gegeben, ein Künstler zu sein.“
Die Entwicklung von Fugatto war ein gewaltiges Unterfangen. Seine 2,5 Milliarden Parameter wurden auf NVIDIA-DGX-Systemen mit 32 H100 Tensor Core GPUs trainiert. Das Entwicklungsteam – eine globale Zusammenarbeit zwischen Brasilien, Indien, China und weiteren Ländern – verbrachte mehr als ein Jahr damit, Millionen vielfältiger Audiobeispiele zusammenzustellen und neue Zusammenhänge in den Daten aufzudecken.
Lesen Sie unsere Rezension des Text-to-Speech-Generators Murf AI und erfahren Sie mehr darüber, wie generative KI für die Audioproduktion eingesetzt werden kann.


