Dans une avancée majeure pour l’IA audio, NVIDIA a présenté Fugatto, un générateur audio d’IA de 2,5 milliards de paramètres conçu pour redéfinir la manière dont les sons sont créés et transformés. Développé par une équipe de chercheurs en IA générative, Fugatto est un outil polyvalent capable de produire et de manipuler de la musique, des voix et des sons à partir de simples instructions textuelles et audio. Cette innovation, présentée comme un « couteau suisse du son », repousse les limites de la créativité alimentée par l’IA et permet aux utilisateurs de générer des sons jamais entendus auparavant.
La solution tout-en-un pour l’IA audio
Alors que de nombreux modèles d’IA se spécialisent dans des tâches isolées comme la composition de chansons ou la modulation de la voix, la flexibilité inégalée de Fugatto le distingue. De la création d’extraits musicaux à partir de descriptions textuelles à l’ajout ou à la suppression d’instruments dans des morceaux existants, il prend en charge de manière fluide de multiples tâches de génération et de transformation audio. La polyvalence de Fugatto ouvre des perspectives dans de nombreux domaines :
- Production musicale : les artistes peuvent esquisser des idées de chansons, expérimenter différents styles et peaufiner leurs morceaux.
- Publicité : les agences peuvent adapter des voix off avec différents accents et registres émotionnels pour des campagnes localisées.
- Éducation : les outils d’apprentissage des langues pourraient reproduire la voix choisie par l’apprenant, qu’il s’agisse de celle d’un membre de sa famille ou d’un personnage fictif.
- Jeux vidéo : les développeurs peuvent modifier ou créer dynamiquement des éléments audio en fonction des actions dans le jeu.
Des capacités émergentes dans la recherche sur l’IA générative
Fugatto exploite des propriétés émergentes — des capacités inattendues qui apparaissent grâce à la diversité de son entraînement— et permet aux utilisateurs de combiner des instructions en langage libre pour produire des résultats complexes et superposés. Il peut par exemple produire un discours avec un accent français empreint de tristesse, ou combiner des éléments sonores comme un orage évoluant vers un chant d’oiseaux. Grâce à un réglage fin, Fugatto peut effectuer des tâches pour lesquelles il n’a pas été explicitement entraîné, comme générer des voix chantées de haute qualité à partir d’instructions textuelles.
La fonctionnalité ComposableART de Fugatto permet de mélanger des instructions en temps réel afin d’offrir aux créateurs un contrôle nuancé sur des attributs comme l’intensité de l’accent ou les variations de tonalité. La fonctionnalité d’interpolation temporelle du modèle permet en outre aux utilisateurs de façonner l’évolution du son, par exemple en créant le crescendo d’un orage qui se transforme en un paisible chœur matinal.
« Lors de mes tests, a déclaré Rohan Badlani, chercheur en IA ayant participé à la conception du modèle, Fugatto m’a souvent donné l’impression d’être un artiste. »
La création de Fugatto a constitué une entreprise monumentale. Ses 2,5 milliards de paramètres ont été entraînés sur des systèmes NVIDIA DGX utilisant 32 GPU H100 Tensor Core. L’équipe de développement — une collaboration internationale réunissant des chercheurs du Brésil, de l’Inde, de la Chine et d’ailleurs — a consacré plus d’un an à sélectionner des millions d’échantillons audio variés et à découvrir de nouvelles relations dans les données.
Lisez notre test du générateur de synthèse vocale Murf AI pour en savoir plus sur la manière dont l’IA générative peut être utilisée pour la production audio.


