NVIDIA dévoile Fugatto : un générateur audio d’IA révolutionnaire de 2,5 milliards de paramètres

DJ mixer with headphones

Top view of DJ Mixer with headphones. Elements and details of artists working tools – DJ console with knobs and black headphones. Soft focus.

Écrit par
Sunny Yadav
Sunny Yadav
Dec 15, 2024
3 minute read
eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Dans une avancée majeure pour l’IA audio, NVIDIA a présenté Fugatto, un générateur audio d’IA de 2,5 milliards de paramètres conçu pour redéfinir la manière dont les sons sont créés et transformés. Développé par une équipe de chercheurs en IA générative, Fugatto est un outil polyvalent capable de produire et de manipuler de la musique, des voix et des sons à partir de simples instructions textuelles et audio. Cette innovation, présentée comme un « couteau suisse du son », repousse les limites de la créativité alimentée par l’IA et permet aux utilisateurs de générer des sons jamais entendus auparavant.

La solution tout-en-un pour l’IA audio

Alors que de nombreux modèles d’IA se spécialisent dans des tâches isolées comme la composition de chansons ou la modulation de la voix, la flexibilité inégalée de Fugatto le distingue. De la création d’extraits musicaux à partir de descriptions textuelles à l’ajout ou à la suppression d’instruments dans des morceaux existants, il prend en charge de manière fluide de multiples tâches de génération et de transformation audio. La polyvalence de Fugatto ouvre des perspectives dans de nombreux domaines :

  • Production musicale : les artistes peuvent esquisser des idées de chansons, expérimenter différents styles et peaufiner leurs morceaux.
  • Publicité : les agences peuvent adapter des voix off avec différents accents et registres émotionnels pour des campagnes localisées.
  • Éducation : les outils d’apprentissage des langues pourraient reproduire la voix choisie par l’apprenant, qu’il s’agisse de celle d’un membre de sa famille ou d’un personnage fictif.
  • Jeux vidéo : les développeurs peuvent modifier ou créer dynamiquement des éléments audio en fonction des actions dans le jeu.

Des capacités émergentes dans la recherche sur l’IA générative

Fugatto exploite des propriétés émergentes — des capacités inattendues qui apparaissent grâce à la diversité de son entraînement— et permet aux utilisateurs de combiner des instructions en langage libre pour produire des résultats complexes et superposés. Il peut par exemple produire un discours avec un accent français empreint de tristesse, ou combiner des éléments sonores comme un orage évoluant vers un chant d’oiseaux. Grâce à un réglage fin, Fugatto peut effectuer des tâches pour lesquelles il n’a pas été explicitement entraîné, comme générer des voix chantées de haute qualité à partir d’instructions textuelles.

La fonctionnalité ComposableART de Fugatto permet de mélanger des instructions en temps réel afin d’offrir aux créateurs un contrôle nuancé sur des attributs comme l’intensité de l’accent ou les variations de tonalité. La fonctionnalité d’interpolation temporelle du modèle permet en outre aux utilisateurs de façonner l’évolution du son, par exemple en créant le crescendo d’un orage qui se transforme en un paisible chœur matinal.

Advertisement

« Lors de mes tests, a déclaré Rohan Badlani, chercheur en IA ayant participé à la conception du modèle, Fugatto m’a souvent donné l’impression d’être un artiste. »

La création de Fugatto a constitué une entreprise monumentale. Ses 2,5 milliards de paramètres ont été entraînés sur des systèmes NVIDIA DGX utilisant 32 GPU H100 Tensor Core. L’équipe de développement — une collaboration internationale réunissant des chercheurs du Brésil, de l’Inde, de la Chine et d’ailleurs — a consacré plus d’un an à sélectionner des millions d’échantillons audio variés et à découvrir de nouvelles relations dans les données.

Lisez notre test du générateur de synthèse vocale Murf AI pour en savoir plus sur la manière dont l’IA générative peut être utilisée pour la production audio.

Sunny Yadav

Sunny is a content writer for eSecurity Planet (eSP) with a bachelor’s degree in technology and experience writing for leading cybersecurity brands like Panda Security, Upwind, and Vanta. At eSP, he covers the latest news on cyberattacks, cryptography, data protection, and emerging threats and vulnerabilities. He also explores security policies, governance, and endpoint and mobile security. Sunny enjoys hands-on testing, rigorously evaluating tools to assess their capabilities and real-world performance. He also has extensive experience working with AI tools like ChatGPT and Gemini, experimenting with their applications in cybersecurity, content creation, and research.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.