Le dernier modèle audio de Stability AI peut générer des chansons plus longues que nombre de titres diffusés à la radio.
L’entreprise a lancé Stable Audio 3.0, une famille de modèles audio d’IA capables de créer de la musique et des effets sonores, dont les versions les plus grandes peuvent générer des compositions complètes d’une durée maximale de 6 minutes et 20 secondes.
Stable Audio 3.0 va plus loin
Selon TechCrunch, Stability AI lance quatre modèles sous le nom de Stable Audio 3.0 : Small SFX, Small, Medium et Large. Les deux modèles Small comptent 459 millions de paramètres et sont conçus pour générer sur appareil des sons et de la musique d’une durée maximale de deux minutes.
Les modèles Medium et Large repoussent largement la durée de sortie. Tous deux peuvent créer des compositions complètes de 6 minutes et 20 secondes tout en préservant la structure musicale et la tonalité mélodique. Le modèle Medium compte 1,4 milliard de paramètres, contre 2,7 milliards pour le modèle Large.
La propre annonce de Stable Audio 3.0 de Stability AI indique que les modèles Small SFX, Small et Medium sont proposés avec des poids ouverts. Le modèle Large est accessible via l’API de Stability AI et en auto-hébergement pour les déploiements en entreprise.
Cette sortie met également à jour la gamme audio de Stability AI. Stable Audio Open, lancé en 2024, pouvait générer des échantillons et des effets sonores d’une durée maximale de 47 secondes. Stable Audio 3.0 fait passer l’entreprise à la génération de musique de plus longue durée, tout en conservant des modèles plus petits pour l’expérimentation et l’utilisation locale.
Stability AI a déclaré que tous les modèles Stable Audio 3.0 avaient été entraînés sur des données entièrement sous licence. En vertu de la licence communautaire de Stability AI, les utilisateurs sont propriétaires de leurs créations et peuvent les distribuer et les commercialiser. Les organisations dont le chiffre d’affaires annuel dépasse 1 million de dollars US ont besoin d’une licence entreprise, qui comprend, selon Stability AI, une couverture commerciale et une garantie juridique.
Les outils de création musicale par IA arrivent en pleine bataille autour du droit d’auteur, tandis que les créateurs et les législateurs réclament davantage de transparence sur les données d’entraînement.
Modèles ouverts, accès payant et liens avec l’industrie musicale
Stable Audio 3.0 n’est pas un modèle unique destiné à un seul public. Stability AI répartit cette famille entre les créateurs, les développeurs et les grandes entreprises qui ont besoin d’un accès à l’API ou de l’auto-hébergement.
L’entreprise a indiqué que le modèle Small SFX était conçu pour les effets sonores sur des appareils tels que les téléphones mobiles et les ordinateurs portables grand public. Le modèle Small est conçu pour composer de la musique complète directement sur appareil. Le modèle Medium propose des morceaux plus longs et une musicalité renforcée, tandis que le modèle Large est destiné aux plateformes musicales et aux applications créatives qui nécessitent une génération à faible latence et à grande échelle.
La nouvelle architecture prend également en charge les outils d’édition. Stability AI a déclaré que Stable Audio 3.0 pouvait gérer l’inpainting audio, la continuation et la génération de longueur variable avec un contrôle à la seconde. Les utilisateurs peuvent ainsi modifier une partie d’un morceau, prolonger une composition ou générer une section plus courte sans devoir recommencer depuis le début.
Stability AI cherche également à gagner en crédibilité auprès de l’industrie musicale. TechCrunch a rapporté que l’entreprise avait signé l’année dernière des accords avec Warner Music Group et Universal Music Group pour développer des modèles et des outils de création musicale. L’entreprise met aussi au point une suite de produits destinée aux musiciens professionnels, avec l’arrivée d’Ethan Kaplan, ancien directeur du numérique d’Universal Audio et de Fender, pour diriger cette initiative.
Stable Audio 3.0 arrive alors que Google approfondit son travail sur la musique par IA avec les outils Gemini et Lyria, et que l’audio prend une place croissante dans la course aux produits d’IA, des assistants aux rumeurs d’appareils d’IA conçus d’abord pour l’audio.
Pour les créateurs, l’intérêt réside dans des sorties plus longues et un contrôle accru. Pour les entreprises, l’attrait tient à une famille de modèles qui associe l’expérimentation avec des poids ouverts à un accès entreprise payant.
Cette famille de modèles offre aux deux groupes une voie vers une création audio plus rapide, sans perdre de vue les questions de licence et de propriété.
À lire également : la dernière mise à jour de l’IA vocale d’OpenAI montre à quelle vitesse les entreprises transforment les outils vocaux en systèmes capables d’écouter, de répondre, de traduire et d’agir.


