Microsoft a signé un accord de trois ans avec HarperCollins pour entraîner un modèle d’IA dont le nom n’a pas encore été dévoilé à partir du catalogue de ce grand éditeur. Selon Bloomberg, les modalités de l’accord prévoient le versement de 5 000 dollars US par livre documentaire, répartis à parts égales entre l’auteur et HarperCollins. Cet accord est distinct des autres contrats d’édition et n’est pas déduit des avances existantes. En outre, il ne s’applique qu’à une sélection de livres documentaires déjà publiés, et non aux ouvrages de fiction.
404 Media a révélé l’information mais n’a pas dévoilé le nom de l’entreprise technologique concernée. Bloomberg a publié un article de suivi apportant davantage de précisions, notamment le fait que Microsoft développe le modèle d’IA.
Les modalités de l’accord entre Microsoft et HarperCollins sur l’IA
Les auteurs de HarperCollins doivent accepter de participer au programme d’entraînement de l’IA et autoriser l’utilisation de leurs livres documentaires. Les auteurs qui refusent la proposition ne verront pas leurs ouvrages inclus dans les données d’entraînement et ne percevront pas la rémunération prévue. Tous les auteurs de HarperCollins ne se verront pas proposer cet accord. Microsoft sélectionne les livres qu’il souhaite inclure dans le jeu de données d’entraînement.
L’accord comprendrait des dispositions destinées à apaiser les inquiétudes des auteurs concernant l’IA générative et le risque qu’elle plagie des contenus ou réduise la demande de rédacteurs humains. Ainsi, l’accord stipule que « pas plus de 200 mots consécutifs et/ou 5 % du texte d’un livre » ne seront utilisés pour entraîner le modèle d’IA. Il comprend également l’engagement de Microsoft à ne pas extraire de textes de sites illégaux de piratage.
Pourquoi l’accord entre Microsoft et HarperCollins sur l’IA est important
Les grands modèles de langage (LLM) et les autres types de modèles d’IA nécessitent d’immenses jeux de données pour être entraînés. La quantité de contenus disponibles dans le domaine public est limitée. En achetant l’accès au fonds de livres documentaires déjà publiés de HarperCollins, Microsoft augmente considérablement le volume de données disponibles pour entraîner son modèle d’IA.
Si plusieurs entreprises technologiques ont déjà conclu des accords avec des éditeurs pour entraîner des modèles d’intelligence artificielle à partir de contenus existants, c’est la première fois que les modalités précises d’un tel accord sont rendues publiques. L’accord avec HarperCollins fournit un repère financier sur ce que Microsoft — et, par extension, les autres entreprises spécialisées dans l’IA — sont disposées à dépenser pour entraîner leurs modèles.
Une source a également déclaré à Bloomberg que Microsoft n’utiliserait pas le modèle d’IA pour générer des livres. La finalité du nouveau modèle d’IA de Microsoft n’a pas encore été annoncée.


