Percée majeure : Google a trouvé la clé pour créer une IA dans plus de 400 langues

The Neuron featured image about Google ATLAS being utilized as AI in multiple languages.

Image: The Neuron

Written By
Grant Harvey
Grant Harvey
Feb 2, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Vous êtes-vous déjà demandé pourquoi ChatGPT parle mieux anglais que, disons, swahili ou arabe ?

Ce n’est pas un hasard, ni une quelconque faveur particulière accordée à l’anglais dans les données d’entraînement ; c’est une question de mathématiques. Les entreprises d’IA ont avancé à l’aveugle pour créer des modèles dans des langues autres que l’anglais, en devinant la quantité de données à utiliser et les langues à entraîner ensemble.

L’équipe de recherche de Google vient de publier ATLAS (papier), la plus vaste étude publique sur l’entraînement d’IA multilingue. Elle a mené 774 expériences dans plus de 400 langues pour répondre à des questions qui ont longtemps déconcerté les développeurs : de combien faut-il augmenter la taille de votre modèle si vous voulez prendre en charge 50 langues au lieu de 10 ? Quelles langues s’entraident réellement pendant l’entraînement ?

The Neuron featured image about the accidental leak of GPT - 5.4.
Image: The Neuron

La percée clé

ATLAS crée une « matrice de transfert » qui montre quelles langues améliorent les performances des autres. Le norvégien progresse lorsqu’il est entraîné avec le suédois et l’allemand. Le malais bénéficie de l’indonésien. L’arabe s’améliore avec l’hébreu. Le point commun ? Les langues qui partagent le même alphabet et la même famille linguistique s’entraident le plus.

Voici les trois outils pratiques proposés par ATLAS :

  • Calculateur de mise à l’échelle : si vous voulez doubler le nombre de langues prises en charge (de K à 2K langues), augmentez la taille du modèle de 1,18× et la quantité totale de données de 1,66×.
  • Guide des associations de langues : une carte thermique montre quelles langues fonctionnent le mieux ensemble ; l’anglais, le français et l’espagnol sont utiles au plus grand nombre de langues.
  • Choix entre préentraînement et ajustement fin : une formule indique quand repartir de zéro plutôt que de s’appuyer sur un modèle multilingue existant (généralement entre 144 et 283 milliards de tokens pour des modèles de 2 milliards de paramètres).

L’équipe s’est également penchée sur la « malédiction du multilinguisme », c’est-à-dire le fait que l’ajout de langues nuit généralement aux performances. La bonne nouvelle, c’est que cette malédiction existe, mais qu’elle reste limitée. Les langues qui partagent les mêmes systèmes d’écriture créent suffisamment de synergies positives pour compenser la plupart des contraintes de capacité.

Advertisement

Pourquoi c’est important

Plus de 50 % des utilisateurs d’IA parlent des langues autres que l’anglais, mais les lois de mise à l’échelle ont été très largement axées sur l’anglais. Les développeurs qui créent des IA multilingues ont dû faire des estimations coûteuses concernant la taille des modèles et les données d’entraînement.

ATLAS leur fournit une feuille de route fondée sur les données. On peut s’attendre à ce que la prochaine génération de modèles multilingues fonctionne réellement bien dans des langues autres que l’anglais, car les entreprises savent désormais exactement comment répartir efficacement leur budget de calcul entre les langues.

La suite : les développeurs de modèles dans des entreprises comme Anthropic, OpenAI, et Google adopteront probablement ces principes de mise à l’échelle au cours des 6 à 12 prochains mois (les laboratoires chinois le feront peut-être aussi !). Si vous créez ou évaluez des produits d’IA multilingues, vérifiez quelles langues ont été privilégiées lors de l’entraînement ; ATLAS montre que ces choix ont un impact mesurable.

Note de la rédaction : ce contenu a d’abord été publié dans la newsletter de notre publication sœur, The Neuron. Pour découvrir d’autres articles de The Neuron, inscrivez-vous à sa newsletter ici.

Grant Harvey

Grant Harvey is the Lead Writer of The Neuron, where he continues to lead the publication's daily coverage of AI news, tools, and trends.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.