Les erreurs de l’IA augmentent malgré les progrès du raisonnement – des experts avancent des hypothèses

Profile photo of Sam Altman.

Image: Sam Altman CropEdit James Tamim/Creative Commons

May 9, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

L’IA a d’abord semblé extraordinaire grâce à ses nombreuses capacités, notamment répondre aux questions, résumer des documents et même écrire du code. Mais les inquiétudes grandissent quant à la fréquence à laquelle les systèmes d’IA inventent de fausses informations – autrement dit, les hallucinations – les taux d’erreur atteignant jusqu’à 79 % dans certains tests.

Ce problème a récemment touché les clients de Cursor, une plateforme d’assistance au codage par IA, lorsque son robot d’assistance a affirmé à tort que les utilisateurs ne pouvaient installer le logiciel que sur un seul ordinateur. La politique inventée de Cursor a suscité l’indignation, certains clients allant jusqu’à résilier leur abonnement avant que l’entreprise n’intervienne. « Nous n’avons aucune politique de ce type. Vous êtes bien entendu libres d’utiliser Cursor sur plusieurs machines », a précisé sur Reddit Michael Truell, le PDG de Cursor.

Cet incident montre comment les hallucinations de l’IA cessent d’être de simples erreurs sans conséquence pour entraîner des répercussions bien réelles.

Les problèmes de précision de l’IA dans les modèles d’OpenAI, de DeepSeek et d’IBM

Tests indépendants sur les hallucinations révèlent des tendances alarmantes, et la hausse des taux d’erreur de l’IA inquiète les experts.

Vectara, qui suit la fréquence à laquelle l’IA invente des informations, affirme que les hallucinations de l’IA deviennent plus courantes, y compris dans des tâches qui devraient être faciles à vérifier. L’entreprise a constaté que le modèle o3 d’OpenAI inventait des détails dans 6,8 % des cas lorsqu’il résumait des articles d’actualité, une tâche simple et vérifiable. Le modèle R1 de DeepSeek a fait moins bien, avec un taux de 14,3 %, tandis que le Granite 3.2 d’IBM, axé sur le raisonnement, hallucinaient dans 8,7 à 16,5 % des cas, selon la taille de la version.

Le Tow Center for Digital Journalism a récemment constaté que les moteurs de recherche propulsés par l’IA citent très mal les articles d’actualité ; en fait, le modèle Grok 3 d’Elon Musk a produit des citations incorrectes dans 94 % des cas, un chiffre stupéfiant.

Advertisement

Les experts affirment ne pas encore savoir pourquoi cela se produit, même si plusieurs théories existent. Selon l’une d’elles, les nouveaux modèles sont entraînés à résoudre les problèmes étape par étape, mais chaque étape introduit une nouvelle occasion de se tromper. Une autre théorie veut que l’IA soit entraînée à toujours fournir une réponse, même incorrecte, plutôt qu’à admettre qu’elle ne sait pas.

« Malgré tous nos efforts, ils hallucineront toujours », a déclaré Amr Awadallah, directeur général de Vectara et ancien cadre de Google, dans The New York Times. « Cela ne disparaîtra jamais. »

Résultats des tests de référence d’OpenAI

OpenAI, leader de la technologie de l’IA générative, essuie un revers ironique avec ses systèmes les plus récents. Les modèles o3 et o4-mini d’OpenAI utilisent le « raisonnement » (c’est-à-dire un processus de réflexion étape par étape) au lieu de se contenter de produire des réponses, mais les tests montrent que cette réflexion approfondie se retourne contre eux.

Selon les tests de référence d’OpenAI, :

  • le modèle o3 a halluciné dans 33 % des cas lorsqu’il répondait à des questions sur des personnalités publiques (PersonQA).
  • Pour des questions factuelles plus simples (SimpleQA), o3 a halluciné dans 51 % des cas.
  • Le modèle o4-mini a fait encore pire : 48 % pour PersonQA et 79 % pour SimpleQA.

Ces chiffres sont supérieurs à ceux des précédents systèmes d’OpenAI. Et bien qu’OpenAI étudie le problème, ses causes restent floues. « Nous poursuivrons nos recherches sur les hallucinations dans tous les modèles afin d’améliorer leur précision et leur fiabilité », a déclaré Gaby Raila, porte-parole d’OpenAI, au New York Times.

Un problème sérieux pour les travaux sérieux

Si un peu de désinformation n’est peut-être pas très grave lorsqu’on écrit un poème ou qu’on demande des idées de repas, les hallucinations peuvent être dangereuses dans le cas de documents judiciaires, de dossiers médicaux ou de décisions commerciales.

Même les entreprises qui tentent de résoudre le problème des hallucinations de l’IA éprouvent des difficultés. Microsoft et Google disposent d’outils qui tentent de signaler les réponses suspectes, mais les experts restent sceptiques quant à la capacité de ces mesures à régler entièrement le problème.

Découvrez la couverture d’eWeek consacrée à la manière dont Amazon atténue les hallucinations de l’IA grâce à une méthode mathématique. Sur notre site sœur TechRepublic, nous nous penchons sur les recherches d’Anthropic sur la manière dont son IA Claude « réfléchit ».

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.