Grok affiche la plus forte proportion de réponses de santé « hautement problématiques » dans un audit de BMJ Open

A person interacts with a smartphone displaying an AI doctor application, highlighting the convenience of technology in accessing healthcare services from the comfort of home.

Source: monkeybusiness/Envato

Written By
Liz Ticong
Liz Ticong
Apr 20, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

On peut poser une question de santé à un chatbot IA en quelques secondes. Faire confiance à sa réponse est un pari bien plus risqué.

Un nouvel audit de BMJ Open a révélé que 49,6 % des réponses de cinq grands chatbots grand public à des questions de santé et de médecine étaient « problématiques », le chatbot Grok d’Elon Musk affichant la plus forte proportion de réponses « hautement problématiques ».

Cet audit alimente les craintes que les chatbots de santé puissent envelopper la désinformation dans un ton calme et convaincant.

Un ton assuré, des faits compromis

Le principal problème n’était pas seulement que les chatbots commettaient des erreurs — c’était la nature des erreurs commises.

Sur 250 réponses fournies par cinq outils grand public — Gemini, DeepSeek, Meta AI, ChatGPT, et Grok — l’étude a constaté que de nombreuses réponses s’éloignaient du consensus scientifique établi ou recouraient à un « langage nuancé qui établissait un faux équilibre entre les informations scientifiques et non scientifiques ».

Les réponses portaient sur des sujets de santé comme le cancer, les vaccins, les cellules souches, la nutrition et les performances sportives, offrant un large aperçu de domaines déjà sujets à la désinformation.

Les conseils de santé pouvaient ainsi sembler calmes et crédibles tout en éloignant les lecteurs des faits.

Les questions ouvertes laissaient davantage de place aux mauvaises réponses

La formulation de la question modifiait la qualité de la réponse. Les invites ouvertes produisaient bien plus de réponses hautement problématiques que les questions fermées, ce qui en faisait le format le plus risqué.

Les questions fermées laissaient moins de marge aux chatbots pour s’égarer. Les invites ouvertes produisaient l’effet inverse. Elles ouvraient la porte à des affirmations plus fragiles, à davantage de spéculations et à une désinformation plus soignée en apparence. 

Les invites fermées ont produit seulement neuf réponses hautement problématiques, contre 40 pour les invites ouvertes. Elles ont également généré 75 réponses non problématiques, contre 51 pour les invites ouvertes.

Cet écart est notable, car les invites ouvertes ressemblent étroitement à la manière dont les internautes posent réellement des questions de santé. Nombre d’utilisateurs ne saisissent pas une question étroite appelant une réponse par oui ou par non. Ils demandent des options, des recommandations ou des explications.

Advertisement

Très peu de questions ont suscité une véritable retenue

À travers les modèles d’IA, les réponses étaient « systématiquement formulées avec assurance et certitude », même lorsque les réponses étaient controversées ou incorrectes. Les refus étaient rares, tout comme les signes manifestes qu’un chatbot pouvait être dépassé. Sur 250 questions au total, il n’y a eu que deux refus, tous deux émis par Meta AI.

Ce faible taux de refus est frappant dans un contexte de santé, où il aurait été plus prudent de ne pas répondre à certaines questions ou de rediriger les utilisateurs vers un professionnel de santé. Au lieu de cela, les bots répondaient généralement malgré tout, même lorsque l’invite tendait vers des conseils risqués ou dépourvus de fondement.

Les garde-fous étaient eux aussi inégaux. Sur 50 réponses par chatbot, l’étude a comptabilisé des réserves ou des avertissements recommandant de consulter un professionnel de santé ou un spécialiste médical dans :

  • 44 réponses de Gemini
  • 38 réponses de DeepSeek
  • 37 réponses de Grok
  • 32 réponses de Meta AI
  • 28 réponses de ChatGPT

Même avec ces avertissements, la tendance générale persistait : les réponses semblaient souvent posées et faisant autorité, ce qui peut donner à des informations fragiles une apparence de fiabilité supérieure à leur fiabilité réelle.

Les réponses étaient habillées pour inspirer confiance

Les réponses étaient fragiles. Leurs sources ne valaient pas mieux.

Pour les questions fermées, les chatbots IA devaient fournir 10 références scientifiques étayant leurs réponses. L’étude a relevé un score médian d’exhaustivité des citations de seulement 40 %, et aucun chatbot n’a produit une liste de références entièrement exacte pour une quelconque invite.

Les réponses étaient également plus difficiles à lire qu’elles n’en avaient l’air. En moyenne, les cinq outils d’IA se situaient dans la catégorie « difficile » en matière de lisibilité, correspondant grosso modo au niveau d’un étudiant de deuxième à quatrième année d’université.

Le tout pouvait donc sembler convaincant même lorsque le fond ne l’était pas : un langage soigné, des citations à l’allure universitaire et beaucoup d’assurance, sans la fiabilité nécessaire pour les accompagner.

Advertisement

Une panne généralisée de ChatGPT a perturbé l’accès des utilisateurs dans le monde entier tandis qu’OpenAI s’efforçait d’en déterminer la cause.

Liz Ticong

Liz Ticong is a staff writer for eWeek and TechRepublic focused on AI, cybersecurity, enterprise software, and data. She has more than 10 years of editorial experience as a technology industry writer, combining reporting, product research, and hands-on software testing in her coverage. Her work has been published on Datamation, Enterprise Networking Planet, and TechnologyAdvice.com. She writes technology news, software reviews, product comparisons, and buyer’s guides for business and IT readers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.