L’o1 d’OpenAI montre des résultats prometteurs pour diagnostiquer de vrais cas aux urgences

Female scientist and AI robot working together in the science lab.

Source: stockasso/Envato

Written By
Liz Ticong
Liz Ticong
May 4, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Les urgences ont soumis l’o1 d’OpenAI à un test diagnostique bien plus difficile qu’une question d’examen médical.

Dans le cadre d’une étude en aveugle s’appuyant sur les dossiers de patients issus de véritables consultations hospitalières, le système d’IA a diagnostiqué les cas traités aux urgences avec davantage de précision que deux médecins seniors. Publiés dans Science par des chercheurs de Harvard Medical School et du Beth Israel Deaconess Medical Center, ces résultats suggèrent que l’évaluation de l’IA médicale commence à se rapprocher des conditions désordonnées des soins réels.

Pour les hôpitaux, les chercheurs et les autorités de régulation, l’étude soulève une question plus vaste : quelle importance faut-il accorder à la précision diagnostique lorsque la sécurité, les décisions relatives aux examens et le jugement clinique continuent de déterminer ce qui arrive au patient ?

Le résultat auquel les chercheurs ne s’attendaient pas

Adam Rodman, l’un des principaux auteurs de l’étude et professeur adjoint de médecine à Harvard Medical School et au Beth Israel Deaconess, s’est lancé dans le test mené aux urgences avec de faibles attentes.

« Je pensais que ce serait une expérience amusante, mais qu’elle ne fonctionnerait pas très bien. C’est tout sauf ce qui s’est passé », a déclaré Rodman.

L’expérience menée aux urgences comprenait 76 cas du Beth Israel Deaconess Medical Center et comparait l’o1 d’OpenAI à GPT-4o ainsi qu’à un groupe de référence composé de médecins. L’écart le plus important apparaissait au tout début de la prise en charge. Lors du triage initial, alors que les informations sur les patients étaient les plus limitées, l’o1 a identifié le diagnostic exact ou un diagnostic très proche dans 67,1 % des cas. Les médecins ont obtenu 55,3 % et 50 %.

Le système est également resté en tête plus tard dans le parcours aux urgences, notamment après la consultation médicale et lors de l’admission dans un service de médecine ou en soins intensifs.

Advertisement

De vrais dossiers, une véritable incertitude

La partie consacrée aux urgences de la étude a abandonné les études de cas médicaux soigneusement préparées pour tester le modèle d’une manière plus proche du déroulement réel d’un diagnostic à l’hôpital.

« Pour mieux comprendre les performances en conditions réelles, nous devions évaluer le système au début du parcours du patient, lorsque les données cliniques sont rares », a déclaré Thomas Buckley, coauteur principal de l’étude.

Les cas traités aux urgences provenaient directement de dossiers médicaux électroniques, et Harvard a précisé que l’équipe n’avait pas prétraité les données avant de les transmettre au modèle. L’IA devait traiter des informations incomplètes et non structurées sur les patients, aux mêmes moments précoces où les cliniciens tentent encore de comprendre ce qui se passe.

Pas de feu vert pour des médecins IA

Les chercheurs ne prétendent pas que l’IA devrait diagnostiquer les patients seule. L’article de Science affirme que ces résultats justifient la mise en place d’essais cliniques prospectifs, ainsi que des études supplémentaires sur la manière dont les cliniciens et les systèmes d’IA devraient collaborer dans des contextes de soins réels.

La précision diagnostique n’est qu’un aspect des soins d’urgence. Les médecins doivent encore évaluer les risques, prescrire des examens, décider si un patient doit être hospitalisé et tenir compte de détails qui peuvent ne jamais apparaître clairement dans un dossier.

« Un modèle peut établir le bon diagnostic principal tout en recommandant des examens inutiles susceptibles d’exposer le patient à des préjudices », a déclaré Peter Brodeur, coauteur principal de l’étude et médecin clinicien en formation à Harvard Medical School et au Beth Israel Deaconess. « Les humains doivent constituer la référence ultime lorsqu’il s’agit d’évaluer les performances et la sécurité. »

Advertisement

Le prochain test consistera à déterminer si des systèmes comme l’o1 peuvent améliorer les soins lorsque les médecins les utilisent, et pas seulement s’ils peuvent battre les médecins dans un classement diagnostique.

Les chercheurs ont constaté que l’IA pouvait repérer de nombreux cas de cancer du pancréas avant qu’ils ne soient diagnostiqués bien avant que les médecins ne le puissent.

Liz Ticong

Liz Ticong is a staff writer for eWeek and TechRepublic focused on AI, cybersecurity, enterprise software, and data. She has more than 10 years of editorial experience as a technology industry writer, combining reporting, product research, and hands-on software testing in her coverage. Her work has been published on Datamation, Enterprise Networking Planet, and TechnologyAdvice.com. She writes technology news, software reviews, product comparisons, and buyer’s guides for business and IT readers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.