OpenAIs o1 zeigt vielversprechende Ergebnisse bei der Diagnose echter Notaufnahmefälle

Female scientist and AI robot working together in the science lab.

Source: stockasso/Envato

Written By
Liz Ticong
Liz Ticong
May 4, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Notaufnahmen stellten OpenAIs o1 vor eine weitaus schwierigere diagnostische Prüfung als eine medizinische Prüfungsfrage.

In einer verblindeten Studie mit Patientenakten aus tatsächlichen Krankenhausbesuchen diagnostizierte das KI-System Notaufnahmefälle genauer als zwei behandelnde Ärzte. Die von Forschenden der Harvard Medical School und des Beth Israel Deaconess Medical Center in Science veröffentlichten Ergebnisse legen nahe, dass sich die Erprobung medizinischer KI allmählich den komplexen Bedingungen der echten Versorgung annähert.

Für Krankenhäuser, Forschende und Aufsichtsbehörden wirft die Studie eine größere Frage auf: Wie stark sollte die diagnostische Genauigkeit zählen, wenn Sicherheit, Testentscheidungen und das Urteilsvermögen von Ärzten weiterhin bestimmen, was mit einem Patienten geschieht?

Das Ergebnis, mit dem die Forschenden nicht gerechnet hatten

Adam Rodman, einer der leitenden Autoren der Studie und Assistenzprofessor für Medizin an der Harvard Medical School sowie am Beth Israel Deaconess, ging mit niedrigen Erwartungen in das Experiment in der Notaufnahme.

„Ich dachte, es würde ein interessantes Experiment werden, aber nicht besonders gut funktionieren. Genau das ist überhaupt nicht passiert“, sagte Rodman.

Das Experiment in der Notaufnahme umfasste 76 Fälle aus dem Beth Israel Deaconess Medical Center und verglich OpenAIs o1 mit GPT-4o und einer Vergleichsgruppe aus Ärzten. Der größte Abstand zeigte sich am frühesten Punkt der Versorgung. Bei der ersten Triage, als die Patienteninformationen noch am begrenztesten waren, identifizierte o1 in 67,1 % der Fälle die exakte oder eine sehr ähnliche Diagnose. Die Werte der Ärzte lagen bei 55,3 % und 50 %.

Das System lag auch später im Ablauf der Notaufnahme vorn, unter anderem nach dem Arztkontakt und bei der Aufnahme auf die Normalstation oder die Intensivstation.

Advertisement

Echte Akten, echte Ungewissheit

Der Teil der Studie zur Notaufnahme ließ ausgearbeitete medizinische Fallstudien hinter sich und testete das Modell näher an der Art und Weise, wie sich Diagnosen in einem Krankenhaus entwickeln.

„Um die Leistung unter realen Bedingungen besser zu verstehen, mussten wir die Leistung früh im Verlauf der Behandlung testen, wenn nur wenige klinische Daten vorliegen“, sagte der gleichrangige Erstautor Thomas Buckley.

Die Fälle aus der Notaufnahme stammten direkt aus elektronischen Gesundheitsakten, und Harvard zufolge bearbeitete das Team die Daten nicht vor, bevor es sie in das Modell einspeiste. Die KI musste mit unvollständigen, unstrukturierten Patienteninformationen zu genau dem frühen Zeitpunkt arbeiten, an dem Ärzte noch versuchen herauszufinden, was vor sich geht.

Kein Freifahrtschein für KI-Ärzte

Die Forschenden behaupten nicht, dass KI Patienten eigenständig diagnostizieren sollte. Der Science-Artikel besagt, dass die Ergebnisse für prospektive klinische Studien sprechen – ebenso wie für weitere Untersuchungen dazu, wie Ärzte und KI-Systeme in der realen Versorgung zusammenarbeiten sollten.

Die diagnostische Genauigkeit ist nur ein Teil der Versorgung in der Notaufnahme. Ärzte müssen weiterhin Risiken abwägen, Untersuchungen anordnen, entscheiden, ob ein Patient aufgenommen werden sollte, und Details berücksichtigen, die möglicherweise nie sauber in einer Akte erscheinen.

„Ein Modell könnte zwar die wahrscheinlichste Diagnose richtig erkennen, aber zugleich unnötige Untersuchungen vorschlagen, die einen Patienten gefährden könnten“, sagte Peter Brodeur, gleichrangiger Erstautor der Studie und Clinical Fellow für Medizin an der Harvard Medical School sowie am Beth Israel Deaconess. „Bei der Bewertung von Leistung und Sicherheit sollten Menschen der letztgültige Maßstab sein.“

Advertisement

Die nächste Prüfung wird darin bestehen, ob Systeme wie o1 die Versorgung verbessern können, wenn Ärzte sie einsetzen – und nicht nur darin, ob sie Ärzte auf einer diagnostischen Punkteskala schlagen können.

Die Forschenden stellten fest, dass die KI viele Fälle von Bauchspeicheldrüsenkrebs lange vor den Ärzten erkennen konnte.

Liz Ticong

Liz Ticong is a staff writer for eWeek and TechRepublic focused on AI, cybersecurity, enterprise software, and data. She has more than 10 years of editorial experience as a technology industry writer, combining reporting, product research, and hands-on software testing in her coverage. Her work has been published on Datamation, Enterprise Networking Planet, and TechnologyAdvice.com. She writes technology news, software reviews, product comparisons, and buyer’s guides for business and IT readers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.