KI-Sprachmodelle werden an großen Datenmengen trainiert, um möglichst menschenähnliche Antworten zu geben. Sie können Informationen analysieren und zusammenfassen, auf Fragen antworten und scheinbar empathisch auf menschliche Probleme eingehen. Doch gerade in sensiblen Bereichen gilt stets die Devise, dass man sich auf die KI-generierten Angaben nicht verlassen sollte. Denn da die Sprachmodelle lediglich Muster auswerten und reproduzieren, kann es leicht zu Fehlern kommen. Als besonders kritisch gelten Gesundheitsinformationen. Auch wenn inzwischen mehr und mehr Privatpersonen ChatGPT und Co zu ihren Symptomen befragen und sich medizinischen Rat erhoffen, haben bisherige Studien gezeigt, dass die KI zwar überzeugend und hilfreich klingen kann, teils aber gefährliche Fehlinformationen liefert.
Besser als Ärzte?
Zugleich werden KI-Modelle, die mit echten oder konstruierten medizinischen Fallberichten konfrontiert werden, immer besser darin, korrekte Diagnosen und Behandlungsvorschläge zu generieren. Wie gut sie darin schon sind, zeigt nun eine Studie von einem Team um Peter Brodeur vom Beth Israel Deaconess Medical Center in Boston. Die Forschenden ließen das Sprachmodell o1 von OpenAI zahlreiche standardisierte klinische Fälle sowie echte Fälle aus Notaufnahmen bewerten und verglichen seine Leistung dabei sowohl mit anderen KI-Modellen als auch mit der von menschlichen Ärzten.
Für die Studie bewerteten andere Ärzte die jeweiligen Diagnosen und Entscheidungen, ohne zu wissen, ob sie von einem Menschen oder von einer KI stammten. Das Ergebnis: „In allen Experimenten übertraf OpenAI o1 die Referenzwerte der menschlichen Ärzte und zeigte eine kontinuierliche Verbesserung gegenüber früheren Generationen klinischer KI-Entscheidungshilfen“, berichtet das Forschungsteam. So lieferte o1 im Vergleich zu menschlichen Ärzten häufiger korrekte Diagnosen und traf häufiger die richtigen Entscheidungen für den weiteren Behandlungsverlauf.
Vorteil in Akut-Situationen
„Die Leistungsunterschiede waren besonders ausgeprägt bei Fällen aus der Notaufnahme, wo die wenigsten Informationen über den Patienten vorliegen und die größte Dringlichkeit besteht, die richtige Entscheidung zu treffen“, berichten Brodeur und seine Kollegen. Während Ärzte hier aufgrund der begrenzten Informationen nur in etwa der Hälfte der Fälle richtig entschieden, lag die KI immerhin in etwa zwei Drittel der Fälle richtig. Dabei war sie in der Lage, auch fragmentierte, unstrukturierte Daten aus den Krankenakten effektiv zu nutzen.





