Zum Hauptinhalt springen
5 Min. Lesezeit

Auslassungen: die Fehlerklasse, die Sie beim Gegenlesen nicht sehen

KI-Entwürfe lassen zwei- bis dreimal häufiger etwas weg, als sie erfinden — und Auslassungen hinterlassen im Text keine Spur. Wie Sie die dominante Fehlerklasse im eigenen Haus messen, in fünf Schritten.

Dr. Sven Jungmann

Dr. Sven Jungmann

CEO

Arztbrief-Entwurf auf einem Bildschirm neben einem Stapel Quelldokumente, ein markierter Befund im Stapel fehlt im Entwurf

Der Entwurf liest sich gut. Die Oberärztin geht ihn Absatz für Absatz durch: Aufnahmegrund stimmt, Verlauf stimmt, Medikation stimmt, das Prozedere ist plausibel. Sie ändert zwei Formulierungen und gibt frei. Was sie nicht sehen konnte: Im Aufnahmelabor stand ein grenzwertiger Kreatininwert, im Vorbefund eine Medikamentenunverträglichkeit. Beides steht in den Quelldokumenten. Im Brief steht es nirgends — und nichts im Brief deutet darauf hin, dass etwas fehlt.

Das ist die Asymmetrie zwischen den beiden großen Fehlerklassen generierter Dokumentation. Eine erfundene Aussage steht im Text; ein aufmerksamer Leser kann über sie stolpern. Eine Auslassung hinterlässt in dem Dokument, das geprüft wird, keine Spur. Wie aus zwei richtigen Befunden trotzdem eine falsche Akte entsteht, haben wir in Wie aus zwei richtigen Befunden eine erfundene Diagnose wird beschrieben. Hier geht es um den umgekehrten, häufigeren Fall: Es fehlt etwas.

Die Evidenz: Auslassungen dominieren

Die Befunde dazu sind über Arbeitsgruppen und Methodiken hinweg auffallend einheitlich.

  • In der CREOLA-Arbeit zu LLM-generierter Klinikdokumentation lag die Halluzinationsrate bei 1,47 Prozent, die Auslassungsrate bei 3,45 Prozent — mehr als das Doppelte. 44 Prozent der gefundenen Halluzinationen wurden als klinisch bedeutsam eingestuft [1].
  • An der University of California San Francisco enthielten 42 Prozent der mit GPT-4 generierten Entlassdokumente aus der Notaufnahme Halluzinationen — und 47 Prozent fehlende relevante Information [2].
  • Eine Vergleichsuntersuchung von fünf Scribe-Plattformen über je 14 Encounters fand eine Notiz-Fehlerrate von 26,3 Prozent; rund drei Viertel aller Fehler waren Auslassungen [3].
  • In einem Zwei-Monats-Pilot (31 Ärzt:innen, 7.545 generierte Notizen, davon 356 systematisch geprüft) waren Auslassungen mit 18 Prozent der geprüften Notizen der häufigste Fehlertyp, vor Halluzinationen mit 11,5 und versehentlichen Einfügungen mit 9,3 Prozent [4].

Eine Einschränkung gehört dazu: Die Studien messen unterschiedlich — mal pro Satz, mal pro Notiz, mal als Anteil aller gefundenen Fehler — und ihre Raten lassen sich untereinander kaum vergleichen [5]. Das Muster ist trotzdem stabil: Es fehlt häufiger etwas, als dass etwas erfunden wird. Wer sein Prüfregime allein auf Halluzinationen ausrichtet, prüft die kleinere Fehlerklasse.

Warum Gegenlesen allein nicht reicht

Gegenlesen prüft, was dasteht. Für Auslassungen ist genau das der blinde Fleck: Sie gelten in der Literatur als der für Prüfende am schwersten zu entdeckende Fehlertyp, weil der Text keinen Anlass zum Stutzen gibt [5]. Ein Entwurf kann vollständig wirken und trotzdem den einen Befund verschweigen, an dem später Weiterbehandlung oder Abrechnung hängen.

Die Prüfung braucht deshalb eine zweite Liste: das, was dastehen müsste. Diese Liste lässt sich erzeugen — aus den Quelldokumenten, bevor man den Entwurf liest.

Redaktion oder Auslassung?

Eine Abgrenzung vorweg, weil an ihr die ganze Messung hängt: Weglassen ist nicht per se ein Fehler. Ein guter Brief wählt aus. Hausärzt:innen wünschen sich ausdrücklich priorisierte, kürzere Briefe — mit umsetzbaren To-do-Listen, markierten Zufallsbefunden und begründeten Medikationsänderungen, ausdrücklich ohne lückenlose Datenwiedergabe [6]. Der Unterschied liegt in der Entscheidung: Redaktion ist ein bewusstes Urteil über Relevanz. Eine Auslassung im hier gemessenen Sinn ist ein Weglassen, das niemand entschieden hat — und das deshalb auch niemand verantworten kann.

Auslassungen im eigenen Haus messen: fünf Schritte

Sie brauchen dafür kein Studiendesign und keine Ethikkommission: Es ist eine interne Qualitätsprüfung an Dokumenten, die ohnehin durch Ihre Freigabe laufen.

  1. Stichprobe ziehen. 20 bis 30 Vorgänge über zwei Wochen, verteilt über verschiedene Autor:innen, Tageszeiten und Falltypen. Routinefälle eingeschlossen; die Stichprobe soll den Alltag abbilden, keine Raritätensammlung. Sind mehrere Dokumenttypen im Einsatz — Arztbrief, Aufnahmenotiz, Gesprächszusammenfassung —, prüfen Sie getrennt: Fehlerprofile unterscheiden sich je Dokumenttyp.
  2. Quellliste erstellen. Vor dem Blick in den Entwurf extrahiert eine Prüferin aus den Quelldokumenten die prüfrelevanten Items: Diagnosen, Medikation mit Dosis, Allergien und Unverträglichkeiten, pathologische und grenzwertige Befunde, ausstehende Ergebnisse, Nachsorgeverpflichtungen.
  3. Abgleichen. Eine zweite Person prüft den Entwurf gegen die Quellliste und markiert jedes Item: übernommen, begründet weggelassen oder fehlend. Wer die Quellliste erstellt hat, prüft nicht denselben Vorgang. Strittige Items wandern in ein kurzes Konsensgespräch; notieren Sie auch, wie oft die Prüfer:innen uneinig waren — diese Quote sagt etwas über die Schärfe Ihrer Zählregel.
  4. Zählen. Eine Auslassung zählt, wenn ein Item für Weiterbehandlung oder Abrechnung relevant ist und im Entwurf weder erscheint noch erkennbar begründet fehlt. Berichtet wird der Anteil der Vorgänge mit mindestens einer relevanten Auslassung — pro Vorgang, damit die Zahl mit der Literatur vergleichbar bleibt.
  5. Einordnen. Werte in der Größenordnung der publizierten Studien — je nach Definition zwischen knapp einem Fünftel und der Hälfte der Dokumente [2,4] — sind kein Ausreißer, sondern der Normalzustand der Werkzeugklasse. Die eigentliche Frage lautet, was Ihr Review-Prozess davon abfängt.

Die Messung eignet sich als Standortbestimmung vor jeder Beschaffungsentscheidung — und als Wiederholungsmessung im laufenden Betrieb, wenn ein System längst eingeführt ist.

Woran Sie Anbieter messen sollten

  1. Berichtet der Anbieter eine Auslassungsrate — oder ausschließlich Halluzinationszahlen?
  2. Gegen welche Referenz wurde gemessen: Transkript, Quelldokumente oder eine Goldstandard-Notiz? Auslassungen sind nur gegen die Quellen messbar.
  3. Zeigt das System, was es weggelassen hat, oder muss der Prüfblick es selbst finden?
  4. Lässt sich die Fünf-Schritte-Messung im Probebetrieb am eigenen Bestand durchführen? Ein strukturiertes Protokoll dafür steht in Probebetrieb klinischer KI: das 14-Tage-Prüfprotokoll.

In unserer eigenen Dokument-Pipeline planen wir für dieses Problem einen Auslassungs-Detektor, der jeden Entwurf gegen die strukturierten Daten der verifizierten Akte abgleicht und Weggelassenes in einem „Nicht übernommen“-Panel sichtbar macht, sodass Auslassen eine geloggte Entscheidung wird — das Feature ist in Entwicklung und noch nicht produktiv.

Wenn Sie die Fünf-Schritte-Messung einmal an Ihren eigenen Dokumenten durchspielen wollen, schreiben Sie uns — auch ohne dass Sie aiomics evaluieren. Im Newsletter Visite schreiben wir regelmäßig über Dokumentationsqualität und die Evidenz dahinter.

Quellen

  1. Asgari E, Montaña-Brown N, Dubois M, et al. A framework to assess clinical safety and hallucination rates of LLMs for medical text summarisation. npj Digital Medicine. 2025;8(1):274. doi:10.1038/s41746-025-01670-7.
  2. Williams CYK, Bains J, Tang T, et al. Evaluating large language models for drafting emergency department encounter summaries. PLOS Digital Health. 2025;4(6):e0000899. doi:10.1371/journal.pdig.0000899.
  3. Anderson TN, Mohan V, Dorr DA, Ratwani RM, Biro JM, Gold JA. Evaluating the Quality and Safety of Ambient Digital Scribe Platforms Using Simulated Ambulatory Encounters. Mayo Clinic Proceedings: Digital Health. 2025;3(4):100292. doi:10.1016/j.mcpdig.2025.100292.
  4. Taylor SL, Jost M, MacDonald S, et al. Quality of Clinical Notes Created by Ambient Listening Generative AI: Pragmatic Prospective Pilot Study. JMIR Medical Informatics. 2026;14:e86474. doi:10.2196/86474.
  5. Topaz M, Peltonen LM, Zhang Z. Beyond human ears: navigating the uncharted risks of AI scribes in clinical practice. npj Digital Medicine. 2025;8(1):569. doi:10.1038/s41746-025-01895-6.
  6. Primary Care Physicians' Perspectives on High-Quality Discharge Summaries. Journal of General Internal Medicine. 2023. doi:10.1007/s11606-023-08541-5.
#KI Dokumentation Fehler#Auslassungen KI#Omission Halluzination#Arztbrief KI Qualität

Der im Text erwähnte Auslassungs-Detektor von aiomics ist in Entwicklung und noch nicht produktiv.

Weiterlesen

Diese Analyse stammt von den Leuten hinter Visite.

Unser wöchentlicher Newsletter zu KI in der Medizin. Jeden Freitag, gründlich geprüft.

Mit der Anmeldung stimmen Sie dem Erhalt von Visite per E-Mail zu. Abmeldung jederzeit. Mehr in unserer Datenschutzerklärung.

Sie möchten das in Ihrer Klinik sehen?

30 Minuten. Ihre Fragen. Unser Arzt-Gründer zeigt Ihnen die Plattform persönlich.

Termin vereinbaren

Unverbindliches Gespräch mit Dr. med. Sven Jungmann.