Der Brustkrebs-KI-Test zeigt, dass kein einzelner Chatbot in allen Kategorien herausragend ist.
Ein direkter Vergleich von fünf führenden LLMs (Large Language Models) untersuchte, was passiert, wenn Fragen zu Brustkrebs vom theoretischen Wissen in klinische Fälle und die alltäglichen Sorgen der Patienten übergehen, die sie in ihre Behandlungsteams einbringen.
Hier klicken, um den Artikel zu lesen.
In einer aktuellen Studie, die als ‚Artikel in Presse‘ in der Fachzeitschrift Scientific Reports veröffentlicht wurde, führten Forscher einen Quervergleich durch, um die Leistung moderner große Sprachmodelle (LLMs) bei der Bereitstellung von Informationen zur Brustgesundheit zu bewerten.
Die Studie testete ChatGPT-5.2, ChatGPT-4o, Gemini 3.0, DeepSeek und ERNIE Bot mit 90 Multiple-Choice-Fragen, 10 anonymisierten klinischen Fällen und Antworten auf 20 häufige Patientenanliegen.
Die Untersuchungen der Studie ergaben, dass alle fünf Modelle hohe Genauigkeit bei standardisierten Brustkrebs-Wissenfragen zeigten, die zwischen 82,22 % und 94,44 % lagen, sie aber in sprachlicher Komplexität und von Experten bewerteten Qualitätsmaßen variierten.
Human-Experten gaben ChatGPT-5.2 und DeepSeek die höchsten Vollständigkeitspunkte, während Gemini 3.0 die höchste von Experten bewertete Lesbarkeit erreichte. DeepSeek erzielte auch den niedrigsten Schwierigkeitsgrad im automatisierten Bewertungsverfahren für chinesische Texte.
Die Studie kam zu dem Schluss, dass kein einzelnes Modell als das „beste“ zur Beantwortung von Brustkrebsfragen betrachtet werden kann, und empfahl, LLMs anhand mehrerer Kriterien zu bewerten, wobei zukünftige Studien Patientenbewertungen und reale klinische Umgebungen einbeziehen sollten.
Hintergrund
Globale Schätzungen für das Jahr 2020 zeigen, dass etwa 685.000 Frauen an Brustkrebs starben, was etwa 16 % aller Krebstote bei Frauen weltweit ausmacht und die globale gesundheits-Politik-Belastung der Krankheit verdeutlicht.
Obwohl Fortschritte in der Diagnose und Behandlung von Brustkrebs die Überlebensraten verbessert haben, können postoperative körperliche Veränderungen sowie Nebenwirkungen von Chemotherapie und Strahlentherapie zu psychischen Belastungen führen, die Müdigkeit, Angstzustände und Depressionen umfassen können.
Brustkrebspatienten suchen zunehmend zusätzliche Gesundheitsinformationen über ihren Zustand, Behandlung, Genesung und psychologische Anliegen, wobei glaubwürdige und verständliche Informationen ihnen helfen, eine aktivere Rolle in der täglichen Pflege und klinischen Entscheidungen zu übernehmen.
Obwohl moderne dialogfähige große Sprachmodelle personalisierte Gesundheitsinhalte generieren können, bleiben ihre Genauigkeit, Vollständigkeit, Nützlichkeit, Sicherheit, Lesbarkeit und sprachliche Komplexität aktive Forschungsgebiete im Kontext der Unterstützung von Brustkrebsinformationen.
Über die Studie
Die vorliegende Studie hatte zum Ziel, einen Referenzrahmen für die Bewertung der Nutzung von LLMs in Gesundheitsinformationen zu Brustkrebs bereitzustellen, indem die fünf ausgewählten Modelle systematisch verglichen wurden. Diese Modelle wurden ausschließlich über ihre offiziellen Web-Schnittstellen mit Standard-Einstellungen zwischen dem 15. Dezember 2025 und dem 15. Januar 2026 bewertet. Alle Eingabefragen wurden in vereinfachtem Chinesisch eingegeben.
Die Studie bewertete die Leistung der LLMs in drei Hauptaufgaben. Zunächst wurde das standardisierte Wissen durch 90 Multiple-Choice-Fragen aus Lehrbüchern und klinischen Richtlinien bewertet.
Anschließend wurde eine klinische Fallanalyse durchgeführt, bei der den LLMs 10 anonymisierte Patientenfälle aus fünf klinischen Bereichen (Diagnose, Behandlung, postoperative Pflege, psychosoziale Unterstützung sowie Prognosebewertung und Rehabilitation) zur Verfügung gestellt wurden.
Zuletzt bewertete die Studie die Antworten der LLMs auf Patientenanliegen, wobei 20 häufige klinische Fragen über drei Sitzungen hinweg wiederholt wurden, um die Konsistenz und Stabilität der Antworten zu messen. Der Schwierigkeitsgrad der LLM-generierten Texte in chinesischer Sprache wurde objektiv mit Hilfe der Bewertungsplattform der Ludong-Universität (LDU-TGP) quantifiziert.
Drei Brustkrebsspezialisten („Human-Experten“) bewerteten die Antworten der LLMs blind und unabhängig hinsichtlich Vollständigkeit, Richtigkeit, Lesbarkeit, Nützlichkeit und Sicherheit anhand einer 5-Punkte-Likert-Skala. Statistische Analysen verglichen die Modellgenauigkeiten und Expert:innenbewertungen. Die Übereinstimmung zwischen den drei Expertenbewertern war insgesamt schlecht, sodass die individuellen Bewertungen in der Analyse separat beibehalten wurden, anstatt sie zu mitteln.
Studienergebnisse
Die standardisierten Wissensbewertungen der Studie zeigten, dass alle Modelle mit einem hohen Maß an medizinischer Genauigkeit arbeiteten. DeepSeek erzielte die höchste numerische Genauigkeit (94,44 %; 85 von 90 korrekt), gefolgt von ChatGPT-5.2 und ERNIE Bot mit 88,89 % (80 von 90 korrekt), Gemini 3.0 mit 87,78 % (79 von 90 korrekt) und ChatGPT-4o mit 82,22 % (74 von 90 korrekt).
Obwohl die Modelle insgesamt in der Leistung des standardisierten Wissens unterschiedlich waren, ergaben angepasste paarweise Vergleiche keine statistisch signifikanten Unterschiede zwischen den Modellen. Die Ergebnisse belegen daher nicht, dass die Modelle gleichwertig sind.
Die Bewertungen der LDU-TGP zeigten, dass die LLMs erheblich hinsichtlich der Lesekomplexität ihrer Antworten variierten. ChatGPT-5.2 produzierte die komplexesten Texte (Durchschnitt = 21,22; je höher, desto schwieriger), während DeepSeek den wenigsten sprachlich schwierigen und konsistentesten Text in der chinesischen Fallanalyse laut dieser automatisierten Maßnahme erzeugte (Durchschnitt = 13,15).
Die von Experten bewerteten Punktzahlen variierten nach Modell über alle fünf Dimensionen: Vollständigkeit, Richtigkeit, Lesbarkeit, Nützlichkeit und Sicherheit. ChatGPT-5.2 erzielte die höchste Punktzahl in der Vollständigkeit (Durchschnitt = 4,350 von 5,0), während Gemini 3.0 (Durchschnitt = 4,108) und DeepSeek (Durchschnitt = 4,075) in den Dimensionen Lesbarkeit bzw. Sicherheit führten.
ERNIE Bot erhielt die niedrigsten geschätzten Durchschnittswerte in allen fünf Dimensionen, die von Experten bewertet wurden, einschließlich der Vollständigkeit (Durchschnitt = 3,583 von 5,0).
Fazit
Die Studie zeigt, dass die fünf getesteten LLMs insgesamt ähnlich in Bezug auf das standardisierte Wissen über Brustkrebs abschnitten, jedoch in sprachlicher Komplexität und der Qualität der von Experten bewerteten Antworten variierten.
So erhielten ChatGPT-5.2 und DeepSeek höhere Punktzahlen für die Vollständigkeit, während Gemini 3.0 die höchste Punktzahl für die Lesbarkeit erhielt. Die Studie testete jedoch nicht das Verständnis von Patienten oder die Sicherheit und Effektivität dieser Modelle bei direkten klinischen Entscheidungsprozessen. Alle 10 klinischen Fälle stammten auch aus einem einzigen Krankenhaus, was die Übertragbarkeit der Ergebnisse einschränken könnte. Die Autoren forderten dringend Bewertungen aus Sicht der Patienten und Tests in tatsächlichen klinischen Umgebungen, bevor die Ergebnisse in der Praxis angewendet werden.
Quellen:
- Lin, M., Liu, W., & Zeng, Z. (2026). A comparative study of large language models in responding to breast cancer-related questions. Scientific Reports. DOI: 10.1038/s41598-026-70016-4. https://www.nature.com/articles/s41598-026-70016-4
