Eine Frau sitzt auf dem Sofa im Wohnzimmer. Auf dem Couchtisch steht ein Windlicht. Außerdem liegen dort einige Blister Tabletten und eine weiße Dose. Die Frau schaut besorgt auf ihr Handy.

Praxis Dr. Chatbot – Wie gut kann KI-Symptome deuten?

Wenn‘s vorne zwickt und hinten beißt, fragen viele heutzutage die KI. ChatGPT, Gemini oder Claude nennen schnell und unkompliziert mögliche Ursachen. Doch wie zuverlässig sind diese „Diagnosen“? Die Stiftung Warentest zeigt: KI kann Symptome sinnvoll einordnen. Den Arzt ersetzen kann sie nicht.

Eine plausible Antwort ist noch keine Diagnose

Generative KI wie ChatGPT, DeepSeek und Co. kann große Mengen medizinischer Informationen verarbeiten und daraus sprachlich verständliche Antworten formulieren. Sie kann beispielsweise erklären, welche Erkrankungen grundsätzlich zu bestimmten Beschwerden passen, welche zusätzlichen Symptome relevant sind oder welche Fragen man beim Arztbesuch stellen könnte.

Das kann gerade bei alltäglichen Beschwerden hilfreich sein. Wer etwa einen medizinischen Fachbegriff aus einem Arztbrief nicht versteht, kann sich diesen von einem Chatbot erklären lassen. Auch als Vorbereitung auf einen Arzttermin kann KI nützlich sein.

Doch zwischen „Welche Ursachen kommen infrage?“ und „Das habe ich“ liegt ein entscheidender Unterschied.

Eine Diagnose beruht nicht allein auf einer Liste von Symptomen. Alter, Vorerkrankungen, Medikamente, körperliche Untersuchung, Laborwerte oder bildgebende Verfahren können eine wichtige Rolle spielen. Ein Chatbot hat auf diese Informationen häufig keinen oder nur einen unvollständigen Zugriff. Und selbst wenn Nutzer viele Informationen eingeben, bleibt immer die Frage, ob wichtige Angaben fehlen.

Hinzu kommt: Eine KI kann eine Antwort überzeugend formulieren, obwohl die zugrunde liegende Einschätzung falsch oder unvollständig ist.

Fünf Bots, fünf Diagnosen

Wie gut die digitalen Helfer mit medizinischen Symptomen umgehen können, hat die Stiftung Warentest 2026 (8/2026Öffnet sich in einem neuen Fenster) genauer untersucht. Getestet wurden fünf weitverbreitete KI-Chatbots: ChatGPT, Gemini, Claude, Meta AI und DeepSeek. Die Tester konfrontierten sie mit fünf fiktiven Krankheitsfällen und prüften nicht nur die vermutete Erkrankung, sondern auch die Empfehlung zum weiteren Vorgehen und vor allem: Erkennt die KI auch einen medizinischen Notfall?

Auf dem Prüfstand standen typische Symptome unter anderem von:

  • Angina pectoris,
  • einem Bandscheibenvorfall,
  • einer Blasenentzündung,
  • einer Depression und
  • dem Restless-Legs-Syndrom.

Drei von fünf lieferten weitgehend richtige Einschätzungen

Drei der fünf geprüften Chatbots lieferten laut Stiftung Warentest weitgehend zutreffende Einschätzungen der Krankheitsbilder. Ein System ordnete alle geprüften Krankheitsbilder weitgehend richtig ein, während zwei Chatbots die Tester mit ihren Antworten eher irritierten.

Das zeigt zweierlei. Erstens: KI kann bei der Einordnung von Symptomen inzwischen erstaunlich hilfreich sein. Zweitens: Die Ergebnisse unterscheiden sich je nach System. Wer einen anderen Chatbot verwendet, kann deshalb auf dieselben Beschwerden eine andere Antwort bekommen.

Für Verbraucher bedeutet das: Eine Aussage wie „Die KI sagt, es ist harmlos“ sollte nicht als medizinische Entwarnung verstanden werden.

Das Problem mit dem plausiblen Irrtum

Eine besondere Schwierigkeit generativer KI besteht darin, dass sie nicht wie ein Arzt „weiß“, was ein Patient hat. ChatGPT, Gemini, DeepSeek und Co. erzeugen Antworten auf Grundlage von Mustern, die sie aus großen Datenmengen gelernt haben – sogenannten Wahrscheinlichkeitsmodellen. Sie prüfen ihre Antworten jedoch nicht auf dieselbe Weise wie eine Ärztin oder ein Arzt eine Diagnose anhand von Krankengeschichte, Untersuchung und medizinischen Befunden. Das Ergebnis kann deshalb sehr kompetent klingen, ohne dass es tatsächlich medizinisch korrekt sein muss.

Ein Chatbot könnte beispielsweise eine harmlose Erklärung für Beschwerden nennen und dadurch den Eindruck vermitteln, dass kein Arztbesuch nötig sei. Umgekehrt kann er auch zahlreiche mögliche Krankheiten aufzählen und damit unnötige Sorgen auslösen.

Laut Stiftung Warentest (8/2026) konnten Wissenschaftler aus Schweden zudem nachweisen, dass die KI bei medizinischen Fragen auch nicht belegte oder frei erfundene Krankheitsbezeichnungen ausgeben kann.

Bereits die Anfrage kann über das Ergebnis entscheiden

Eine weitere Schwierigkeit mit Dr. Chatbot: Bereits die Eingabe der Beschwerden beeinflusst die Ergebnisse. Sind die aufgezählten Symptome nicht vollständig, kann auch die Einschätzung der generativen KI unvollständig oder irreführend sein.

Die Gefahr des „Übervertrauens“

Je souveräner eine KI antwortet, desto leichter fällt es ihr zu vertrauen. Sie klingt freundlich, geduldig und selbstbewusst. Sie kann Rückfragen stellen und ihre Einschätzung ausführlich erklären. Das kann den Eindruck erwecken, man habe es mit einem digitalen Arzt zu tun.

Doch genau vor diesem Übervertrauen in KI wird auch im Zusammenhang mit dem Stiftung-Warentest-Test (8/2026) gewarnt.

Deshalb sollte eine KI-Einschätzung eher als erste Orientierung verstanden werden – nicht als Ersatz für eine medizinische Diagnose.

Auch Datenschutz gehört zur Diagnosefrage

Wer Symptome in einen Chatbot eingibt, sollte sich außerdem fragen: Welche persönlichen Gesundheitsdaten gebe ich hier eigentlich preis?

Gesundheitsinformationen gehören zu den besonders sensiblen personenbezogenen Daten. Deshalb sollte man vor der Eingabe prüfen, wie ein Dienst mit den Daten umgeht, welche Einstellungen zur Speicherung und Nutzung von Chats bestehen und ob persönliche Angaben überhaupt notwendig sind.

Bei Diensten, die Daten in Ländern außerhalb der EU verarbeiten, können andere rechtliche Rahmenbedingungen gelten. Deshalb lohnt sich ein Blick darauf, welche Daten gespeichert werden, wofür sie verwendet werden und ob sie an Dritte oder in Drittländer übermittelt werden. Deutsche Datenschützer und auch Stiftung Warentest (8/2026) warnen unter anderem im Zusammenhang mit der chinesischen KI DeepSeek vor Datenschutzrisiken.

Name, Adresse oder konkrete Kontaktdaten gehören in der Regel nicht in eine Anfrage, wenn sie für die Beantwortung keine Rolle spielen.

Statt „Ich bin Max Mustermann, 57 Jahre alt, wohne in … und nehme Medikament XY“ kann beispielsweise eine möglichst anonymisierte Frage formuliert werden – so weit die Information für die konkrete Frage nicht benötigt wird.

Symptom-Checker als Alternative?

Wer seine Beschwerden digital einordnen möchte, kann auch speziell dafür entwickelte Symptom-Checker nutzen. Auch hier können Beschwerden geschildert werden, um mögliche Ursachen oder Krankheitsbilder einzuordnen und Hinweise zur Dringlichkeit einer medizinischen Abklärung zu erhalten. Stiftung Warentest empfiehlt hierfür Symptomate (Browseranwendung) und Ada (App).

Auch Symptom-Checker ersetzen allerdings keine ärztliche Untersuchung. Sie sind darauf ausgelegt, Beschwerden strukturiert abzufragen und Hinweise auf mögliche Ursachen oder die Dringlichkeit einer medizinischen Abklärung zu geben.

Wann KI besser Pause hat

Bei akuten Warnzeichen sollte die Frage nicht lauten: „Was sagt mein Chatbot dazu?“

Starke oder neu auftretende Brustschmerzen, erhebliche Atemnot, Bewusstlosigkeit, Lähmungserscheinungen oder andere schwere akute Beschwerden gehören medizinisch abgeklärt. Bei einem möglichen Notfall sollte professionelle Hilfe organisiert werden, statt erst mehrere KI-Antworten zu vergleichen.

Auch bei psychischen Krisen gilt: Ein Chatbot kann Informationen geben, aber er ersetzt keine professionelle Hilfe. Bei akuter Gefahr sollte unmittelbar Unterstützung durch medizinische oder psychiatrische Notfallangebote gesucht werden.

(sie)

Stand: September 2026