Ein Test mit 121 echten Geldfragen entlarvt die beliebtesten KI-Chatbots: 57 Prozent der Antworten waren falsch, bei kniffligen Steuer- und Rentenfragen sogar 88 Prozent. Für Firmen, die Mitarbeitern oder Kunden solche Auskünfte zutrauen, wird aus einem Bequemlichkeits-Tool schnell ein Haftungsrisiko.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügenKI-Chatbots beantworten Fragen zur Steuerlast, zur Rente oder zur besten Kredittilgung flüssig und selbstbewusst. Nur stimmt die Auskunft oft nicht. Der Finanztechnik-Anbieter Saturn hat 18 gängige KI-Modelle mit 121 typischen Geldfragen konfrontiert und über 10.000 Antworten ausgewertet.[1]
Das Wichtigste in Kürze
- 57 Prozent aller Antworten waren falsch, bei komplexen Fragen zu Steuer, Rente und Schulden stieg die Fehlerquote auf 88 Prozent.
- Gratis-Modelle patzten häufiger als Bezahlversionen. Selbst das beste Modell lag mit 39 Prozent Fehlern bei jeder dritten Antwort daneben.
- Als Durchfaller zählten nicht nur Rechenfehler, sondern auch fehlende Risikohinweise und frei erfundene Regeln.
- Anlageberatung ist in Deutschland erlaubnispflichtig, die Haftung bleibt beim Anbieter, nicht bei der KI.
Warum scheitern KI-Chatbots ausgerechnet an Geldfragen?

Sprachmodelle rechnen nicht, sondern schätzen den nächstwahrscheinlichen Satz. Eine korrekte Steuerauskunft hängt aber an aktuellen Freibeträgen, Fristen und Prozentsätzen, die je nach Land und Jahr wechseln. Fehlt der passende Wert, erfindet das Modell eine plausibel klingende Regel, statt die Lücke zuzugeben. Genau diese erfundenen Vorgaben wertete Saturn neben Rechenfehlern und fehlenden Warnhinweisen als Durchfaller, ein bekanntes Muster der aktuellen KI-Modelle.
Bei schweren Fragen versagt die KI am häufigsten
Die Fehlerquote wächst mit der Schwierigkeit. Bei fortgeschrittenen Fragen zu Schulden, Studienkrediten, Hypotheken, Renten und Steuern kletterten die Fehler auf 88 Prozent, einzelne Modelle irrten in 99 Prozent der Fälle.[1] Kostenlose KI-Tools schnitten mit 63 Prozent Fehlern schlechter ab als Bezahlmodelle mit 49 Prozent. Selbst der Testsieger Claude Opus 5 im Reasoning-Modus lag bei 39 Prozent daneben, das Schlusslicht Claude Haiku 4.5 bei 82 Prozent. Ausgerechnet bei den komplizierten Fällen, in denen Rat am wertvollsten wäre, antwortet die KI am unzuverlässigsten. Welches Modell wie sauber arbeitet, ordnet auch unser Vergleich der KI-Textgeneratoren ein.
Eine KI, die flüssig formuliert und trotzdem in mehr als der Hälfte der Fälle danebenliegt, ist kein Berater, sondern ein Risiko mit gutem Sprachgefühl. Verlässliche Zahlen erkennt man nicht am Tonfall, sondern an der Quelle.
— Markus Seyfferth, Chefredakteur Dr. Web
Was bedeutet das für Beratung und Haftung im Unternehmen?
Anlageberatung ist in Deutschland erlaubnispflichtig und steht unter Aufsicht der BaFin. Ein Chatbot, der konkrete Geld- oder Anlageempfehlungen ausspricht, kann die Grenze zur regulierten Beratung nach MiFID II überschreiten. Seit August 2026 greift zudem der EU AI Act voll: KI-Systeme im direkten Kundenkontakt unterliegen Transparenzpflichten, automatisierte Finanzberatung kann als Hochrisiko-Anwendung gelten. Der Grundsatz bleibt einfach: Aufgaben lassen sich an eine KI delegieren, die Haftung nicht.
Für Unternehmen folgt daraus zweierlei. Auskünfte zu Steuern, Finanzen oder Recht gehören vor jeder Verwendung gegen eine belastbare Primärquelle oder eine qualifizierte Fachkraft geprüft. KI-generierte Antworten im Kundenkontakt werden als solche gekennzeichnet. Dieselbe Sorgfaltsfrage stellt sich überall dort, wo KI in die Rechtsberatung einzieht. Als Recherchehilfe unter menschlicher Kontrolle bleibt der Chatbot nützlich, als letzte Instanz bei einer Geldentscheidung taugt er nicht.
Quelle
[1] Saturn: „Artificial Authority: Should you trust AI to deliver financial advice?“
Mehr Newshunger?
- Kartellklage gegen OpenAI, Anthropic, Google und xAI: Ist die abgestimmte KI-Bremse illegal?
- ChatGPT weiß über seinen Werbe-Collector, was Nutzer auf anderen Websites tun
- KI-Agenten sprengen das Budget: Warum feste Rollen mehr bringen als mehr Rechenleistung
- Googles Gemini verschafft sich im Sicherheitstest Zugang zu drei echten Firmen
- Kimi K3 auf Amazon Bedrock: Chinas offene KI wird per Klick mietbar