Murphy Trueman schreibt über Designsysteme und führt eine Datei namens „Literary Graveyard“ mit Wörtern wie „genuinely“ und „quiet“, die Leser inzwischen für Spuren von KI halten. Eine Podcast-Analyse aus dem Max-Planck-Institut für Bildungsforschung belegt, dass Menschen das Vokabular von ChatGPT erst übernehmen und später meiden. Für Redaktionen taugt ein Detektor-Ergebnis deshalb nicht als Beweis für Maschinenarbeit.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügenAus Angst vor KI-Detektoren durchsucht Murphy Trueman jeden fertigen Text nach Verdachtsmomenten. Vor der Veröffentlichung ersetzt Trueman Gedankenstriche durch Kommas oder Punkte und tauscht Wörter wie „honest“ oder „worth“ gegen neutralere aus.[1] Eine frühere Führungskraft hatte verlangt, die grammatisch korrekten Gedankenstriche zu streichen, damit niemand den Text für KI-generiert hält.
Das Wichtigste in Kürze
- Forscher des Max-Planck-Instituts für Bildungsforschung werteten 737.083 Stunden Podcast-Gespräche aus und führen den Anstieg von Wörtern wie „delve“ auf den Start von ChatGPT zurück.
- Nach Mitte 2024 kippte der Effekt: Über alle Podcast-Kategorien hinweg fiel „delve“ 35 % unter das erwartete Niveau.
- Warum Sprachmodelle solche Wörter bevorzugen, ist nicht abschließend geklärt, das Experiment der Florida State University blieb ohne eindeutiges Ergebnis.
- Der AI Act verzichtet bei KI-Texten von öffentlichem Interesse auf die Hinweispflicht, sobald ein Mensch prüft und eine Redaktion verantwortlich zeichnet.
Warum streichen sorgfältige Autoren Wörter, die nach KI klingen?

Sorgfältige Autoren streichen solche Wörter, weil Leser, Vorgesetzte und Prüfsoftware einen sauberen, gleichmäßigen Stil inzwischen als Indiz für KI werten. Murphy Trueman beschreibt diesen Druck in einem Essay vom 28. September.[1]
Trueman kennt einen ähnlichen Kreislauf aus jahrelanger Arbeit an Produkten und Designsystemen. Ein Muster landet im System, andere Teams übernehmen die Vorlage und irgendwann gilt die bloße Verbreitung als Beleg dafür, dass die Vorlage richtig ist.[1] Schon im August beschrieb Trueman, warum in Designsystemen jede Kopie nach echter Nutzung aussieht.
In der Sprache fehlt nach Truemans Einschätzung ein Maßstab, an dem sich die Richtung des Einflusses prüfen ließe. Die Wörter auf der Streichliste stammen ursprünglich von menschlichen Autoren, von denen die Modelle diesen Stil erst lernten. Klare, strukturierte Fachtexte geraten so besonders leicht unter Verdacht.
Was zeigen die Studien zum Wort „delve“?
Menschen übernahmen nach dem Start von ChatGPT dessen Lieblingswörter und mieden diese Wörter später wieder. Den Beleg lieferte ein Team des Max-Planck-Instituts für Bildungsforschung in Berlin mit einer Auswertung von 737.083 Stunden ungeskripteter Gespräche aus 824.634 Podcast-Folgen.[2]
Wörter wie „delve“, „showcase“ und „meticulous“ nahmen in spontaner Rede sprunghaft zu. Ein vorregistriertes Experiment mit 496 Versuchspersonen bestätigte den Mechanismus: Schon ein kurzer Chat mit einem Chatbot genügte, damit die Teilnehmenden dessen Wörter in ihren aktiven Wortschatz übernahmen.[2]
Die überarbeitete Fassung der Studie vom Juli 2026 dokumentiert die Kehrtwende. Nach einem Höhepunkt um Mitte 2024 sank „delve“ in den folgenden Monaten über alle Kategorien hinweg 35 % unter das Niveau, das ohne ChatGPT zu erwarten gewesen wäre.[2] Die Forscher sehen darin ein Muster, das an Hyperkorrektur erinnert: Sprecher meiden Formen, die als KI-typisch gelten. Das Team warnt außerdem, dass solche Wörter bald für geringere Kompetenz oder unkritische KI-Nutzung stehen könnten. Für deutsche Texte fehlt eine vergleichbare Messung, die Daten stammen ausschließlich aus englischsprachigen Podcasts.
Die Herkunft der Modellvorlieben erzählt Truemans Essay eindeutiger, als die Forschung hergibt. Tom Juzek und Zina Ward von der Florida State University fanden 21 Wörter, deren Zunahme in wissenschaftlichen Abstracts wahrscheinlich auf Sprachmodelle zurückgeht.[3] Die Modelltests der beiden passen zur These, dass menschliches Feedback im Training diese Wörter fördert. Das Online-Experiment mit 201 Teilnehmenden aus Indien werten die Autoren selbst als nicht eindeutig. Welche Vokabeln aktuell auffallen, zeigt unser Überblick über typische Wörter in KI-Texten.
Rückgang von „delve“ unter das erwartete Niveau nach Kategorie
Ende 2022
ChatGPT startet für die breite Öffentlichkeit
Ab hier misst die Studie die Wirkung
Bis Mitte 2024
„delve“, „showcase“ und „meticulous“ nehmen in spontaner Rede sprunghaft zu
Menschen übernehmen das Vokabular des Chatbots
Danach
„delve“ fällt unter das erwartete Niveau
Die Forscher erkennen darin ein Muster der Hyperkorrektur
Ein Detektor-Score bewertet die Oberfläche eines Textes und nicht die Arbeit, die darin steckt. Redaktionen sollten ihre Prüfschritte dokumentieren, statt gute Wörter auf den Index zu setzen.
Markus Seyfferth, Chefredakteur Dr. Web
Was taugen KI-Detektoren als Beweis?
Als Beweis taugen KI-Detektoren wenig, weil ein klar und gleichmäßig geschriebener Text genau den Mustern ähnelt, auf die solche Prüfprogramme reagieren. Trueman fasst die Kriterien so zusammen: Auffällig wird ein Text, dessen Wortwahl ein Modell vorhersagen würde und dessen Sätze ähnlich lang sind.[1]
Frühe Werkzeuge wie GPTZero arbeiteten mit Perplexität, also der Wahrscheinlichkeit, mit der ein Sprachmodell genau diese Wortfolge gewählt hätte, und mit der Schwankung dieses Werts von Satz zu Satz.[4] Seit Herbst 2023 nutzt GPTZero nach eigenen Angaben ein Deep-Learning-Modell. Die Fehlerquote bleibt trotzdem das Kernproblem, wie unser Bericht über die Grenzen der KI-Text-Erkennung zeigt: In einer Stanford-Untersuchung stuften gängige Detektoren über 61 % der Aufsätze von Nicht-Muttersprachlern fälschlich als KI-Text ein.
Langfristig droht beiden Seiten eine Verarmung. Ein Team um Ilia Shumailov zeigte 2024 in Nature, dass Modelle beim Training mit Ausgaben anderer Modelle zuerst die seltenen Ränder der ursprünglichen Daten verlieren.[5] Trueman erkennt im eigenen Streichen dieselbe Bewegung im Kleinen, denn jeder getilgte Ausdruck rückt den Text ein Stück zur Mitte. Für Oberflächen beschreibt unser Beitrag über den Einheitslook von SaaS-Anwendungen ein verwandtes Phänomen.
Was bedeutet der KI-Verdacht für Redaktionen und Agenturen?
Für Redaktionen zählt die nachweisbare Prüfung durch Menschen. Nach Artikel 50 Absatz 4 des AI Act entfällt seit dem 2. August 2026 die Hinweispflicht für KI-Texte zu Themen von öffentlichem Interesse, sobald ein Mensch den Text prüft und eine Person die redaktionelle Verantwortung trägt.[6]
Google stellt ebenfalls die Qualität eines Inhalts in den Mittelpunkt und verlangt seit dem 1. Oktober ausdrücklich einen Faktencheck von Hand für KI-Inhalte. Ein Detektor-Score spielt in beiden Regelwerken keine Rolle.
Agenturen und Personalabteilungen sollten Detektor-Ergebnisse deshalb weder in Abnahmen noch in Mitarbeitergesprächen als Beleg verwenden. Mehr Aussagekraft hat ein kurzes Protokoll, das Recherche, Quellen und Überarbeitungsschritte festhält. Interne Stilregeln sollten Verständlichkeit fördern und abgegriffene Floskeln aussortieren, wie die Regeln des quelloffenen Werkzeugs Clarity zeigen. Weitere Hintergründe bündelt unsere KI-Rubrik.
Quellen
[1] Murphy Trueman: „I can’t tell who’s teaching who anymore“
[2] arXiv, Yakura et al. (Max-Planck-Institut für Bildungsforschung): „Empirical evidence of Large Language Model’s influence on human spoken communication“
[3] arXiv, Juzek und Ward (Florida State University): „Why Does ChatGPT ‚Delve‘ So Much? Exploring the Sources of Lexical Overrepresentation in Large Language Models“
[4] GPTZero: „Perplexity, burstiness, and statistical AI detection“
[5] Nature, Shumailov et al.: „AI models collapse when trained on recursively generated data“
[6] EUR-Lex: „Verordnung (EU) 2024/1689 (KI-Verordnung), Artikel 50“
Mehr Newshunger?
- KI-Wasserzeichen im Text: Anthropic markiert jede Antwort von Claude
- Paraphrasierungs-Tools: Wo die Maschine an Grenzen stößt
- KI-Plakate sehen alle gleich aus: warum ein Stilname den Unterschied macht
- Beiersdorf schafft eine eigene Stelle für die KI-Kommunikation
- An diesen Wörtern erkennen Sie KI-Texte: Warum Sprachmodelle immer zu denselben Vokabeln greifen
- KI-Text-Erkennung in der Wissenschaft: Wo die Messung scheitert
