Start / Magazin / KI, Automatisierung & Reporting
KI-Texte erkennen: funktionieren Wasserzeichen wirklich?
ArtikelKI, Automatisierung & Reporting04.05.2025/img/magazin/9ecc3df8b0b8.webp
Alles auf einen Blick
- Es gibt kein Verfahren, das KI-Texte verlässlich erkennt. OpenAI hat sein eigenes Erkennungswerkzeug am 20. Juli 2023 abgeschaltet, ausdrücklich wegen zu geringer Treffsicherheit.
- OpenAI hat ein Textwasserzeichen entwickelt und nennt es sehr treffsicher, veröffentlicht hat es die Firma nie. Die Begründung steht seit dem 4. August 2024 im Firmenblog.
- Das eigentliche Problem sind Falschmeldungen. Sieben Detektoren stuften 61,22 Prozent von 91 menschlich geschriebenen TOEFL-Aufsätzen als KI-Text ein.
- Google erlaubt KI-Inhalte ausdrücklich. Verboten ist nicht die Herstellung, sondern die Masse ohne Mehrwert, in Googles Worten "scaled content abuse".
- KI-Produkttexte sind erlaubt und üblich. Entscheidend sind Prüfstufe, eigene Daten und eine Person, die freigibt.
- Prüf Texte inhaltlich: Quellen, Stichproben und Rückfragen bringen mehr als jede Prozentanzeige.
Inhaltsverzeichnis9 Abschnitte
Die Frage kommt in fast jedem Gespräch über Texte: Kann man erkennen, ob das eine KI geschrieben hat? Dahinter steckt meistens eine zweite, nämlich ob Google es erkennt und ob das Folgen hat. Beide Fragen lassen sich beantworten, aber die Antwort fällt anders aus, als die Anbieter von Erkennungswerkzeugen es gern hätten.
Ich nutze selbst KI für Entwürfe. Jeder Text hier entsteht als Rohfassung mit einem Sprachmodell, wird gegen Primärquellen geprüft und von mir freigegeben. Genau deshalb habe ich mir angesehen, was an den Erkennungsverfahren dran ist, was OpenAI und Google selbst dazu sagen und was das für Shops und Auftraggeber bedeutet.
Die ehrliche Antwort zuerst: verlässlich geht es nicht
Am 31. Januar 2023 veröffentlichte OpenAI einen "AI Text Classifier". Die Zahlen standen in der eigenen Ankündigung: Auf einem englischsprachigen Testsatz erkannte das Werkzeug 26 Prozent der KI-Texte korrekt und stufte 9 Prozent der menschlichen Texte fälschlich als KI-Text ein. OpenAI schrieb dazu: "It should not be used as a primary decision-making tool".
Am 20. Juli 2023 wurde es abgeschaltet. Der Satz steht bis heute oben auf derselben Seite: "As of July 20, 2023, the AI classifier is no longer available due to its low rate of accuracy."
Noch deutlicher wird OpenAI im Hilfebereich für Lehrkräfte. Auf die Frage "Do AI detectors work?" lautet die Antwort: "In short, not in our experience." Und als Beispiel: "When we at OpenAI tried to train an AI-generated content detector, we found that it labeled human-written text like Shakespeare and the Declaration of Independence as AI-generated."
Wichtig
ChatGPT selbst kann nicht beurteilen, ob ein Text von einer KI stammt. OpenAI schreibt dazu: "ChatGPT has no 'knowledge' of what content could be AI-generated. It will sometimes make up responses to questions like 'did you write this [essay]?'" Wer ein Sprachmodell fragt, ob es einen Text geschrieben hat, bekommt eine erfundene Antwort, keine Prüfung.
Wie die Verfahren funktionieren
Es gibt vier Ansätze, und sie unterscheiden sich grundlegend darin, wie sicher sie sein können.
Statistische Merkmale: Perplexität und Burstiness
Das ist die Technik hinter fast allen frei zugänglichen Detektoren. Perplexität misst, wie überraschend ein Text für ein Sprachmodell ist. Folgt auf "meine liebsten tropischen Früchte sind Mango und" das Wort "Bananen", ist die Perplexität niedrig. Burstiness beschreibt die Schwankung: Menschen mischen kurze und lange Sätze, KI-Text läuft gleichmäßiger.
Der Haken ist offensichtlich, sobald man ihn ausspricht. Niedrige Perplexität heißt nicht "von einer KI geschrieben", sondern "sprachlich wenig überraschend". Das trifft auf Nicht-Muttersprachler zu, auf Behördendeutsch und auf jeden gut redigierten Sachtext. Die Stanford-Studie von Weixin Liang und Kollegen liefert die Gegenprobe: Ließ das Team ChatGPT die Wortwahl amerikanischer Schüleraufsätze vereinfachen, stieg die Fehlerquote der Detektoren von 5,19 auf 56,65 Prozent. Die Texte blieben menschlich, nur einfacher formuliert.
Wasserzeichen im Text
Hier hält sich die Behauptung, OpenAI habe sich sichtbar nur um Bildwasserzeichen gekümmert. Das stimmt nicht. Im Beitrag "Understanding the source of what we see and hear online" steht seit dem 4. August 2024: "Our teams have developed a text watermarking method that we continue to consider as we research alternatives." Es sei "highly accurate and even effective against localized tampering, such as paraphrasing", aber "less robust against globalized tampering", also gegen Übersetzung oder gegen ein zweites Modell, das den Text neu schreibt.
Drei Gründe nennt OpenAI gegen die Veröffentlichung. Die leichte Umgehbarkeit. Ein Fairnessproblem, im Wortlaut: "it could stigmatize use of AI as a useful writing tool for non-native English speakers." Und die Menge: "applying it to large volumes of text would lead to a large number of total false positives." Stand 18. September 2026 ist das der letzte öffentliche Stand. Ausgerollt ist nichts, ein öffentliches Prüfwerkzeug für Text gibt es nicht.
Google ist weiter. SynthID setzt ein Wasserzeichen in Texte aus der Gemini-App, indem die Wahrscheinlichkeiten der nächsten Wörter minimal verschoben werden. Nur: Die öffentliche Prüfmöglichkeit in Gemini gilt laut Google für Bilder, Video und Audio. Für Text gibt es keinen solchen Knopf, und er würde ohnehin nur Googles eigene Modelle abdecken.
Metadaten und Herkunftsnachweise
Der dritte Weg dreht die Logik um. Statt einen Text zu analysieren, hängt man beim Erzeugen eine signierte Herkunftsangabe an. So arbeitet C2PA, die Coalition for Content Provenance and Authenticity, inzwischen ein Projekt der Linux Foundation. Das Ergebnis heißt Content Credentials und wirkt laut C2PA "like a nutrition label for digital content".
OpenAI hängt C2PA-Daten an alle Bilder aus DALL·E 3 und an Sora-Videos. Der Vorteil steht in OpenAIs eigenem Text: "unlike watermarking, metadata is cryptographically signed, which means that there are no false positives." Der Nachteil auch: "People can still create deceptive content without this information (or can remove it)." Ein Screenshot genügt. Für Text gibt es keine nennenswerte Umsetzung.
Gut zu wissen
Ein fehlendes Wasserzeichen ist kein Beweis für einen Menschen. Diese Verfahren können belegen, dass etwas von einer KI stammt. Sie können nie belegen, dass etwas nicht von einer KI stammt.
| Verfahren | Wie es arbeitet | Wo es scheitert |
|---|---|---|
| Statistische Detektoren | Messen Perplexität und Satzvariation | Falschmeldungen bei einfacher Sprache, leicht umgehbar |
| Textwasserzeichen | Verschiebt Wortwahrscheinlichkeiten beim Erzeugen | Übersetzung löscht es, gilt nur pro Anbieter |
| Metadaten, C2PA | Signierte Herkunftsangabe an der Datei | Lässt sich entfernen, für Text kaum verbreitet |
| Menschliche Prüfung | Fakten, Quellen, Rückfragen | Kostet Zeit, sagt nichts über die Herstellung |
Warum Falschmeldungen das eigentliche Problem sind
Ein Detektor, der KI-Texte übersieht, ist ärgerlich. Einer, der einen Menschen fälschlich beschuldigt, richtet Schaden an. Genau das passiert, systematisch bei bestimmten Gruppen.
Liang und Kollegen testeten sieben verbreitete Detektoren an 91 von Menschen geschriebenen TOEFL-Aufsätzen und 88 Aufsätzen amerikanischer Achtklässler. Bei den amerikanischen Aufsätzen lagen die Werkzeuge fast fehlerfrei. Bei den TOEFL-Aufsätzen, also Texten von Nicht-Muttersprachlern, lag die Falschmeldungsquote im Schnitt bei 61,22 Prozent. 89 der 91 Aufsätze, also 97,80 Prozent, markierte mindestens ein Werkzeug als KI-Text. Die Studie erschien im Juli 2023 in der Zeitschrift Patterns.
Die zweite große Untersuchung stammt von Debora Weber-Wulff und einem europäischen Team, 2023 im International Journal for Educational Integrity. Getestet wurden 14 Werkzeuge an 54 Dokumenten, insgesamt 756 Einzelprüfungen, zwischen März und Mai 2023. Das Fazit im Wortlaut: "Detection tools for AI-generated text do fail, they are neither accurate nor reliable (all scored below 80% of accuracy and only 5 over 70%)."
| Textart | Trefferquote | Was das bedeutet |
|---|---|---|
| Mensch, direkt auf Englisch | 96 Prozent | Der Idealfall, den die Anbieter zeigen |
| Mensch, maschinell übersetzt | rund 20 Punkte niedriger | Wer DeepL nutzt, gerät unter Verdacht |
| KI-Text, danach umformuliert | 26 Prozent | Ein Umschreibedurchgang genügt zur Tarnung |
Sechs der 14 Werkzeuge produzierten Falschmeldungen, bei einem lag die Quote bei 50 Prozent. Als Beweismittel halten die Autoren sie für untauglich. Selbst der Anbieter mit den besten Werten relativiert. Turnitin wirbt mit "a less than 1% false positive rate" und schreibt im selben Beitrag "our false positive rate is not zero". Bei 5.000 geprüften Texten sind das bis zu 50 Menschen, die zu Unrecht beschuldigt werden.
Dazu kommt die Länge. OpenAI notierte für das eigene Werkzeug: "The classifier is very unreliable on short texts (below 1,000 characters)." Das sind etwa 150 Wörter. Produktbeschreibungen, Teaser und Kategorietexte liegen alle darunter. Genau bei den Texten, um die es im Shop geht, taugen Detektoren am wenigsten.
Was Google dazu sagt
Googles Position steht seit dem 8. Februar 2023 unverändert öffentlich und ist eindeutig. Die Überschrift des Beitrags lautet "Rewarding high-quality content, however it is produced". In der FAQ steht auf die Frage, ob KI-Inhalte gegen die Richtlinien verstoßen: "Appropriate use of AI or automation is not against our guidelines. This means that it is not used to generate content primarily to manipulate search rankings, which is against our spam policies."
Zwei weitere Sätze aus derselben FAQ kann man Kunden vorlegen: "Using AI doesn't give content any special gains. It's just content." Und: "If you see AI as an inexpensive, easy way to game search engine rankings, then no."
Verboten ist also nicht die Herstellung, sondern die Masse. Die Spam-Richtlinie "Scaled content abuse" nennt als Beispiel wörtlich: "Using generative AI tools or other similar tools to generate many pages without adding value for users." Googles Richtlinien für die Qualitätsbewerter, Abschnitt 4.6.5, sind noch deutlicher: "Pages and websites made up of content created at scale with no original content or added value for users, should be rated Lowest, no matter how they are created."
"No matter how they are created" ist der Kern. Google interessiert sich nicht für das Werkzeug, sondern für Zahl und Nutzen. Dreißig generierte Ratgeber ohne eigenen Beitrag fallen darunter, ein recherchierter Text mit eigenen Zahlen nicht. Wie Google Qualität und Vertrauen beschreibt, steht in der Erklärung zu E-E-A-T.
Zur Kennzeichnung sagt Google nichts Verpflichtendes, aber etwas Konkretes. Im Leitfaden zu hilfreichen Inhalten steht: "AI or automation disclosures are useful for content where someone might think 'How was this created?'" KI als Autor auszuweisen hält Google dagegen für falsch.
Was das praktisch für Shops heißt
Produkttexte mit KI zu erzeugen ist erlaubt, üblich und in großen Sortimenten alternativlos. Kein Mensch schreibt 8.000 Varianten von Hand. Die Frage ist nicht ob, sondern mit welcher Prüfstufe. Wie das in die übrige Arbeit passt, steht im Überblick zu SEO für Online-Shops. Vier Punkte trennen nützlich von Spam:
- Eigene Daten. Maße, Materialien, Passformhinweise, Retourengründe, Fragen aus dem Kundendienst. Das Modell kann nur ordnen, was du ihm gibst. Ohne eigene Substanz entsteht genau der austauschbare Text, den Google beschreibt.
- Faktenprüfung bei jedem Wert. Sprachmodelle erfinden Zahlen, wenn sie keine haben. Jede Angabe zu Größe, Inhaltsstoff oder Garantie gehört gegen das Datenblatt geprüft.
- Stichprobe statt Vollprüfung. Zieh pro Charge 20 bis 30 Texte zufällig, prüf sie vollständig und miss die Fehlerquote. Liegt sie über deiner Schwelle, geht die ganze Charge zurück.
- Eine verantwortliche Person. Nicht "das Team", sondern ein Name, der freigibt. Daran unterscheidet sich sauberer Einsatz von Fließbandproduktion.
Für Bilder ist Google konkreter als für Text: Wer KI-Bilder über das Merchant Center ausliefert, muss sie in den Bildmetadaten als solche ausweisen, und für KI-erzeugte Titel und Beschreibungen sind eigene Angaben vorgesehen. Das ist keine Empfehlung, sondern eine Datenanforderung.
Wichtig
Seit dem 2. August 2026 gilt Artikel 50 der KI-Verordnung der EU. Er verpflichtet die Anbieter der KI-Systeme, ihre Ausgaben maschinenlesbar zu markieren. Für dich als Betreiber gilt Absatz 4: Offenlegen musst du nur bei Text, der veröffentlicht wird "with the purpose of informing the public on matters of public interest", und die Pflicht entfällt, "where the AI-generated content has undergone a process of human review or editorial control and where a natural or legal person holds editorial responsibility". Produktbeschreibungen fallen nach dem Wortlaut nicht darunter. Ich bin kein Anwalt, für den Einzelfall gehört das geprüft.
Für Auftraggeber: so prüfst du Texte wirklich
Woran erkennst du, ob ein bezahlter Text seinen Preis wert ist? Die Antwort funktioniert unabhängig davon, ob eine KI beteiligt war, denn schlechte Texte von Menschen fallen durch dieselben Prüfungen. Das gilt auch, wenn du SEO gerade erst entdeckst.
| Prüfschritt | Konkrete Frage | Was ein Nein bedeutet |
|---|---|---|
| Quellen | Steht hinter jeder Zahl eine Primärquelle mit Datum? | Die Zahl kann erfunden sein, egal wer sie schrieb |
| Stichprobe | Drei zufällige Behauptungen nachschlagen. Stimmen alle drei? | Stimmt nur eine von dreien, ist der Text unbrauchbar |
| Eigenanteil | Was steht drin, das nicht in den ersten fünf Treffern steht? | Austauschbarer Text, der nichts trägt |
| Rückfrage | Kann die Person zwei Sätze zum Thema frei erklären? | Niemand hat das Thema verstanden, nur formuliert |
| Aktualität | Sind Jahreszahlen und Rechtslage aktuell? | Modellwissen mit Stichtag, ungeprüft übernommen |
Tipp
Nimm die Quellenpflicht in den Auftrag auf, bevor geschrieben wird. Ein Satz genügt: Jede Zahl, jedes Zitat und jede Rechtsaussage wird mit Link und Abrufdatum belegt, sonst fliegt sie raus. Einen sauber arbeitenden Dienstleister kostet das nichts, schlechte Arbeit wird sofort sichtbar. Wo dein Shop inhaltlich steht, klärt vorher ein Shop-Check.
Mein eigener Ablauf
Über KI-Texte zu schreiben und den eigenen Einsatz zu verschweigen wäre unehrlich. Mein Ablauf hat drei Stufen.
Erstens Recherche und Entwurf. Die Primärquellen kommen zuerst: Googles Dokumentation, Blogbeiträge mit Datum, Studien, Gesetzestexte. Danach entsteht die Rohfassung mit einem Sprachmodell, auf Basis dieser Quellen und meiner Notizen aus Kundenprojekten.
Zweitens Faktencheck gegen die Primärquelle. Jede Zahl und jedes Zitat hier habe ich an der Originalseite nachgelesen, nicht in einer Zusammenfassung. Was ich nicht belegen kann, streiche ich. Deshalb bringt KI hier keine Zeitersparnis von 90 Prozent, sondern eher von 30.
Drittens Freigabe durch einen Menschen. Ich lese den fertigen Text vollständig, kürze, was nur schön klingt, und veröffentliche unter meinem Namen. Wenn hier etwas falsch ist, ist es mein Fehler, nicht der eines Modells. Dieselbe Trennung nutze ich in der KI-Automatisierung: Die Maschine erzeugt und sortiert, ein Mensch gibt frei.
Häufige Fragen
Erkennt Google, ob ein Text von einer KI stammt?
Google macht dazu keine Angaben und hat nie behauptet, KI-Texte als solche zu identifizieren. Bewertet werden Qualität, Originalität und Zweck. Die Spam-Richtlinie zu Inhalten in großer Zahl gilt laut Googles Qualitätsrichtlinien ausdrücklich unabhängig von der Herstellungsart.
Werden Seiten mit KI-Texten abgestraft?
Nicht für den Einsatz von KI. Abgestraft wird das massenhafte Erzeugen von Seiten ohne Mehrwert. Der Unterschied liegt in Zahl und Nutzen, nicht im Werkzeug.
Kann ich mich auf einen Detektor verlassen, wenn er 99 Prozent anzeigt?
Nein. Die Anzeige ist eine Wahrscheinlichkeit aus einem statistischen Modell, kein Nachweis. Eine Prozentzahl ohne nachprüfbare Begründung ist als Beleg wertlos.
Muss ich KI-Texte in Deutschland kennzeichnen?
Artikel 50 Absatz 4 der KI-Verordnung sieht für redaktionelle Texte mit menschlicher Prüfung und benannter Verantwortung ausdrücklich eine Ausnahme vor, und Produktbeschreibungen erfüllen die Voraussetzung "informing the public on matters of public interest" nach dem Wortlaut nicht. Google empfiehlt eine Angabe dort, wo Leser sich fragen würden, wie ein Inhalt entstanden ist. Im Zweifel fragst du besser einen Anwalt als einen SEO.
Warum veröffentlicht OpenAI sein Textwasserzeichen nicht?
Drei Gründe nennt OpenAI: leichte Umgehbarkeit durch Übersetzung oder Umformulierung, die Gefahr, Nicht-Muttersprachler zu stigmatisieren, und die Menge an Falschmeldungen, die selbst eine niedrige Fehlerquote bei vielen Texten erzeugt.
Quellen
- OpenAI: New AI classifier for indicating AI-written text
- OpenAI: Understanding the source of what we see and hear online
- OpenAI Help Center: How can educators respond to students presenting AI-generated content as their own?
- Patterns, Cell Press: GPT detectors are biased against non-native English writers
- International Journal for Educational Integrity: Testing of detection tools for AI-generated text
- Turnitin: Understanding false positives within our AI writing detection capabilities
- Google Search Central: Google Search's guidance about AI-generated content
- Google Search Central: Spam policies for Google web search
- Google Search Central: Creating helpful, reliable, people-first content
- Google DeepMind: SynthID
- C2PA: Coalition for Content Provenance and Authenticity
- EUR-Lex: Verordnung (EU) 2024/1689 über künstliche Intelligenz
- EU Artificial Intelligence Act: Article 50, Transparency Obligations
Das für deinen Shop umsetzen?
Drei Fragen, sofort eine Einschätzung, danach drei konkrete Punkte von mir persönlich. Kostenlos.
Weitere Artikel
aus dem Magazin.
Alle ArtikelSEO-Monitoring-Tools: Sichtbarkeit richtig überwachen
Deine Website steht nie still. Google rollt ein Update aus, dein Shop bekommt eine neue Version, ein Plugin setzt ein noindex, wo keines hingehört, und der Server hat eine schlechte Nacht. Ohne Überwachung merkst …
Warum Ahrefs andere Zahlen zeigt als die Search Console
Stell dir folgende Lage vor, die Zahlen sind ausgedacht, der Fall ist Alltag: Die Google Search Console zeigt 412 Klicks im letzten Monat. Ahrefs zeigt für dieselbe Domain 3.100 Besucher aus der organischen Suche. …
Context Engineering: so gibst du der KI den richtigen Kontext
Du gibst einem Sprachmodell zweimal dieselbe Anweisung und bekommst zweimal ein anderes Ergebnis. Beim ersten Mal stimmen die Maße im Produkttext, beim zweiten Mal erfindet das Modell eine Materialangabe dazu. Am …

