Anthropic setzt Wasserzeichen: neue Claude-Modelle markieren ihre Texte
Anthropic markiert die Ausgaben seiner neuen Modelle. Alle Claude-Modelle, die ab dem 2. August 2026 erschienen sind, weben ein unsichtbares Wasserzeichen in den erzeugten Text und hängen signierte Herkunfts-Metadaten an erzeugte Dateien. Den Anfang machen Claude Fable 5.1 und Claude Mythos 5.1, beide veröffentlicht am 1. September 2026. Ältere Modelle wie Claude Opus 5 oder Sonnet 5 sind nicht rückwirkend markiert.
Was Anthropic umgesetzt hat
- Stichtag 2. August 2026 — Modelle ab diesem Datum markieren ihre Ausgaben ab Start.
- Betroffen sind zunächst Claude Fable 5.1 und Claude Mythos 5.1.
- Zwei Mechanismen: ein statistisches Wasserzeichen im Text und signierte Provenance-Metadaten an Dateien.
- Das Textverfahren ist mit SynthID-Text (Google DeepMind, 2024) verwandt: die Wortwahl wird nach einem geheimen Schlüssel minimal verschoben.
- Code bleibt weitgehend unmarkiert — Kommentare, Docstrings und Dokumentation sind Prosa und tragen das Muster.
- Die Detection-API läuft zunächst als Private Preview für ausgewählte Organisationen.
Was vorher galt
Bis Sommer 2026 gab es für KI-Texte praktisch keine belastbare Herkunftsprüfung. Bilder und Videos wurden von mehreren Anbietern schon länger markiert — Google mit SynthID, OpenAI und Microsoft über C2PA-Metadaten in ihren Bildprodukten. Text war die Lücke: Wer wissen wollte, ob ein Artikel von einem Modell stammt, war auf statistische KI-Detektoren angewiesen, die anhand von Stilmerkmalen raten und dafür bekannt hohe Fehlerquoten haben.
Der Grund für die Lücke war weniger technisch als wirtschaftlich. Verfahren für Text-Wasserzeichen existierten seit Jahren; Google DeepMind veröffentlichte SynthID-Text 2024. Ausgerollt hat sie kaum jemand — die Sorge, Nutzer an nicht markierende Konkurrenz zu verlieren, war in einem Markt mit austauschbaren Modellen ein reales Gegenargument.
Was jetzt gilt
1. Der Text selbst trägt die Markierung. Ein Sprachmodell hat an jeder Stelle mehrere gleichwertige Fortsetzungen zur Auswahl. Beim Wasserzeichnen wird diese Auswahl nach einem geheimen Schlüssel leicht verzerrt getroffen. Ein einzelnes Wort verrät nichts; über einen ausreichend langen Text entsteht daraus ein statistisches Muster, das ein Detektor mit dem Schlüssel wiederfindet. Das Verfahren ist unsichtbar und überlebt Copy-Paste.
2. Dateien bekommen zusätzlich signierte Metadaten. Der zweite Mechanismus verändert den Inhalt nicht, sondern hängt einen kryptografisch signierten Datensatz an die erzeugte Datei. Das ist eindeutig prüfbar, geht aber beim Kopieren, Konvertieren oder Screenshotten verloren — die beiden Verfahren decken sich gegenseitig ab.
3. Prüfen kann es vorerst fast niemand. Ein statistisches Wasserzeichen ist nur mit dem passenden Schlüssel überprüfbar, und der liegt beim Anbieter. Anthropic stellt eine Detection-Schnittstelle bereit, die zunächst als Private Preview für ausgewählte Organisationen läuft — insbesondere solche mit entsprechenden Nachweispflichten. Eine vollständige öffentliche Übersicht, welches Modell in welchem Umfang markiert, gibt es nicht.
4. Code ist die große Lücke. Bei Prosa gibt es viele gleichwertige Formulierungen, deren Auswahl sich verschieben lässt. Bei Code gibt es die nicht — Syntax lässt sich nicht anders formulieren, ohne das Programm zu ändern. Ausgerechnet die Disziplin, für die Fable am stärksten beworben wird, bleibt damit weitgehend unmarkiert. Die begleitende Dokumentation dagegen ist normale Prosa und trägt das Muster sehr wohl.
Der regulatorische Hintergrund
Der Stichtag ist kein Zufall. Artikel 50 der EU-KI-Verordnung verlangt von Anbietern von KI-Systemen, synthetische Inhalte in einem maschinenlesbaren Format zu kennzeichnen. Genau das leistet ein Wasserzeichen. Anthropic setzt hier also eine Pflicht um, keine freiwillige Selbstbeschränkung — und der 2. August 2026 fällt mit dem Anwendungsbeginn dieser Transparenzpflichten zusammen.
Wichtig für die Einordnung: Die maschinenlesbare Markierung trifft Anbieter. Wer KI-Systeme lediglich einsetzt, ist Betreiber und hat andere Pflichten — etwa Offenlegung gegenüber Menschen bei Deepfakes oder bei Texten zu Angelegenheiten von öffentlichem Interesse.
Wie sich die anderen positionieren
Anthropic ist beim Text in kleiner Gesellschaft. Die Trennlinie verläuft zwischen Medien und Text: Bilder und Videos markieren fast alle, Text fast niemand.
| Anbieter | Text-Wasserzeichen | Medien / Metadaten | |---|---|---| | Anthropic (Claude) | ja, ab Modellen vom 2.8.2026 | signierte Provenance an Dateien | | Google (Gemini) | ja, SynthID-Text | SynthID für Bild, Audio, Video | | OpenAI (GPT, Sora) | kein öffentlich ausgerolltes Verfahren | C2PA Content Credentials | | Meta (Llama, Meta AI) | nein | sichtbare KI-Hinweise + Bild-Metadaten | | Microsoft | nein | C2PA in eigenen Bildprodukten | | Mistral, xAI und weitere | keine öffentliche Zusage bekannt | uneinheitlich bis gar nicht |
Stand: September 2026.
Einordnung
Die naheliegende Sorge — „Google erkennt jetzt meine KI-Texte und straft mich ab” — trifft nicht zu, und zwar aus zwei unabhängigen Gründen. Google hat den Schlüssel nicht: Anthropics Wasserzeichen ist nur mit Anthropics Detektor prüfbar. Und Google bewertet ohnehin Qualität und Nutzen, nicht das Herstellungsverfahren; abgestraft wird Masse ohne Mehrwert, und die erkennt man ohne Wasserzeichen.
Was sich trotzdem ändert, ist die Beweislage. Bisher war „das haben wir selbst geschrieben” eine Behauptung, die praktisch niemand überprüfen konnte. Sie wird jetzt technisch überprüfbar — vorerst nur für wenige, mittelfristig vermutlich für Auftraggeber, Plattformen und Prüfstellen. Agenturen und Redaktionen, die pauschal „100 % handgeschrieben” zusichern, sollten ihre Formulierungen anfassen, bevor es jemand anders tut.
Gleichzeitig ist die Markierung schwächer, als die Schlagzeilen suggerieren. Sie braucht Länge, sie ist eine Wahrscheinlichkeitsaussage und kein Beweis, sie verliert bei starker Umformulierung an Signal, und sie greift bei kurzen Ausgaben wie Meta-Descriptions oder Betreffzeilen praktisch nicht. Ein markierter Rohentwurf, der redaktionell geprüft und mit eigener Erfahrung angereichert wurde, bleibt ein völlig legitimes Arbeitsergebnis — wie das sauber läuft, steht im Lexikon-Beitrag Wasserzeichen in KI-Texten.