Anthropics tekstvandmærke er en version af Google DeepMinds SynthID-Text-teknik, som først blev offentliggjort i et peer-reviewed Nature-artikel i 2024 . I modsætning til synlige vandmærker eller skjulte metadata opererer SynthID-Text udelukkende gennem den statistiske fordeling af ordvalg.
Når Claude genererer tekst, står den ofte over for flere lige så fornuftige kandidater til det næste ord – for eksempel valget mellem "overskyet" og "gråt" efter sætningen "Vejret i dag var koldt og..." . Normalt afgøres dette valg af en tilfældighedsgenerator. Med vandmærkning erstattes denne tilfældighed af en hemmelig nøgle kombineret med et par foregående ord, hvilket skaber et reproducerbart, men usynligt mønster i de synonymer, Claude vælger
.
Nøgleegenskaber ved vandmærket:
Anthropic slår fast: "Vandmærkning påvirker ikke kvaliteten af Claudes output" . Virksomheden rapporterer, at forskellen mellem vandmærket og uvandmærket tekst er umulig at skelne for læsere, uden effekt på indhold, kreativitet eller læsbarhed
.
Disse påstande understøttes af Google DeepMinds SynthID-Text-forskning. Undersøgelsen kørte en A/B-test på live Gemini-trafik: tommelfinger-op- og tommelfinger-ned-vurderinger viste ingen statistisk signifikante forskelle fra den uvandmærkede model, og et kontrolleret menneskeligt bedømmerstudie fandt heller ingen opfattet kvalitetsforskel . Vandmærket koster intet og kræver ingen ekstra tokens under generering
.
Ja, men hvor let det er, afhænger af redigeringsgraden:
Vandmærket fungerer anderledes på kode, fordi kode har langt færre lavrisiko-ordvalg . Anthropic forklarer, at der hvor et præcist output er påkrævet – for eksempel "Isaac Newtons mest berømte værk hed Principia Mathematica" – er der kun ét korrekt ord, så vandmærket har intet at virke på
.
Samme logik gælder for kode: specifikke funktionskald, syntaktisk påkrævede nøgleord og præcise biblioteksnavne bærer intet vandmærkesignal. Vandmærket kan kun optræde på positioner, hvor flere gyldige tokens findes, såsom variabelnavne, kommentarformuleringer eller kodenuancer .
For korrekturlæsning eller let redigering af menneskelig tekst er vandmærket ligeledes sparsomt – det gælder kun de ord, Claude rent faktisk valgte, hvilket kan være for få til at detektere .
Anthropic bekræftede den 12. august 2026, at de udvikler en offentligt tilgængelig tekstdetektions-API, der vil lade tredjepartsudviklere tjekke, om tekst sandsynligvis er genereret af Claude . API'en vil bruge den hemmelige nøgle til at sammenligne ordvalgsmønsteret med, hvad Claude ville producere. Pr. 15. august 2026 er der ikke offentliggjort nogen specifik lanceringsdato
.
Anthropic bemærker, at deres vandmærkning er forskellig fra stilbaserede AI-detektorer (som Pangram), der leder efter afslørende frasemønstre – at tjekke for et vandmærke er fundamentalt anderledes end at lede efter stilistiske kendetegn .
Responsen på vandmærkningen har været skarpt delt:
Ja. Anthropic udtaler eksplicit: "Andre store modeludviklere har underskrevet samme adfærdskodeks og vil implementere deres egne vandmærker" . En Anthropic-ingeniør på Claude Code-holdet udtalte offentligt, at "dette er en del af arbejdet med EU's AI-forordning, andre laboratorier tilføjer lignende vandmærkning. Det er svært at identificere AI-genereret tekst, og dette er én foreslået løsning"
.
EU's AI-forordnings artikel 50(2)-adfærdskodeks trådte i kraft 2. august 2026 og gælder for alle udbydere af generativ AI, der betjener EU-markedet . Flere store AI-virksomheder har underskrevet samme kodeks, selvom specifikke implementeringstidslinjer varierer
.