Anthropic áp dụng watermark cho các mô hình Claude được ra mắt từ ngày 2/8/2026 và triển khai tại mọi nơi Claude được hỗ trợ, nhưng một công cụ né watermark đã xuất hiện chỉ trong vòng 4 giờ. Dự án mã nguồn mở của Guillaume Meyer sau đó thu hút hơn 100 cộng tác viên và được đánh dấu lưu hơn 20.000 lần trên X; chưa c...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What happened after Anthropic began globally embedding a statistical, machine-readable watermark in all Claude-generated text on August 2 to. Article summary: Anthropic’s rollout was rapidly met by public circumvention tools, illustrating a core limitation of text watermarking: a statistical signal embedded in word choices can be weakened or erased by sufficiently extensive re. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Việc Anthropic đưa dấu máy đọc được vào nội dung do Claude tạo ra nhanh chóng trở thành phép thử thực tế đối với công nghệ watermark văn bản. Chỉ khoảng 4 giờ sau khi công ty xác nhận triển khai, nhà phát triển Guillaume Meyer đã công bố một giải pháp né watermark mã nguồn mở. Sự việc phơi bày giới hạn cốt lõi của dấu thống kê: công cụ này có thể hỗ trợ phát hiện trong các tình huống thông thường, nhưng vẫn dễ bị suy yếu nếu văn bản được viết lại đủ nhiều.
Anthropic cho biết các mô hình Claude được ra mắt từ ngày 2/8/2026 sẽ hỗ trợ đánh dấu nội dung ngay khi phát hành. Văn bản do các mô hình được hỗ trợ tạo ra sẽ mang một watermark không thể nhận biết bằng mắt thường; với một số tệp được hỗ trợ, hệ thống còn có thể đính kèm siêu dữ liệu nguồn gốc được ký số. Việc đánh dấu áp dụng ở mọi nơi Claude được cung cấp trên toàn cầu.
Anthropic cho biết thay đổi này nhằm đáp ứng các nghĩa vụ minh bạch liên quan đến Đạo luật AI của Liên minh châu Âu (EU AI Act). Đạo luật yêu cầu các nhà cung cấp tích hợp giải pháp kỹ thuật để nội dung do hệ thống AI tạo ra hoặc thao túng có thể được đánh dấu và phát hiện bằng máy, trong phạm vi kỹ thuật cho phép.
Ngay sau đợt triển khai toàn cầu, các nỗ lực công khai nhằm vô hiệu hóa dấu văn bản cũng xuất hiện. Wired đưa tin Meyer công bố công cụ vượt watermark trong vòng 4 giờ. Dự án sau đó thu hút hơn 100 cộng tác viên, còn bài đăng quảng bá dự án được lưu hơn 20.000 lần trên X. Các nguồn hiện có không xác lập được con số đáng tin cậy về số sao GitHub, lượt tải xuống hay tổng số người dùng.
Watermark văn bản của Claude không phải là một lớp ký tự vô hình có thể xóa đi một cách đơn giản. Anthropic mô tả nó là một mẫu thống kê nằm trong cách mô hình lựa chọn từ hoặc token. Bộ kiểm tra có phương pháp phát hiện tương ứng sẽ đánh giá xem chuỗi từ đó có nhất quán về mặt thống kê với quá trình tạo văn bản của Claude hay không.
Theo mô tả về cách Meyer tiếp cận, công cụ này sử dụng một mô hình ngôn ngữ không có watermark để tạo ra nhiều phiên bản viết lại. Các phiên bản thay đổi từ đồng nghĩa và sắp xếp lại câu, đồng thời cố gắng giữ nguyên ý nghĩa. Những thay đổi đó đánh thẳng vào mẫu lựa chọn từ vốn tạo nên dấu thống kê.
Một số công cụ chạy trên trình duyệt được đề cập trong các bài đưa tin lại nhắm đến những lớp khác của nội dung: xóa ký tự Unicode vô hình hoặc ký tự trông giống nhau, đảo lại trật tự câu và thay thế từ đồng nghĩa. Rút gọn văn bản, hoặc dịch sang một ngôn ngữ khác rồi dịch ngược lại, cũng có thể làm nhiễu mẫu thống kê. Tuy nhiên, không nên nhầm các cách này với việc xóa watermark cốt lõi của văn bản Claude: Anthropic nói watermark không phải dữ liệu ký tự ẩn hay siêu dữ liệu được thêm vào văn bản.
Anthropic cho biết watermark của Claude dựa trên một phiên bản của phương pháp SynthID-Text do Google DeepMind phát triển. Trong những lựa chọn từ tiếp theo ít ảnh hưởng đến chất lượng câu trả lời, Claude sử dụng nguồn ngẫu nhiên gắn với khóa bí mật và các từ đứng trước. Sau đó, bộ kiểm tra có thể ước tính liệu đoạn văn có nhất quán về mặt thống kê với những lựa chọn đó hay không.
Dấu này được thiết kế để người đọc không nhận ra, không thêm ký tự, không sử dụng token bổ sung và không gây ảnh hưởng thực tế đến ý nghĩa, chất lượng, tính sáng tạo, khả năng đọc hay chi phí, theo Anthropic.
Watermark cũng không chứa thông tin nhận dạng và không thể truy ngược đến một cá nhân, tổ chức hay cuộc trò chuyện cụ thể. Vì vậy, đây là tín hiệu quy nguồn mang tính xác suất, không phải “dấu vân tay” cá nhân. Anthropic mô tả kết quả phát hiện là xác suất Claude có tham gia viết một đoạn văn. Nó không thể xác định ai là người viết, chứng minh rằng con người không viết đoạn đó, nhận diện nội dung do một mô hình khác tạo ra hay đánh giá đáng tin cậy các đoạn quá ngắn.
Điểm này đặc biệt quan trọng khi Claude chỉ được dùng để kiểm lỗi, biên tập nhẹ, tóm tắt hoặc dịch. Anthropic cho biết một đoạn văn được chỉnh sửa nhẹ có thể chỉ còn giữ dấu ở vài từ do Claude lựa chọn, khiến tín hiệu quá yếu để phát hiện đáng tin cậy.
Theo Wired, Meyer không phản đối việc quy nguồn nội dung nói chung. Ông phân biệt “quy nguồn nội dung” với một dấu vô hình có thể bị dùng như bằng chứng chống lại một người. Mối lo của ông là một tín hiệu xác suất không phân biệt được giữa việc AI tham gia sâu vào quá trình viết và những hỗ trợ hạn chế như kiểm lỗi hoặc biên tập.
Đây là vấn đề lớn hơn về nguồn gốc văn bản. Một bộ phát hiện có thể cho thấy đoạn văn nhất quán về mặt thống kê với khả năng Claude từng tham gia, nhưng không cho biết bao nhiêu phần của bản cuối cùng do Claude tạo ra, bao nhiêu phần do con người sửa đổi, hay ai là người đưa ra ý tưởng ban đầu. Khi văn bản được viết lại đáng kể, dịch, rút gọn hoặc tái cấu trúc, ranh giới giữa “AI tạo ra” và “con người viết với sự hỗ trợ của AI” trở nên khó xác định hơn.
Các bằng chứng hiện có cũng không cho thấy watermark làm thay đổi quyền sở hữu đối với nội dung Claude tạo ra hay các quyền thực chất của người dùng. Anthropic giới thiệu hệ thống như một cách ước tính khả năng Claude đã tham gia, chứ không phải một tuyên bố về quyền sở hữu.
Watermark thống kê phụ thuộc vào một mẫu được phân bổ trên nhiều lựa chọn từ. Nếu văn bản gần như giữ nguyên, mẫu đó có thể đi theo nội dung khi được sao chép, dán và có thể tồn tại qua một số chỉnh sửa. Nhưng việc diễn đạt lại sâu, dịch thuật hoặc viết lại có thể thay đổi đủ nhiều từ ngữ để khiến tín hiệu không còn phát hiện được.
Các nhà nghiên cứu được Nature dẫn lời cũng hoài nghi rằng watermark văn bản có thể ngăn cản một người có động cơ viết lại nội dung AI, kể cả bằng một mô hình ngôn ngữ khác. Mối lo là tín hiệu có thể bị loại bỏ trong khi ý nghĩa nội dung phần lớn vẫn được giữ lại.
Điều đó không có nghĩa watermark hoàn toàn vô dụng. Với những đoạn đủ dài và còn gần với bản gốc do mô hình tạo ra, nó có thể cung cấp một manh mối máy đọc được cho các cuộc kiểm tra thông thường. Nhưng watermark yếu hơn nhiều nếu được xem như bằng chứng bền vững về nguồn gốc không thay đổi, đặc biệt khi con người đã sửa lại đáng kể văn bản.
Yêu cầu liên quan của EU chủ yếu đặt nghĩa vụ lên các nhà cung cấp: họ phải tích hợp giải pháp kỹ thuật hỗ trợ việc đánh dấu và phát hiện bằng máy rằng đầu ra được tạo ra hoặc thao túng bởi AI, trong phạm vi kỹ thuật khả thi. Văn bản pháp luật nêu watermark và các kỹ thuật khác là những hướng tiếp cận có thể sử dụng, chứ không bảo đảm rằng một phương pháp duy nhất sẽ hoạt động trong mọi hoàn cảnh.
Các nguồn được cung cấp ở đây không xác lập một lệnh cấm chung trong luật EU đối với bên thứ ba độc lập tạo ra hoặc sử dụng công cụ xóa watermark. Các nguồn này cũng không giải thích vì sao Anthropic không thể ban đầu chỉ giới hạn tính năng cho người dùng tại EU. Cách làm được Anthropic công bố là áp dụng đánh dấu trên toàn cầu, ở mọi nơi các mô hình Claude được hỗ trợ cung cấp dịch vụ.
Vì thế, watermark tạo ra một sự thỏa hiệp thực tế. Nó có thể cải thiện tính minh bạch và giúp phát hiện dễ hơn đối với văn bản tương đối nguyên vẹn. Nhưng dựa trên bằng chứng hiện có, nó không thể bảo đảm nguồn gốc sau khi nội dung bị viết lại có chủ đích, cũng không thể tự mình giải quyết câu hỏi ai là tác giả, người dùng có ý định gì hay trách nhiệm thuộc về ai.
Đợt triển khai của Claude cho thấy đồng thời giá trị và sự mong manh của watermark văn bản AI. Dấu này có thể hoạt động như một tín hiệu xác suất cho thấy Claude từng góp phần tạo ra một đoạn văn, nhưng không phải siêu dữ liệu ẩn, mã nhận dạng cá nhân hay bằng chứng kết luận rằng Claude là tác giả của bản cuối cùng. Việc các công cụ viết lại xuất hiện nhanh chóng—bắt đầu với dự án của Meyer chỉ sau 4 giờ—cho thấy yêu cầu đánh dấu bằng máy của EU nên được hiểu là một biện pháp minh bạch, không phải chuỗi bằng chứng bất khả xâm phạm về nguồn gốc nội dung.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Anthropic áp dụng watermark cho các mô hình Claude được ra mắt từ ngày 2/8/2026 và triển khai tại mọi nơi Claude được hỗ trợ, nhưng một công cụ né watermark đã xuất hiện chỉ trong vòng 4 giờ.
Anthropic áp dụng watermark cho các mô hình Claude được ra mắt từ ngày 2/8/2026 và triển khai tại mọi nơi Claude được hỗ trợ, nhưng một công cụ né watermark đã xuất hiện chỉ trong vòng 4 giờ. Dự án mã nguồn mở của Guillaume Meyer sau đó thu hút hơn 100 cộng tác viên và được đánh dấu lưu hơn 20.000 lần trên X; chưa có số liệu đáng tin cậy về tổng người dùng hay số sao GitHub.
Dấu của Claude là một mẫu thống kê trong cách chọn từ và token, không phải ký tự vô hình hay siêu dữ liệu nhận dạng.