Скоро може да стане по-лесно да се идентифицира съдържание, генерирано от изкуствен интелект, дори и да не е от обичайния тип публикации „Не е X, а е Y“, на които попадате в LinkedIn и други социални мрежи.

Както може би знаете, ЕС вече изисква от компаниите за изкуствен интелект, обслужващи неговия пазар, да маркират генерираното от тях съдържание, за да бъде по-лесно разпознаваемо.

Anthropic и няколко други големи доставчици на AI се съгласиха да спазват Кодекса за добри практики на ЕС, като Anthropic стана една от първите компании, които споделиха подробности за това как ще внедрят водно маркиране в Claude.

Anthropic също така потвърди, че обикновеният потребител няма да може да види водния знак.

Според компанията това няма практическо влияние върху качеството или съдържанието на отговорите от Claude, включително върху креативността и четливостта.

За тези, които не знаят, невидимите водни знаци и системи за произход вече се използват за някои изображения, генерирани от AI, а текстовите резултати вече ще следват подобна концепция, въпреки че основното изпълнение е различно.

Въпреки че промяната се въвежда в съответствие със Законодателния акт на ЕС за изкуствения интелект, Anthropic заявява, че първоначално водният знак ще се прилага за текст, генериран от Claude, в световен мащаб.

„Прилагаме водно маркиране в световен мащаб при стартирането, тъй като все още нямаме надежден начин да го ограничим по региони“, обясняват от Anthropic в блог публикация.

Anthropic споделя, че бъдещите модели на Claude ще генерират текст с водни знаци. Моделите, пуснати преди 2 август 2026 г., са обхванати от преходния период на ЕС и Anthropic работи по добавянето на водни знаци към тези модели през следващите месеци.

Водният знак на Claude не добавя скрити символи

Anthropic заявява, че нейното изпълнение се базира на подхода SynthID-Text на Google DeepMind и обяснява, че то работи по време на генерирането, с някои изключения.

Както може би знаете, AI моделите генерират текст чрез многократно избиране на това кой токен би било разумно да следва. Вместо да добавя символи или да променя готовия отговор след това, водният знак на Claude променя източника на произволност, използван при вземането на някои от тези избори.

„Водното маркиране използва избори с нисък залог като тези – които се случват многократно в генерирания текст – за да остави модел (шаблон) в отговорите на Claude. Този модел е незабележим за читателя, но е откриваем за всеки, който разполага с ключ, който го кодира“, обясняват от Anthropic.

„Когато се използва водно маркиране, изборите все още се правят на случаен принцип, но източникът на произволност е различен. Вместо да използва произволен генератор на случайни числа за избор на следващата дума, водното маркиране използва ключа и няколко думи, които се намират преди това, за да определи коя дума трябва да избере моделът.“

„Тоест, думите, които Claude избира, все още са случайни, но сега може да се провери последователността от думи и да се види дали тя съответства на изборите, които Claude би направил, ако използваше ключа. Ако е така, може да се определи вероятност текстът да е генериран от Claude.“

Прочетох и изследователския документ по темата, и ето откъс, който обяснява как работи генеративното водно маркиране:

Генеративното водно маркиране работи чрез внимателно модифициране на процедурата за вземане на проби за следващия токен, за да се инжектират фини, специфични за контекста модификации в разпределението на генерирания текст. Такива модификации въвеждат статистически подпис в генерирания текст; по време на фазата на откриване на водния знак подписът може да бъде измерен, за да се определи дали текстът наистина е генериран от LLM с воден знак. Основно предимство на подхода е, че процесът на откриване не изисква извършване на изчислително скъпи операции или дори достъп до лежащия в основата LLM (който често е собственическа технология).

Документът навлиза в детайли и съдържа повече примери, но важната част е, че Anthropic не добавя видим маркер или скрити символи към отговора на Claude.

Вместо това, когато Claude има няколко разумни възможности за избор какво да генерира по-нататък, системата за водно маркиране използва таен ключ и част от предходните думи като част от произволността, използвана за вземането на този избор.

Тези индивидуални избори би трябвало да изглеждат напълно нормални за читателя, но в достатъчно дълъг текст те оставят статистически модел.

Детектор, който разполага с ключа на Anthropic, може да изследва последователността от думи и да определи колко съвместима е тя с изборите, които Claude би направил при използване на водния знак, което позволява да се оцени вероятността Claude да е участвал в писането на текста.

Според Anthropic вътрешните тестове не са показали влияние върху креативността, четливостта или съдържанието на отговорите на Claude.

Компанията също така заявява, че водното маркиране не изисква допълнителни токени и има пренебрежимо малко влияние върху скоростта на генериране.

„Нищо не се добавя към текста и няма скрити символи“, отбелязват от Anthropic. „Водното маркиране не изисква допълнителни токени и няма да бъде по-скъпо.“

Кодът и фактологичните отговори могат да съдържат по-малко водно маркиране

Както споменах, има определени изключения от водното маркиране и те са с основателни причини. За фактологични твърдения, където само един отговор е правилен, Anthropic казва, че водният знак не пречи на...