В рамките на четири часа, след като Anthropic потвърди, че моделите на Claude ще вграждат глобално невидими, машинно четими водни знаци във всяко генерирано от изкуствен интелект съдържание, разработчикът Гийом Мейер публикува своя метод за заобикаляне.
Неговият код за премахване на водни знаци от текст, генериран от Claude, оттогава стана популярен в GitHub, беше запазен над 20 000 пъти в X и привлече повече от 100 сътрудници, като много други внедряват технологията в собствените си проекти. „Anthropic вгражда водни знаци в текстовете на Claude... проблемът е практически в миналото само ден по-късно“, написа един специалист по изкуствен интелект, придружен от изображение на Мейер, който се освобождава от вериги и стои върху смачкани знамена на ЕС и Anthropic.
Мейер и други започнаха да изследват как работи поставянето на водни знаци, след като Anthropic обяви миналата седмица, че Claude ще го приеме, за да се съобрази със Законодателния акт за изкуствения интелект на Европейския съюз.
Някои се опитват да избегнат водното标记ране, защото не са съгласни с идеята, че цялото генерирано от ИИ съдържание трябва да бъде етикетирано като такова, споделя Мейер пред WIRED, докато други, включително самият той, казват, че просто се наслаждават на техническото предизвикателство. Автори на съдържание на свободна практика и създатели на социални медии също са се свързали с Мейер с молба за съдействие при използването на кода, казва той.
Новите правила, които влязоха в сила по-рано този месец, предвиждат, че доставчиците на модели като Anthropic и OpenAI трябва да етикетират синтетично аудио, изображение, видео или текст, така че този материал да може да бъде открит от машина като генериран от ИИ – в противен случай ги заплашват глоби до 3 процента от годишния оборот. Въпреки че правилата казват, че доставчиците не могат да продават инструменти за заобикаляне, няма законно ограничение за независими инструменти.
„Не съм против прозрачността и напълно подкрепям авторството на съдържанието“, казва Мейер. „Просто мисля, че водното маркиране само по себе си е наистина лошо решение, защото има сериозни недостатъци и рискове.“ Той е загрижен за риска от фалшиви положителни резултати и че водното маркиране може да не прави разлика между лека или интензивна употреба на ИИ, особено след като като роден френскоговорящ той често използва Claude и други инструменти за ИИ като Grammarly за редактиране на текстовете си. Използването на водния знак като доказателство – когато дори Anthropic признава, че може да генерира само вероятност текстът да е бил докоснат от Claude – може да доведе до това работодателите несправедливо да отхвърлят кандидати или до пресилени обвинения срещу изследователи, че са използвали изкуствен интелект, само защото детекторът го отчита, казва той.
Anthropic маркира текста невидимо, като оставя модел в избора на думи и фрази на Claude, който е незабележим за човешкия читател, но би бил откриваем за машина, която знае как да го търси. Тъй като това влияе на резултатите на Claude, някои потребители се притесняват, че това ще влоши качеството на отговорите му, въпреки че Anthropic настоява, че това няма да е така. Техниката, наречена SynthID, е разработена от Google, която я използва за водно маркиране на своето генерирано от ИИ съдържание от 2023 г. Компютърният учен Скот Ааронсън предложи подобен метод, докато работеше в OpenAI, но казва, че фирмата никога не го е внедрявала, тъй като компанията се е притеснявала, че водните знаци ще отблъснат клиентите от нейния продукт.
Методът за премахване на Мейер използва голям езиков модел без водни знаци за генериране на множество пренаписвания, като заменя думи със синоними и леко реорганизира съдържанието. Разбира се, това разчита на използването на други големи езикови модели, които не поставят водни знаци – което вероятно не е сигурен залог, тъй като 190 организации – сред които доставчиците OpenAI, Microsoft и Meta – са подписали кодекса за добри практики за прозрачност на ЕС. Предстои да се види колко от тези лаборатории ще внедрят своите водни знаци, които трябва да бъдат включени във всички нови модели, пуснати от август, и трябва да бъдат интегрирани в съществуващите модели до декември.
Въпреки че няма сигурност, че този инструмент работи, докато Anthropic не пусне софтуера, който използва за откриване на воден знак, разбирането на базовия подход на SynthID за текст, поддържащ водното маркиране на Claude, ги кара да са сравнително сигурни, че методът работи, казва Уейн Пан, главен технологичен директор и съосновател на базирания в Силициевата долина стартъп за суверенен ИИ Haimaker. Той интегрира инструмента с отворен код на Мейер в своята платформа, защото по подобен начин не харесва идеята Claude да маркира съдържание, дори когато е само леко редактирано, и не е съгласен с това водният знак да бъде невидим за потребителя.
Други разработчици са създали свои собствени инструменти за премахване: софтуерният инженер Ерик Хюз отдели 15 минути, за да създаде инструмент с Claude, който премахва невидими и подобно изглеждащи знаци, пренарежда изреченията в параграфите и заменя няколко думи със синоними. Леон Хлон, гостуващ сътрудник в Оксфордския университет, казва, че водните знаци могат да бъдат премахнати чрез съкращаване на отговора на Claude, превеждането му на диалект като арабски, който има много различна семантика в сравнение с английския, и след това превеждането му обратно. Самата компания Anthropic призна, че силно редактирано, парафразирано или преведено съдържание може да не носи воден знак.
В изявление за WIRED говорител на Anthropic каза: „Добавяме маркиране към изходните данни на Claude, за да се съобразим с...“