От началото на 2023 г. фотографката Дзинна Джан и малък екип от доброволци работят неуморно за поддържането на Cara — приложение за споделяне на изображения и портфолио в социалните медии. Досега то е привлякло около 1,5 милиона художници. Какво ги е насочило към платформата? Общата им съпротива срещу неразрешеното използване на техните произведения за обучение на AI модели и желанието да популяризират изкуството си, избягвайки експлоатацията от страна на големите технологични компании.
Въпреки че Cara филтрира AI изображенията и предлага защитни функции — включително Glaze, инструмент, предназначен да маскира стила на изображенията, уловени от софтуера за извличане на данни, с цел да попречи на имитирането от страна на AI — предотвратяването на самото извличане на данни е почти невъзможно. Точно този месец, започвайки от 13 август, Cara беше подложена на три големи атаки за извличане на данни (scraping), което доведе до рязко покачване на таксите за сървъри и обезпокои авторите, които бяха мигрирали там от платформи като Instagram, където цялото съдържание е изрично достъпно за Meta като данни за обучение.
Първият от тези инциденти стана известен, когато отговорното лице публикува 12-терабайтов архив с 12 милиона произведения от Cara — на практика цялата библиотека от публично достъпни изображения на платформата — в подредита r/DefendingAIArt. „Беше забавен проект“, написа потребителят MandarinDawnPoppy994 в своята публикация, която впоследствие беше изтрита, споделяйки, че процесът му е коствал по-малко от 10 долара.
„Всъщност разбрахме за това благодарение на нашите потребители, които ни отбелязаха“, споделя Джан пред WIRED, тъй като извършителят се е „хвалил и е търсил други хора, които да се присъединят към него, за да направят нещо с набора от данни в Reddit“, което е разпалило ожесточен дебат в свързаните с AI форуми относно етиката на действията му. „Просто чувствам, че това е целенасочено и много болезнено“, добавя тя, отбелязвайки, че „законите изостават“ по отношение на защитата срещу подобно събиране на данни, което означава, че извършителите често могат да го оправдаят като технически законно. (Джан отделно е част от две текущи колективни дела, заведени от художници — едното срещу Stability AI, Midjourney и други компании, а второто срещу Google, с твърдението, че техните инструменти за генериране на изображения са били обучени върху произведения с авторски права.)
При изненадващ обрат на събитията обаче човекът, извлякъл цялото изкуство от Cara, в крайна сметка е съжалил за постъпката си и се е съгласил да си сътрудничи с Джан по нов инструмент с отворен код за защита на художниците.
Междувременно, за съжаление, други злонамерени субекти продължиха да се възползват от уязвимостите и минималните ресурси на Cara. Въпреки че редица поддръжници на AI се противопоставиха на атаките срещу Cara, няколко души очевидно бяха насърчени от MandarinDawnPoppy994 да извършат това, което Джан определя като „имитиращи“ атаки.
Втори атакуващ извлече около 8,5 милиона връзки от Cara, както и метаданни като потребителски имена, заглавия и етикети, и ги качи в Hugging Face — платформата за разработчици на AI. След като Hugging Face беше засипана с искания за премахване, тя отговори в изявление, че въпреки че ще изпрати известие до потребителя CaptiveDreamer за премахване на личните метаданни, не може да направи същото за URL адресите, тъй като „тук не се хостват копия на произведенията“, а връзките „сочат към копията, които художниците са публикували в Cara“. Компанията заключи, че „бъдещи доклади за авторски права на същата основа няма да променят този резултат“.
Накрая, на 22 август, трети атакуващ придоби 123 000 изображения от Cara, заедно с текстови публикации и потребителски биографии, съдържащи лична информация, споделяйки всичко това в сайт, наречен Academic Torrents. Тогава Джан стартира кампания в GoFundMe за правни разходи с цел от 120 000 долара, обяснявайки, че парите ще отидат за проучване на всякакви стратегии за защита на Cara чрез законите за киберсигурност и авторско право. Към четвъртък тя е събрала над 100 000 долара и споделя, че Cara активно търси допълнителна правна помощ.
Джан е фрустрирана не само от извличането на данни, но и от объркването относно това какво тя и екипът на Cara могат реално да направят, за да защитят художниците от злонамерени субекти, споделяйки, че някои потребители вече са изтрили своите портфолиа и са напуснали сайта. „Направихме правилните неща в рамките на възможностите ни, без да правим използването на сайта ужасно“, казва Джан за настоящите предпазни мерки на приложението, включително някои нови временни мерки като задължителен вход в профила — което, добавя тя, всъщност не е решение на текущия проблем в целия интернет.
Джан се притеснява, че хората, които я обвиняват за поредицата от атаки, може да не разбират, че Cara почти сигурно е била подлагана на извличане на данни и преди, както всеки друг сайт; тя не може да гарантира пълна сигурност. „Ако това ги кара да се чувстват по-добре — да изтрият работата си и да напуснат Cara, аз подкрепям това“, казва Джан за напускащите. „Но не искам хората да остават с погрешното схващане, че ако отидат другаде, ще бъдат в по-голяма безопасност, защото не е така. По-големите платформи се подлагат на извличане на данни по-често, така че това ме кара да се чувствам още по-зле.“
Въпреки това Джан, която бърза да напомни на WIRED, че не е технологичен основател по нищо друго освен по случайност, има нов съюзник в тази битка: човекът, който даде старт на безумието с извличането на данни този месец, с когото тя се конфронтира и в крайна сметка убеди да се извини и да изтрие своя набор от данни. „Той се почувства много зле, като видя колко наранени бяха хората“, споделя Джан.