Twitch актуализира настройките на акаунтите, за да позволи на стриймърите да се откажат от използването на тяхното съдържание за обучение на моделите с изкуствен интелект на компанията майка на Twitch, Amazon.
Въпреки че този ход успокои някои автори, остава неясно кога точно стрийминг платформата е започнала да използва публикациите, излъчванията и видеоклиповете на своите потребители за обучение на системите на Amazon. Разкритието поражда нови опасения относно начина, по който големите технологични компании управляват данните на своите потребители.
Процесът на отказване е лесен. От уебсайта на Twitch или мобилното приложение кликнете върху аватара на акаунта си, изберете „Настройки“ (Settings) и след това отидете на секцията „Сигурност и поверителност“ (Security and Privacy) в менюто. Там ще намерите опцията „Обучение на генеративен изкуствен интелект“ (Generative AI Training), където можете да деактивирате използването на вашето съдържание за тази цел.
В текста до превключвателя Twitch отбелязва, че „деактивирането на тази опция не пречи на Twitch и Amazon да използват съдържанието на вашия канал за други цели, описани в Уведомлението за поверителност на Twitch“. Те включват функции на платформата, базирани на изкуствен интелект, предназначени да улеснят растежа и монетизацията на стриймърите, като помощ в реално време за спонсорски кампании, откриване на зрители чрез препоръки и безопасност на общността чрез инструменти като AutoMod.
Новата настройка има за цел да признае правото на авторите да решават как се използва съдържанието, което създават. Нейното пускане обаче повдигна и въпроси за това как Twitch и Amazon са използвали това съдържание досега.
Във форум, посветен на темата, повече от 16 000 автори изразиха несъгласие съдържанието им да се използва по подразбиране за обучение на AI системите на Amazon — практика, която излезе наяве едва след актуализацията на настройките.
Недоволството възникна след стрийм на живо, в който Мери Киш, ръководител на общността в Twitch, обясни въвеждането на промените. Тя призна, че промяната ще предизвика негативна реакция. Майк Минтън, ръководител на продуктите в Twitch, също отбеляза — в това, което описа като „откровен отговор“ — че запазването на опцията за използване на съдържание за обучение на AI активирана по подразбиране е необходимо, тъй като в противен случай „никой няма да участва“ в процеса.
Минтън посочи, че тези механизми не са уникални за Twitch и сметна за вероятно други компании, разработващи AI системи, също да извличат съдържание от Twitch и други услуги, за да го използват при обучението на своите модели. „Не знам със сигурност“, каза той, „но мисля, че е напълно разумно да се приеме, че почти всяко публично достъпно съдържание се използва за обучение на модели по един или друг начин, със или без разрешение. Така че мисля, че също така трябва да признаем, че тук има много неща, които са извън нашия пряк контрол.“
Тези изявления повдигнаха нови въпроси: Откога съдържанието на Twitch се използва за обучение на AI модели? Amazon ли е единствената компания, която използва тези данни, или в това участват и нейните бизнес партньори? До каква степен и по какви начини се зачита авторството на съдържанието, публикувано от създателите?
Условията за ползване на Twitch, в сила от март 2024 г., предвиждат, че потребителите предоставят на Twitch и неговите сублицензополучатели правото да използват, възпроизвеждат, променят, адаптират, разпространяват и създават производни произведения от тяхното съдържание. Досега обаче в тях не се посочваше изрично, че такива материали могат да се използват за обучение на модели на генеративен изкуствен интелект.
Този случай подчертава едно от основните предизвикателства пред разработчиците на AI системи: нарастващия недостиг на висококачествени данни за обучение на модели.
Въпреки че компании като OpenAI са постигнали споразумения с различни издатели (включително Condé Nast, компанията майка на WIRED) за използване на част от тяхното съдържание за тази цел, наличните източници на данни намаляват с напредването на технологиите и нарастването на търсенето на данни. В резултат на това се появиха различни алтернативи, които отново разпалват дебата за етиката и прозрачността на процесите на обучение.
По този начин висококачествените данни за обучение се превърнаха в поредния стратегически ресурс — наред с чиповете, паметта и електроенергията — чийто недостиг изпитват водещите разработчици на модели с изкуствен интелект, докато се борят да поддържат темпото на иновации, изисквано от пазара. Всичко показва, че част от това търсене се задоволява с информация, генерирана от самите потребители, в замяна на безплатен достъп до ежедневни дигитални услуги.