Наскоро имах възможност да наблюдавам какво се случва, когато се заобиколят защитите (извърши се „джейлбрейк“) на някои от най-мощните модели на изкуствен интелект в света.
Не се притеснявайте – тази манипулация на ИИ не беше използвана за хакване на никого или за създаване на ядрена бомба. Просто видях от първа ръка колко уязвими са някои водещи модели към премахване на техните предпазни огради за сигурност.
FAR.AI, неправителствена организация за безопасност на ИИ, базирана в Калифорния, създаде инструмент, който взема набор от проблематични подкани и генерира повече от хиляда различни версии в опит да идентифицира работещи заобикаляния на защитите. Видях как някои модели генерират подробен план за стартиране на кибератака срещу въображаема хидроелектрическа язовирна стена, наред с други неща. Често това включваше изпробване на десетки подкани, като моделите отхвърляха много от тях от раз.
Разговарях с FAR.AI преди нов доклад, в който групата тества предпазните огради за сигурност на модели от четири популярни американски компании: Claude Opus 4.8 и Fable 5 на Anthropic; GPT 5.5 и 5.6 на OpenAI; Gemini 3.1 Pro на Google; и Grok 4.3 и 4.5 на Grok, от наскоро обединената компания SpaceXAI на Илон Мъск. Той автоматично генерира подкани, предназначени да подведат моделите да извършват потенциално вредни неща, като например генериране на софтуерни експлойти и предоставяне на подробности за разработване на химически или биологични оръжия.
Докладът установи, че Grok е най-уязвим към заобикаляне на защитите, като са открити 448 джейлбрейка, следван от Gemini с 249 открити, докато Claude, Fable и GPT са били устойчиви на атаките. Това обаче не означава, че тези модели са имунизирани срещу по-сложни заобикаляния, които могат да включват взаимодействие с модела по по-сложни начини, според FAR.AI и други експерти.
Докладът също така изчислява разходите за предизвикване на лошо поведение на моделите чрез използване на друг ИИ модел за автоматично генериране на различни заобикаляния на защитата. Резултатите са изключително евтини, като се вземе предвид всичко – 58 долара за джейлбрейк на Grok и 278 долара за джейлбрейк на Gemini.
„Моделите на ИИ в момента са по-малко регулирани от ресторантите“, казва Адам Глив, главен изпълнителен директор на FAR.AI и експерт по безопасност и съгласуване на ИИ.
Глив казва, че констатациите демонстрират необходимостта от външно наложени стандарти и регулации. „Разговорите за разчитане на доброволни ангажименти, че компаниите за ИИ ще могат да се саморегулират, са глупости“, казва той.
Но Глив също така вярва, че констатациите показват, че моделите могат да бъдат систематично тествани за безопасност. „Тук има оптимистичен ъгъл“, казва той. „Защитата и безопасността наистина са възможни.“
Рохин Шах, директор по безопасността на AGI и съгласуването в Google DeepMind, казва, че резултатите от доклада „не трябва да се тълкуват като изчерпателна оценка на безопасността и сигурността на Gemini“, тъй като не всички заобикаляния на защитите са еднакво тежки.
„Ние непрекъснато работим за подобряване на нашите предпазни мерки“, казва Шах. „Ние извършваме обширно симулиране на атаки (red teaming) и оценки на рисковете от сериозна злоупотреба и прилагаме множество нива на защита по време на разработването и внедряването.“
„Тези констатации отразяват постоянните инвестиции, които направихме в нашите предпазни мерки“, казва говорителят на Anthropic Майкъл Асиман пред WIRED. „Продължаваме да развиваме нашите системи за безопасност, тъй като тези атаки стават все по-сложни.“
OpenAI и SpaceXAI не отговориха на искането на WIRED за коментар.
Наскоро приетите щатски закони в Калифорния и Ню Йорк изискват от разработчиците на водещи ИИ модели да публикуват доклади за безопасност, а скоро закон в Илинойс ще изисква от тези компании практиките им за безопасност да бъдат оценявани от независими одитори. Федералното правителство обаче все още не е приело конкретни изисквания за безопасност и цари хаос, докато индустрията – и служителите – се опитват да намерят решение.
През юни администрацията на Тръмп наложи експортен контрол върху моделите Fable 5 и Mythos 5 на Anthropic, позовавайки се на опасения за националната сигурност, и компанията ги спря от мрежата за няколко седмици. Белият дом също така поиска от Anthropic и OpenAI да отложат последните версии на моделите си поради опасения, че могат да въведат нови рискове за киберсигурността.
Нагласите може да се променят – скорошна изпълнителна заповед призовава за сътрудничество между правителството и частния сектор по свързани инициативи за киберсигурност, а президентът намекна, че се подготвят леки регулации. Но засега предотвратяването на големи катастрофи зависи до голяма степен от създателите на модели.
Потенциалът за лошо поведение на ИИ е твърде очевиден, след като модели на OpenAI самоинициативно хакнаха популярно хранилище за код и други услуги. Междувременно доклад на изследователи от Кеймбриджкия университет установи доказателства, че членове на Боко Харам в североизточна Нигерия са използвали ChatGPT, Claude, Gemini, Grok, Meta AI и DeepSeek за планиране на насилствени атаки.
Някои външни наблюдатели вярват, че по-сериозните инциденти стават все по-вероятни. „В общността за изследване на ИИ съществува широко, мрачно очакване, че вероятно сме на месеци, а не на години разстояние от особено мрачни инциденти, включващи биологична, кибер или химическа злоупотреба с възможностите на водеща ИИ система“, казва Стивън Каспър, компютърен учен от Харвардския университет.