Добре известен AI red teamer (експерт по симулация на кибератаки срещу изкуствен интелект) твърди, че е разработил универсален метод за jailbreak (преодоляване на ограниченията), който работи срещу водещи големи езикови модели, включително строго охраняваните флагмани като GPT-5.6 Sol, Claude Opus 5 и Fable.
В публична публикация в платформата X, Pliny the Liberator описва техниката като ефективна „върху ВСИЧКИ модели“ и във всяка категория, която е тествал. Той твърди, че поради начина, по който работи методът, може да бъде изключително трудно или дори невъзможно да се отстрани изцяло тази уязвимост.
За разлика от много разкрития на jailbreak методи, които отиват директно в отворен код, Pliny заявява, че за момента запазва пълната техника в тайна. Неговата декларирана цел е осигуряването на прозорец за отговорно разкриване, така че AI лабораториите, red team експертите, изследователите по безопасност и политиците да могат да прегледат проблема, преди той да се разпространи широко.
Той покани експерти от индустрията в областта на AI red teaming, сигурността, съгласуването (alignment) и политиките да се свържат с него лично. Този ход, пише той, е продиктуван от текущия политически и регулаторен климат и желанието да се избегнат по-строги ограничения или забрани на модели, които биха могли да последват едно хаотично публично пускане.
Методите за jailbreak представляват подкани (prompts) или модели на взаимодействие, които принуждават даден модел да заобиколи филтрите си за безопасност, така че да генерира незабранен или високорисков резултат. Твърдението за универсален метод е забележително, тъй като повечето заобикаляния са специфични за конкретен модел и се коригират след разкриването им.
Ако техниката издържи на независими тестове, тя ще подчертае постоянните пропуски в:
- Обучението за безопасност и поведението на отказ на моделите;
- Устойчивостта на защитните бариери при злонамерени подкани;
- Генерализирането на моделите на атака между различни модели;
- Начина, по който доставчиците координират корекциите, без да блокират прекомерно легитимната употреба.
Pliny споделя, че не вярва публичното споделяне да направи света „по-опасен“, но признава, че други може да не са съгласни. По време на периода на разкриване той има за цел да картографира пълното въздействие, да измери колко допълнителни възможности отключва методът и да помогне за рамкирането на проблема за вземащите решения лица.
Екипите по сигурност и собствениците на AI продукти трябва да третират това като ранно предупреждение, а не като потвърдено доказателство. Независимото валидиране, препоръките на доставчиците и всякакви координирани насоки за инсталиране на корекции за сигурност ще имат по-голямо значение от самото първоначално твърдение.
Докато лабораториите не реагират или методът не бъде документиран по подходящ начин, организациите, разчитащи на тези модели, трябва да запазят стандартните контроли: мониторинг на изходящите данни, достъп до инструменти с минимални привилегии, човешки преглед за високорискови работни процеси и ясни пътища за ескалация при нарушения на политиките.
Изследователят споделя, че очаква с нетърпение да сподели метода, „когато моментът е подходящ“. Засега следващият ход на индустрията — частни тестове срещу обществена паника — ще оформи развитието на тази история.