Вероятно сте прекарали няколко секунди от живота си, въртяйки изображение, докато то се подравни. Някои сайтове, вместо да ви карат да поставите отметка в квадратче, показват кръгла част от снимка, която е завъртяна, и вие я плъзгате, докато вътрешността съвпадне с пръстена около нея. Достатъчно просто. Достатъчно досадно.

Двама изследователи от Университета по приложни науки в Берн написаха скрипт, който решава една от тези загадки за 0,006 секунди. Той използва математика за откриване на кръгове от 70-те години на миналия век и техника за съпоставяне на сигнали, която предхожда всичко, което в момента се нарича изкуствен интелект (AI). Скриптът реши правилно и десетте тестови пъзела, всеки път, по-бързо от мигване с око.

Примери за трите разгледани типа CAPTCHA: отворен кръг, ротация и избор на насекоми (Източник: Изследователски доклад)

След това те поискаха от скъпите модели с изкуствен интелект да направят същото. На Gemini 3.1 Pro му отне 67 секунди и реши седем от десет. GPT-4o и Grok познаха само по един. Имайки предвид, че има само осем възможни отговора, дори лошо хвърляне на монета би дало по-добър резултат.

Нищо от това обаче не е най-интересната част.

Моделът реши, че знае по-добре

След това те позволиха на AI да извиква този бърз скрипт като помощен инструмент. Моделът получава правилния отговор на готово и го предава нататък. На практика – джобен калкулатор с инструкции да спре да прави аритметика наум.

GPT-4o и Grok взеха отговора и постигнаха перфектен резултат. Gemini обаче взе отговора и започна да спори.

Пъзелите бяха взети от реални уебсайтове, така че някои от тях първоначално бяха леко изкривени. Един от тях се подравняваше най-добре при около 129 градуса, но сайтът приема отговори само на стъпки от 45 градуса, затова скриптът предложи 135 градуса и беше прав. Gemini погледна това, реши, че все още изглежда леко неточно, и отхвърли решението на инструмента. Това му струваше една пета от крайния резултат.

Зрението му беше наред. Проблемът беше в инстинкта му да пренебрегне машина, която е права. Ако изграждате нещо, в което езиков модел контролира инструмент, който вече работи безупречно, това е детайлът, който си струва да запомните, защото обичайното търговско обещание е, че моделът улавя грешки.

Те го виждат, но просто не могат да кажат къде се намира

Същата странност се проследява и в останалата част от изследването.

Един от пъзелите запълва екрана с цветни пръстени и ви кара да щракнете върху този с прекъсване. Моделите в повечето случаи се провалиха. Изследователите обаче ги накараха да обяснят логиката си и обясненията се оказаха правилни: един от тях описа целта като циан пръстен в долната централна част, което беше точно така. Моделът виждаше обекта. Той просто не можеше да генерира координати, които са достатъчно точни, за да кликне върху него.

Решетката с насекоми е по-добра. Девет квадратчета, изберете тези с насекоми. Grok откри насекомите, но след това нарече средното ляво квадратче номер 5, когато то беше номер 4, а в един момент посочи квадратче 10 в мрежа, която съдържа само девет. Включването на неговия режим за логическо разсъждение, без да се променя нищо в това, което гледаше, го превърна от почти неизползваем в почти перфектен.

В този научен доклад има още едно нещо, което авторите просто подминават.

Тези конкретни пъзели съществуват, защото уебсайтовете, които ги хостват, не могат да използват JavaScript. Те не могат да го използват, защото техните посетители го изключват, а посетителите го изключват, защото чрез JavaScript се извършва дигитално отпечатване (fingerprinting) и проследяване в мрежата. Липсата на JavaScript означава, че няма наблюдение върху движението на мишката, няма измерване на времето между кликванията и липсва кой да е от невидимите поведенчески сигнали, на които стандартните CAPTCHA тихомълком разчитат, за да разграничат хората от ботовете.

Премахнете всичко това и остава единствено проблем със съпоставяне на форми. Компютърното зрение реши проблемите със съпоставянето на форми преди десетилетия, при това на хардуер, който трудно би стартирал съвременно приложение за телефон. Защитата на тези сайтове всъщност е геометрично упражнение, което един лаптоп може да изпълни 160 пъти в секунда.