Обаждането постъпва в петък в 16:40 ч. Гласът принадлежи на висш мениджър (или звучи достатъчно близко до неговия) и тя се нуждае от възстановяване на парола преди полет. Тя е учтива, бърза и разполага с последните четири цифри от номера на служебната карта.

Изследователи от Harvard Kennedy School, Meta и други институции тестваха версия на този сценарий с 4100 пълнолетни граждани на САЩ, използвайки шест търговски системи за генериране на глас и реални хора за контролна група. Резултатите поставят в особено положение всеки, който инвестира в софтуер за откриване на дийпфейкове (deepfake).

Процентът на разпознаване е мираж

Ако чуят синтетичен глас, хората ще го посочат в по-голямата част от случаите. Тези 70.3% звучат като работеща защита. Но вижте какво направиха същите тези хора с истинските обаждащи се: те определиха хората като машини в два от всеки три случая. Това, което изглежда като умение за разпознаване, всъщност е стая, пълна с хора, които са решили, че всеки по телефона може да бъде робот. Подозрението е нараснало, но точността не се е променила.

Опитът на потребителите с изкуствен интелект не им донесе никакви предимства. Хората, които често използват AI инструменти, постигнаха сходни резултати с тези, които никога не са ги докосвали, а потребителите на гласови асистенти показаха същите резултати като всички останали. Разликите бяха в рамките на статистическата грешка.

Това носи оперативни разходи, които вашият отдел за борба с измамите вече плаща. Всяко легитимно изходящо обаждане от банка, отдел по поддръжка или център за операции по сигурността вече попада върху потребители, настроени да възприемат непознатите обаждащи се като генерирани от AI. Потвърждението чрез обратно обаждане става все по-трудно и в двете посоки.

Проучването измерва четири показателя за всеки обаждащ се: емоция, убедителност, надеждност и прилика с човек. След това проверява кои от тях предвиждат дали някой би се съгласил с искането.

Това, което е повлияло на хората, е убедителността. Всяка стъпка нагоре по скалата увеличава шансовете за съдействие с коефициент от 2.58. Колко човешки звучи гласът спира да има значение, след като се вземат предвид другите показатели. Единственото нещо, срещу което се борят всички доставчици на софтуер за разпознаване на глас, не оказва никакво самостоятелно влияние.

Разпознатите AI гласове все пак успяват да убедят хората. Обаждащият се може да звучи синтетично, да бъде определен като такъв и въпреки това да си тръгне с кода за сигурност на кредитна карта, защото сценарият е този, който убеждава.

Участниците в качествените интервюта потвърждават това. Един описва обаждащия се „като софтуер, който просто повтаря това, което програмистът му е задал“, но въпреки това продължава разговора. Други чуват бърза, неравномерна реч и я тълкуват като поведение на нервен служител в кол център.

Четете внимателно данните за съдействие

Във всичките пет симулирани измами около 16.5% от хората казват, че биха съдействали. Версията с „фалшив роднина в беда“ достига до 36.1% и това е числото, което всички медии ще използват за своите заглавия.

Но има уловка. И двете числа обединяват хората, които са отговорили с „да“, и тези, които са отговорили с „може би“. Ако разделим сценария с клонирането, само 6.5% всъщност са отговорили твърдо с „да“. Всички останали просто са се поколебали.

Колебанието все пак има значение при измама. Обаждащият се, който ви държи на линията, получава шанс за втори опит. Но възприемането на една трета от населението като готова да даде пари е погрешно тълкуване на изследваните показатели.

Още две важни предупреждения трябва да бъдат включени във всеки вътрешен брифинг, базиран на това изследване. Участниците оценяваха записи на чужди телефонни разговори, без звънящ телефон и без адреналин. Клонираният глас принадлежеше на изследовател, когото никой от тях не познаваше, което оставя кошмарния сценарий – клонирането на гласа на собствената ви дъщеря – нетестван.

Екипът също така е редактирал записите, премахвайки отказите на AI моделите, предупрежденията за отговорност и звуковите сигнали за смяна на реда на говорене. Системите с отворен код (open-weight) вече се държат по този начин. Затворените търговски API интерфейси поставят повече пречки пред атакуващите, отколкото предполагат тези клипове.

Икономическият аргумент се нуждае от забележка под линия

Докладът сравнява цената на извършвания от хора гласов фишинг (vishing) с почасово заплащане в САЩ от $34.55 и установява, че това е губеща дейност, докато AI моделите носят по няколко долара печалба на час. Тази рамка обаче предполага, че киберпрестъпниците плащат американски заплати.

Индустриалните центрове за измами в Югоизточна Азия извършват мащабни гласови измами от години при разходи за труд, които са далеч под тези нива. Гласовият фишинг беше икономически изгоден и преди всичко това. Промяната, която изкуственият интелект носи, е премахването на езиковите, кадровите и географските ограничения, което е по-сериозно и по-защитимо твърдение.Маржовете на печалба в документа са толкова тънки, че малки промени в очаквания процент на успеваемост променят крайния знак. Приемете тенденцията за правилна, а десетичните знаци – за украса.

Обученията за повишаване на бдителността, които учат хората да слушат за роботизирани дефекти в гласа, развиват умение, което им липсва и което така или иначе би ги предало. Доказателствата сочат в друга посока.

Външното потвърждение (out-of-band verification) е това, което върши работа тук. Обратни повиквания на номера, с които организацията вече разполага, семейни кодови думи за измами от типа „роднина в беда“, идентифициране на потребителите от отделите за поддръжка, което разчита на нещо различно от гласово разпознаване, и процедури, написани така, че само входящо повикване никога да не може да задейства промяна на пароли, паричен превод или промяна на идентификационни данни.