WhatsApp обяви нова допълнителна функция, наречена „Предупреждение за измама“ (Scam Alert), създадена да предупреждава потребителите за потенциални измамни съобщения чрез използване на модел за машинно обучение на самото устройство, без това да компрометира шифроването от край до край (end-to-end encryption) на платформата.

Тъй като тактиките за измама се развиват от просто представяне под чужда самоличност до сложни примамки, генерирани от изкуствен интелект, притежаваната от Meta платформа за съобщения заявява, че нейните защити трябва да се развиват също толкова бързо, и „Предупреждение за измама“ представлява последната стъпка към тази цел.

След като потребителят активира функцията, приложението изтегля олекотен модел за машинно обучение директно на устройството, където той анализира входящите съобщения от контакти, които не са в списъка с контакти, за разговорна структура и езикови модели, свързани с известни измами.

От решаващо значение е, че никакво съдържание на съобщенията не напуска устройството за класификация и нищо не се докладва автоматично на WhatsApp, Meta или трета страна, освен ако потребителят изрично не избере да го докладва.

Ако моделът маркира дадено съобщение като вероятна измама, в чата се появява предупреждение, което е видимо само за получателя, предоставяйки му възможност да блокира, докладва или продължи разговора, или да отбележи чата като доверен, ако смята, че предупреждението е било фалшиво положително.

Функцията е изградена около три основни принципа: обработка само на устройството, без автоматично докладване и пълен потребителски контрол. За да измери дали функцията действително работи, WhatsApp се нуждае от известна видимост върху общата производителност, поради което разработи поверителен тръбопровод за съвместна аналитичност (federated analytics), изграден върху доверени среди за изпълнение (TEEs), по-конкретно поверителни виртуални машини.

Тази система агрегира само анонимни данни, като например колко предупреждения са били показани и какви действия са предприели потребителите, и прилага диференциален шум за поверителност, преди каквито и да било данни да достигнат до сървърите на Meta.

Прикаченият диаграмен процес илюстрира този процес от край до край – от минимизиране на данните на устройството през избор на OHTTP релейна задача, до оркестриращи и агрегиращи TEE среди с RA-TLS удостоверяване, до крайния резултат от анонимизирана статистика с диференциална поверителност.

Основна опасност за сигурността при всеки модел, доставян от сървър, е рискът от целева доставка, при която злонамерен субект или вътрешно лице изтласква манипулиран модел към конкретно лице.

Meta се справя с това, като публикува всяка версия на модела, идентифицирана чрез нейния SHA-256 хеш, в публичен регистър за прозрачност на трета страна (append-only ledger) преди внедряването.

Заявките за изтегляне се насочват през OHTTP реле, което премахва IP адресите и се удостоверява чрез анонимни идентификационни данни, така че сървърът не може да определи кой потребител изисква даден модел.

Разпределянето на експерименталните групи за тестване на нови варианти на моделите също се случва изцяло на устройството, като се използва локално генерирана произволност, което предотвратява възможността сървърът да насочи дадено лице към конкретен модел.

Моделът на заплахите на WhatsApp отчита външни атакуващи, злонамерени вътрешни лица и компрометирани доставчици по веригата за доставки. Защитите включват кодова изолация в TEE, криптирана DRAM памет, укрепване на поверителните виртуални машини (CVM) и ограничения, които предотвратяват възможността дори инженери на Meta да получат достъп до конзолата за управление на поверителната изчислителна среда в реално време.

Потребителите могат независимо да одитират системата чрез регистър за прозрачност в приложението, достъпен през „Акаунт“, „Изискване на информация“, „Активност на Scam Alert“, който показва кои съобщения са били сканирани и коя версия на модела е била използвана.

WhatsApp също така разширява своята програма за награждаване за открити уязвимости (Bug Bounty), за да включи теглата на моделите и съвместния тръбопровод за анализи, като кани външни изследователи да проверят дали системата е създадена единствено за откриване на измами.

Функцията стартира първо в ограничена бета версия, като WhatsApp заявява, че ще продължи да тества системата под натоварване съвместно със своята общност от изследователи по сигурността преди по-широкото ѝ разпространение.

Компанията също така планира да публикува подробен технически документ за дизайна на тръбопровода, надграждайки по-ранната си работа върху стека за съвместна аналитичност PAPAYA, представена на USENIX NSDI 2025.

Този поетапен подход отразява по-широка тенденция в индустрията за съчетаване на функции на изкуствен интелект, запазващи поверителността, с независимо проверими механизми за прозрачност, вместо да се разчита единствено на вътрешни уверения.