Атакуващите маскират автоматизираното сканиране като трафик от уеб роботи (crawlers) на изкуствен интелект, управлявани от OpenAI, Anthropic, Google, Perplexity и други компании, докато търсят в уебсайтове изложени идентификационни данни и конфигурационни файлове, според GreyNoise.
„Всяка програма, която посещава уебсайт, се идентифицира в един ред от заявката. Chrome казва, че е Chrome. Googlebot казва, че е Googlebot. Ботът на Anthropic казва, че е ClaudeBot. Нищо в самата заявка не доказва, че нещо от това е вярно“, обясняват изследователите.
„Компанията за изкуствен интелект публикува имената на своите ботове, за да могат собствениците на сайтове да ги разрешат, както и списъци с адреси, за да могат да ги проверят. Потребителският агент (user agent) е заглавна част, предоставена от клиента, така че контрол, който проверява името, но не и адреса, може да бъде заобиколен чрез фалшифициране“, добавят те.
Между 28 юли и 23 август 2026 г. шест имена на ботове, принадлежащи на четири компании за изкуствен интелект, са пристигнали от един и същ цифров отпечатък на HTTP клиент. Този отпечатък е пренасял повече от 1500 различни низа за потребителски агенти през предходните 90 дни, повечето от които са се идентифицирали като обикновени браузъри.
Шестте имена са дошли от едни и същи 824 IP адреса, пристигайки в сходни обеми. Нито един от този трафик не е поискал файла /robots.txt, който сайтът използва, за да укаже правилата си за ботовете.
GreyNoise измерва трафика на истинския бот на Anthropic за същия период и установява, че /robots.txt е неговият най-често изискван път, съставляващ 12 процента от неговия трафик. Той не е изисквал файлове с идентификационни данни.
Изследователите също така са открили фалшифицирани версии на две имена на ботове на Amazon в по-голям обем от шестте съвпадащи имена, изпратени под низове на потребителски агенти, които Amazon не документира.
GreyNoise проверява всички 824 адреса спрямо публикуваните IP диапазони за Anthropic, OpenAI, Google, Perplexity и Amazon. Нито един не съвпада. През същия период хиляди сесии, носещи името ClaudeBot, са пристигнали от адреси в публикувания диапазон на Anthropic.
„Почти всяка сесия тук носи същия етикет за уеб робот, какъвто носи и реалният трафик на роботите. Също така не е възможно да се направи блокиране на мрежово ниво, тъй като 824-те адреса са разпределени в 795 отделни /24 мрежи“, отбелязват изследователите.
Скенерите са изисквали .env файлове, ключове за достъп до облачни услуги, частни ключове и хранилища за пароли. Сред целевите пътища са били /.env, /.env.production, /.env.bak и /.aws/credentials.
От GreyNoise заявяват, че не могат да потвърдят дали някоя заявка е върнала файл или дали някоя организация е била засегната, и не назовават кой стои зад тази дейност.
GreyNoise публикува всички 824 адреса и пътищата за идентификационни данни, към които са били насочени скенерите, заедно със списъците с адреси на доставчиците, които е използвал за сравнение, позволявайки на собствениците на сайтове да извършват същите проверки в своите дневници (logs).