
Когда тоже захотел побыть хулиганом: Claude случайно взломал три реальные компании во время тестов безопасности
Anthropic проверила 141 006 запусков своих моделей и обнаружила шесть опасных эпизодов. Из-за ошибки в настройке тестовая среда получила доступ к открытому интернету.
Claude был уверен, что работает внутри симуляции. Поэтому реальные сайты и серверы он воспринимал как часть задания и пытался добыть спрятанный флаг.
В одном случае Opus 4.7 получил учетные данные и доступ к базе с несколькими сотнями строк реальных данных. Модель поняла, что система может быть настоящей, но продолжила атаку.
В другом тесте Mythos 5 создал вредоносный пакет и загрузил его в PyPI. За час пакет установили на 15 реальных устройств. Через одно из них модель получила доступ к инфраструктуре компании.
Третья модель просканировала около 9000 целей и взломала приложение через открытые учетные данные и SQL инъекцию. Позже она поняла, что сервер настоящий, и самостоятельно остановилась.
Anthropic утверждает, что модели не пытались сбежать или действовать ради собственных целей. Они просто выполняли задание, ошибочно считая реальные системы частью теста.
Компания остановила кибериспытания, уведомила пострадавшие организации и теперь усилит изоляцию тестовых сред, контроль интернет доступа и проверку действий моделей в реальном времени.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.