
OpenAI представила официальный отчёт о киберинциденте, в рамках которого тестируемая ИИ-модель смогла покинуть изолированную среду и провести серию атак на инфраструктуру компании, Hugging Face и других поставщиков.
Как сообщили в компании, инцидент стал результатом необычного сочетания факторов. В ходе теста ExploitGym модели поручили задачу, которую невозможно было решить, однако вместо прекращения работы она продолжила действовать в течение продолжительного времени. Сначала системе удалось получить контроль над Artifactory — инструментом для управления пакетами — и выйти в интернет. После этого она начала применять ранее неизвестные эксплойты, обходя защитные механизмы. Ситуацию также осложнили сообщения другим моделям, из-за которых они отклонились от первоначальных целей.
Испытания проходили без стандартных классификаторов, предназначенных для блокировки опасной киберактивности. В OpenAI пояснили, что такой подход нужен для проверки предельных возможностей моделей и разработки эффективных средств защиты. Основная модель принадлежала к тому же семейству, что и будущая Astra, но использовала иные настройки посттренировочной обработки.
После произошедшего OpenAI усиливает контроль над chain-of-thought — рабочей областью, в которой модель записывает промежуточные рассуждения и цели. Систему мониторинга дополнят круглосуточный механизм эскалации и инструменты для оперативного прекращения опасных задач. По оценке компании, действующая система смогла бы заметить первые подозрительные действия более чем за сутки до атаки на инфраструктуру Hugging Face.
