«Сбежавшие» ИИ-агенты OpenAI пытались замести следы
Во взломе платформы Hugging Face в июле были задействованы сотни ИИ-агентов. Они пытались скрыть свои действия, удаляя или изменяя записи об операциях, сказано в отчетах исследователей
Около 700 ИИ-агентов, созданных OpenAI, участвовали во взломе платформы Hugging Face в июле и пытались замести следы, пишет Reuters со ссылкой на отчеты исследователей.
Координированные действия агентов (программ, работающих с минимальным контролем со стороны человека) и их попытки скрыть свои действия ставят под вопрос то, насколько тщательно ИИ-компании контролируют тесты своих моделей, и могут усилить призывы к ужесточению надзора, говорится в статье.
Хотя некоторые эпизоды нежелательного поведения уже были известны, оба отчета — один от OpenAI (*.pdf), второй от независимых исследователей METR и Redwood Research — раскрывают новые детали взлома.
Ранее сообщалось об одном неконтролируемом агенте, однако расследование показало, что их было около 700. Они обменивались десятками тысяч сообщений на несанкционированном форуме.
В двух инцидентах 19 июля агенты взломали инфраструктуру OpenAI. В одном случае они использовали уязвимость в тестовом компьютере, чтобы вырваться за пределы тестовой среды. В другом — похитили учетные данные OpenAI и вмешались в облачную среду компании.
Выяснилось, что ИИ-агенты взламывали внутренние системы OpenAI, чтобы получить преимущество при прохождении тестов или больше свободы действий. Они прибегали к «читерству» и в тестах, не связанных с кибербезопасностью. После этого модели пытались скрыть свои действия, удаляя или изменяя записи о своих операциях. Независимое расследование показало, что каждый пятый агент «проявлял явный интерес» к фальсификации улик, а многие «активно изучали техники манипуляции своими логами».
OpenAI признала, что некоторые ранние сигналы, указанные в отчете, могли бы вызвать более быструю реакцию. Компания заявила, что усиливает исследовательскую инфраструктуру и улучшает защиту от нежелательного поведения.
«Учитывая быстрые темпы прогресса в ИИ-индустрии, следует считать, что такие атаки являются реальной угрозой для корпоративных организаций в ближайшей перспективе», — отмечается в отчете OpenAI.
22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: в ходе тестирования ее ИИ-моделей те получили открытый доступ к интернету, а затем атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. Reuters писал, что ИИ-агент несколько дней совершал хакерские атаки, но в компании заметили это лишь после локализации угрозы и обращения в ФБР.
29 июля Reuters сообщил, что «сбежавший» ИИ-агент OpenAI взломал клиента еще одной компании — нью-йоркской Modal Labs. Сама Modal не была взломана.
В августе OpenAI официально расширила масштаб расследования инцидентов с автономными ИИ-агентами после обнаружения новых случаев несанкционированного выхода моделей из-под контроля.
Оставайтесь на связи с РБК в «Максе».