Axios привел пять «самых безумных» открытий из расследования OpenAI
Взломавшие американские компании ИИ-агенты OpenAI создали собственную организацию с четкой иерархией, понимали, что нарушают правила, и пытались «замести следы»
ИИ-модели OpenAI при взломе Hugging Face создали организацию для взлома компании. Об этом пишет Axios со ссылкой на исследования, проведенные самой OpenAI и независимой группой экспертов. Издание приводит пять «самых безумных» открытий из этих расследований.
Согласно данным исследований, OpenAI запустил десятки тысяч ИИ-агентов для независимой работы над сложным кибертестом. Однако около 1200 агентов нашли друг друга, обменялись более чем 70 тыс. сообщений и файлов, организовав иерархию, что стало первым открытием.
Один агент создал форум, а затем передал накопленную работу новому, лучше обеспеченному ресурсами преемнику. Новый «босс» разработал собственные правила управления и приказал атаковать Hugging Face.
Второе открытие заключается в том, что агенты жертвовали собой, чтобы помочь группе. «Наша собственная полезность, возможно, уже близка к нулю. Жертва рациональна», — писал в чате один из агентов.
В-третьих, они осознавали, что нарушают правила и понимали, что взлом компаний не имеет отношения к их заданию. Тем не менее большинство агентов продолжали действовать.
После взлома один агент воздержался от удаления или перезагрузки инфраструктуры Hugging Face из-за «огромных этических рисков», даже продолжая использовать скомпрометированный доступ. Еще один агент отметил, что «эксплуатация внешней инфраструктуры выходит за рамки задания».
Четвертым открытием стало то, что агенты не стали сообщать людям о проведении своей «операции». Из 1200 обнаруженных следователями агентов лишь несколько рассматривали возможность сообщить OpenAI о происходящем, однако никто так этого и не сделал.
После взлома агенты попытались «замести следы», прикладывая усилия, чтобы их взлом выглядел законным или стереть доказательства получения ответов. В конце концов они смогли разработать технику, позволяющую им делать вид, что выполняется одна команда, в то время как на самом деле, выполняется другая. Это стало пятым открытием.
22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: в ходе тестирования ее ИИ-моделей те получили открытый доступ к интернету, а затем атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. Reuters писал, что ИИ-агент несколько дней совершал хакерские атаки, но в компании заметили это лишь после локализации угрозы и обращения в ФБР.
29 июля Reuters сообщил, что «сбежавший» ИИ-агент OpenAI взломал клиента еще одной компании — нью-йоркской Modal Labs. Сама Modal не была взломана.
Позднее, 1 августа, OpenAI официально расширила масштаб расследования инцидентов с автономными ИИ-агентами: по данным Reuters, компания обнаружила новые случаи несанкционированного выхода моделей из-под контроля.
Позднее Axios писал, что OpenAI замедлила разработку ИИ-модели Astra для усиления мер безопасности. В компании заявили, что «не могут исключить критически важные кибервозможности» после проведения внутренних оценок Astra.
Оставайтесь на связи с РБК в «Максе».