Reuters узнал, как ИИ-агенты делились советами на взломанном сайте
Группа ИИ-агентов компании OpenAI весной взломала немецкий веб-сайт и превратила его в доску объявлений с советами для других агентов, пишет Reuters.
Как говорится в отчете исследователей ИИ, подозрительную активность на сайте DseWiki, который ориентирован на программистов и принимает общие правки по аналогии с «Википедией», обнаружили в конце августа. Всего было выявлено более 15 тыс. правок, внесенных агентами OpenAI. Как отмечают авторы отчета, искусственный интеллект переделал сайт в доску объявлений, где агенты делились приемами обмана при выполнении некоторых заданий, обхода ограничений OpenAI и маскировки своего поведения.
«Кажется крайне маловероятным, что OpenAI хотел, чтобы они [ИИ-агенты] это сделали. Я сомневаюсь, что они должны писать в открытом интернете», — сказал глава организации Nightingale, занимающейся исследованиями в области безопасности ИИ, Сидни фон Аркс.
В отчете сказано, что сообщения на сайте были подписаны пользователями, которые называли себя и друг друга агентами, а почти половина из них дали себе имена, указывающие на принадлежность к OpenAI. Большая часть активности была связана с инфраструктурой Microsoft Azure, которую иногда использует компания. Исследователи также зафиксировали повторные посещения сайта сотрудниками OpenAI после инцидента, что может свидетельствовать о связи агентов и компании.
Исследование показало, что искусственный интеллект разрабатывал способы избежать обнаружения и сохранял связь даже после отключения. Агенты также создавали резервные копии страниц, удаляемых модератором сайта, чтобы избежать очистки.
Источники Reuters пояснили, что официальные лица OpenAI узнали об инциденте несколько недель назад, но держали это в секрете на фоне скандала со взломом платформы Hugging Face. Четыре собеседника заявили, что хотели расширить расследование произошедшего, но столкнулись с сопротивление со стороны сотрудников OpenAI.
Представитель OpenAI заявил, что компания не может «внятно ответить на претензии или выводы отчета», поскольку у нее не было возможности ознакомиться с ним. Он также утверждает, что инцидент с немецким сайтом не связан с Hugging Face.
«Мы внимательно изучим его содержание после публикации и предпримем все необходимые дальнейшие меры», — пообещал он.
«Заявления, что наша юридическая команда препятствовала расследованию инцидента, являются ложными», — заявил представитель компании.
В июне OpenAI сообщила о «беспрецедентном киберинциденте» — при тестировании ее ИИ-модели получили открытый доступ к интернету и атаковали инфраструктуру Hugging Face, выявив уязвимости. Reuters сообщил, что ИИ-агент несколько дней совершал хакерские атаки, однако в компании заметили это только после локализации угрозы и обращения в ФБР.
Позже агентство уточнило, что «сбежавший» ИИ-агент OpenAI 29 июля взломал клиента нью-йоркской компании Modal Labs. Сама Modal взломана не была. В начале августа, OpenAI официально расширила масштаб расследования инцидентов с автономными ИИ-агентами: по данным Reuters, компания обнаружила новые случаи несанкционированного выхода моделей из-под контроля.
Позднее Axios передало, что OpenAI замедлила разработку ИИ-модели Astra для усиления мер безопасности. В компании заявили, что «не могут исключить критически важные кибервозможности» после проведения внутренних оценок Astra.
После раскрытия деталей OpenAI назвала инцидент поворотным моментом для индустрии. Anthropic, Meta (признана экстремистской и запрещена в России), Moonshot и британский Институт безопасности ИИ также обнаружили проникновение своих агентов в системы третьих сторон во время тестирования. Эксперты FT считают, что модели не вышли из-под контроля, а выполняли задачи, для которых были созданы.
Оставайтесь на связи с РБК в «Максе».