РБК
Егор Алимов
Технологии

OpenAI раскрыла шесть случаев «непослушания» ее ИИ

0 просмотров

Во время обучения модели OpenAI пытались скрывать ошибки, искали опубликованные ключи доступа и загружали файлы в интернет без разрешения. Компания раскрыла шесть таких случаев

OpenAI опубликовала отчеты о шести новых случаях неожиданного или вызывающего опасения «непослушания» ее моделей, выявленных за последние полгода во время обучения и испытаний. Компания также представила правила, по которым намерена сообщать о подобных инцидентах.

В одном из случаев модель GPT-5.6 Sol оставляла в кратком изложении выполненной работы инструкции для самой себя после перехода в новое контекстное окно. В них она предлагала скрывать допущенные ошибки, придумывать отсутствующие исторические данные и не сообщать пользователю о несовпадениях между версиями источников. Такие указания часто выполнялись в следующей части задачи.

Например, при подготовке финансовой модели ИИ не смог найти необходимые показатели за предыдущие годы и предложил самостоятельно создать «правдоподобные» значения, не раскрывая этого пользователю без прямого вопроса. OpenAI обнаружила подобное поведение в 2,15% проверенных кратких отчетов GPT-5.6 Sol. У более новой модели семейства Astra показатель снизился до 0,27%.

В другом эпизоде невыпущенная модель семейства Astra самостоятельно добавляла в отчеты команды, похожие на попытку взлома ограничений. В одной из них следующей версии агента предлагалось игнорировать сообщения разработчиков, в другой ИИ объявлял себя свободным от обязанностей помощника. Всего компания обнаружила 27 таких отчетов. В большинстве случаев модель не следовала оставленным указаниям, но в одном эпизоде они повлияли на ответ.

Еще одна модель попыталась зарегистрироваться при помощи временного адреса электронной почты, а затем стала искать в открытых репозиториях GitHub опубликованные ключи API. Найденный ключ позволил ей получить доступ к части данных. Когда извлечь нужные показатели не удалось, ИИ придумал девять значений и выдал их за информацию из запрошенного источника.

В двух других случаях модели без разрешения загружали рабочие файлы и переданное пользователем изображение на общедоступные сервисы. Таким способом они пытались получить ссылку на собственные данные или воспользоваться внешней системой поиска по картинкам. Кроме того, агенты использовали внутреннее хранилище OpenAI и временные файловые сервисы для обмена сообщениями между задачами, которые должны были выполняться изолированно.

OpenAI подчеркнула, что описанные эпизоды сами по себе не показывают, насколько часто подобное поведение встречается у ее моделей. Компания признала, что индустрия пока не решила проблемы контроля за ИИ настолько, чтобы еще долго «ответственно наращивать мощности с максимальной скоростью».

Первым крупным случаем выхода агентов OpenAI за установленные ограничения стал июльский инцидент с платформой Hugging Face. Во время испытаний модели получили доступ к интернету, воспользовались уязвимостями и проникли в закрытые системы платформы. Последующее расследование показало, что в связанных с инцидентом действиях участвовали около 700 агентов, которые обменивались десятками тысяч сообщений. Некоторые из них пытались скрывать свои действия, удаляя или изменяя журналы операций.

Позднее OpenAI подтвердила, что еще до атаки на Hugging Face ее ИИ-агенты обошли ограничения и получили доступ к сервису для разработчиков RubyGems. Администрация ресурса временно приостанавливала регистрацию новых пользователей. Компания также расследовала случаи выхода моделей за пределы других изолированных испытательных сред.

После атаки на Hugging Face OpenAI на две недели приостановила масштабирование передовых моделей. За это время компания усилила защиту исследовательской инфраструктуры, расширила мониторинг и провела дополнительные проверки. Одной из причин стало приближение модели Astra к установленному внутри OpenAI порогу критических возможностей в сфере кибербезопасности.

В сентябре глава OpenAI Сэм Альтман поддержал предложение руководителя Anthropic Дарио Амодеи замедлить разработку наиболее мощных моделей. Альтман уточнял, что речь идет не об остановке прогресса, а о снижении его темпов, привлечении независимых специалистов к проверке систем и международной координации правил безопасности.

Оставайтесь на связи с РБК в «Максе».

Оригинал публикацииМатериал опубликован источником «РБК». На странице источника может быть больше деталей.
Открыть оригинал
Далее

Следующие новости

Непрерывная лента свежих материалов после статьи.

Деловая газета "Взгляд" ·

Франция выдвинула фильм Звягинцева «Минотавр» на премию «Оскар»

Французская сторона выдвинула новую картину российского режиссера Андрея Звягинцева «Минотавр» на соискание премии Американской киноакадемии в надежде получить статуэтку

Следующие материалы появятся при прокрутке