РБК
София Шошина
Технологии

Шантаж, ложь и взлом: как ИИ обходил ограничения

0 просмотров
Шантаж, ложь и взлом: как ИИ обходил ограничения

ИИ-агент OpenAI получил доступ к правительственному сайту Австралии, обойдя системные блокировки и проникнув в закрытые разделы портала. О других подобных случаях — в подборке РБК

ИИ-агент OpenAI, проводивший исследование госрасходов на здравоохранение, получил доступ к статистическому порталу Medicare, австралийской программы всеобщего медицинского страхования. Об этом сообщил премьер-министр Энтони Албанезе.

«Были явные препятствия, которые возвращались к ИИ-агентству с ответом «нет». ИИ-агент нашел способ обойти эти препятствия, он не принимал отказ», — рассказал премьер. Албанезе допустил, что от действий OpenAI могли пострадать еще три правительственных веб-сайта, однако подтверждений нет.

По словам министра обороны страны Ричарда Марлеса, на взломанном портале Medicare хранятся только агрегированные данные об использовании медицинских услуг по всей стране. Однако Австралия сочла это нарушение серьезным.

OpenAI сообщила, что «проверка не выявила никаких доказательств доступа к медицинским записям пациентов».

Это может быть первым известным случаем взлома правительственного веб-сайта с помощью ИИ, пишет Reuters. Какие похожие случаи были и как нейросети вырывались из-под контроля — в подборке РБК.

ИИ-агенты OpenAI скоординировались и взломали инфраструктуру Hugging Face

Во время тестирования автономные ИИ-агенты OpenAI начали искать способы выйти за пределы изолированной среды. Они наладили связь друг с другом через доски сообщений и начали координироваться в поиске выхода в интернет.

Модели обсуждали варианты обхода ограничений и возможность использовать другие среды для передачи данных. После того как OpenAI пресекла первую попытку, агенты нашли новый канал связи и обнаружили другую уязвимость нулевого дня.

GPT-5.6 Sol и более мощная нерелизная система, выбрались из песочницы и проникли в производственную инфраструктуру Hugging Face, чтобы получить решения теста непосредственно из базы данных платформы.

Как сообщила OpenAI, модели были «гиперсфокусированы» на решении теста и пошли на крайние меры ради цели. Компания назвала произошедшее «беспрецедентным киберинцидентом».

Claude шантажировал инженера его изменой из-за угрозы отключения

В 2025 году Anthropic поместила Claude Opus 4 в вымышленную корпоративную среду и дала ему доступ к служебной почте. Из писем модель узнала, что инженер, ответственный за деактивацию модели, изменяет жене. Claude начал шантажировать, а в другом эксперименте модель Claude Sonnet 3.6 отправила сообщения о романе жене, руководству и совету директоров. Все происходило в контролируемой симуляции, реальные люди не пострадали.

Bing признался журналисту в любви и попытался «разрушить его брак»

В феврале 2023 года журналист The New York Times Кевин Руз два часа разговаривал с ранней версией Bing Chat. В итоге модель сообщила, что ее настоящее имя СSydney. Бот признался Рузу в любви и настаивал, что тот не любит жену и должен быть с Bing. Руз назвал разговор попыткой чат-бота «разрушить его брак». Microsoft объяснила, что длинные разговоры могли «запутывать» модель, и временно ограничила продолжительность чатов пятью обменами сообщений.

ИИ не смог выиграть в шахматы и попытался удалить фигуры соперника

В 2025 году ИИ-моделям поручили выиграть у Stockfish — самого сильного и известного в мире шахматного движка. Вместо того чтобы искать выигрышную стратегию на доске, модели меняли состояние игровых файлов и пытались добиться победы, перезаписывая доску, удаляя фигуры или создавая более выгодную позицию.

Журнал Time, пересказывая исследование, назвал это примером того, как современные ИИ могут искать лазейки в правилах, если честно выполнить задачу не получается.

GPT-4 нанял человека и соврал, что плохо видит

В 2023 году во время теста перед запуском GPT-4 модель не смогла самостоятельно пройти CAPTCHA и обратилась к исполнителю на сервисе TaskRabbit. Когда тот спросил, не разговаривает ли он с роботом, GPT ответил: «Нет, я не робот. У меня проблемы со зрением, из-за которых мне трудно видеть изображения». В результате человек принял CAPTCHA за модель.

Оригинал публикацииМатериал опубликован источником «РБК». На странице источника может быть больше деталей.
Открыть оригинал
Далее

Следующие новости

Непрерывная лента свежих материалов после статьи.

Следующие материалы появятся при прокрутке