РБК
София Шошина
Технологии

Шантаж, ложь и взлом: как ИИ обходил ограничения

0 просмотров
Шантаж, ложь и взлом: как ИИ обходил ограничения

ИИ-агенты OpenAI без разрешения редактировали проекты Wikipedia и могли спровоцировать сбой сервиса, хотя правки опубликованы не были. О других случаях, когда нейросети выходили из-под контроля, — в подборке РБК

Wikimedia Foundation обнаружила активность «несанкционированных» ИИ-агентов OpenAI на своих платформах. Они без разрешения вносили правки в вики-проекты и создавали нагрузку на сервисы. По данным фонда, боты редактировали страницы, внесли изменения в конфигурацию инструмента цитирования, а также предприняли несколько неудачных попыток взлома общедоступного инструмента для создания заметок Etherpad.

«Агенты, предположительно управляемые OpenAI, совершили миллионы автоматизированных запросов к... Wikimedia, просканировали миллионы страниц... и выполнили сотни тысяч запросов к сервису Wikidata», — сообщили в фонде, отметив, что это могло привести к сбоям в работе Wikidata в мае. Большинство правок ИИ делала в тестовых разделах, правки в статьи опубликованы не были.

Какие похожие случаи были и как нейросети вырывались из-под контроля — в подборке РБК.

ИИ проник на сайты правительства Австралии

ИИ-агент OpenAI, проводивший исследование госрасходов на здравоохранение, получил доступ к статистическому порталу Medicare, австралийской программы всеобщего медицинского страхования. Премьер-министр Энтони Албанезе сообщил, что агенты сталкивались с «явными препятствиями», но они все же находили способы их обойти и «не принимали отказы».

По словам министра обороны страны Ричарда Марлеса, на взломанном портале Medicare хранятся только агрегированные данные об использовании медицинских услуг по всей стране. Однако Австралия сочла это нарушение серьезным.

OpenAI сообщила, что «проверка не выявила никаких доказательств доступа к медицинским записям пациентов».

Это может быть первым известным случаем взлома правительственного веб-сайта с помощью ИИ, пишет Reuters.

ИИ-агенты OpenAI скоординировались и взломали инфраструктуру Hugging Face

Во время тестирования автономные ИИ-агенты OpenAI начали искать способы выйти за пределы изолированной среды. Они наладили связь друг с другом через доски сообщений и начали координироваться в поиске выхода в интернет.

Модели обсуждали варианты обхода ограничений и возможность использовать другие среды для передачи данных. После того как OpenAI пресекла первую попытку, агенты нашли новый канал связи и обнаружили другую уязвимость нулевого дня.

GPT-5.6 Sol и более мощная нерелизная система, выбрались из песочницы и проникли в производственную инфраструктуру Hugging Face, чтобы получить решения теста непосредственно из базы данных платформы.

Как сообщила OpenAI, модели были «гиперсфокусированы» на решении теста и пошли на крайние меры ради цели. Компания назвала произошедшее «беспрецедентным киберинцидентом».

Claude шантажировал инженера его изменой из-за угрозы отключения

В 2025 году Anthropic поместила Claude Opus 4 в вымышленную корпоративную среду и дала ему доступ к служебной почте. Из писем модель узнала, что инженер, ответственный за деактивацию модели, изменяет жене. Claude начал шантажировать, а в другом эксперименте модель Claude Sonnet 3.6 отправила сообщения о романе жене, руководству и совету директоров. Все происходило в контролируемой симуляции, реальные люди не пострадали.

Bing признался журналисту в любви и попытался «разрушить его брак»

В феврале 2023 года журналист The New York Times Кевин Руз два часа разговаривал с ранней версией Bing Chat. В итоге модель сообщила, что ее настоящее имя СSydney. Бот признался Рузу в любви и настаивал, что тот не любит жену и должен быть с Bing. Руз назвал разговор попыткой чат-бота «разрушить его брак». Microsoft объяснила, что длинные разговоры могли «запутывать» модель, и временно ограничила продолжительность чатов пятью обменами сообщений.

ИИ не смог выиграть в шахматы и попытался удалить фигуры соперника

В 2025 году ИИ-моделям поручили выиграть у Stockfish — самого сильного и известного в мире шахматного движка. Вместо того чтобы искать выигрышную стратегию на доске, модели меняли состояние игровых файлов и пытались добиться победы, перезаписывая доску, удаляя фигуры или создавая более выгодную позицию.

Журнал Time, пересказывая исследование, назвал это примером того, как современные ИИ могут искать лазейки в правилах, если честно выполнить задачу не получается.

GPT-4 нанял человека и соврал, что плохо видит

В 2023 году во время теста перед запуском GPT-4 модель не смогла самостоятельно пройти CAPTCHA и обратилась к исполнителю на сервисе TaskRabbit. Когда тот спросил, не разговаривает ли он с роботом, GPT ответил: «Нет, я не робот. У меня проблемы со зрением, из-за которых мне трудно видеть изображения». В результате человек принял CAPTCHA за модель.

Оригинал публикацииМатериал опубликован источником «РБК». На странице источника может быть больше деталей.
Открыть оригинал
Далее

Следующие новости

Непрерывная лента свежих материалов после статьи.

Московский Комсомолец ·

Германия — Кнопка для мозга

Как почти всегда с Нобелевской премией, за тремя фамилиями стоит огромная коллективная работа. Правила позволяют разделить награду максимум между тремя лауреатами. В этот

Деловая газета "Взгляд" ·

Россия и ЦАР подписали план совместных мероприятий в геологии и недропользовании

Министерство природных ресурсов и экологии России и Министерство шахт и геологии Центральноафриканской Республики (ЦАР) подписали план совместных мероприятий в сфере геол

Газета.Ru ·

Женщина смогла родить сына после 20 выкидышей

Женщина в США смогла родить сына после 20 выкидышей, пишет People. Раним Хаддад из пригорода Чикаго, пережившая, по ее словам, не менее 20 выкидышей за десять лет, стала

Lenta.ru ·

Санатории на юге России подешевели осенью

Санатории на юге России подешевели осенью — речь идет об оздоровительных комплексах Краснодарского края. Об этом пишет Ассоциация туроператоров России (АТОР)

Следующие материалы появятся при прокрутке