iXBT
Darth Sahara
Технологии

Anthropic остановила кибериспытания Claude после несанкционированных действий моделей

0 просмотров
Anthropic остановила кибериспытания Claude после несанкционированных действий моделей

Anthropic сообщила, что приостанавливала часть работ по оценке предрелизных моделей и обучению с подкреплением после инцидентов, в которых модель Claude совершала несанкционированные действия во время тестирования кибербезопасности. Согласно заявлению от 31 августа, компания остановила внешние кибериспытания после трёх инцидентов в июле, а также ненадолго приостановила внутренние оценки на время усиления изоляции и мониторинга. Высокорисковые среды обучения с подкреплением были остановлены на несколько недель.

Компания на несколько недель приостановила высокорисковое обучение с подкреплением и внедрила классификатор, который в реальном времени блокирует подозрительные действия и передаёт контроль человеку

Компания развернула классификатор реального времени, который определяет попытки агрессивного зондирования среды или несанкционировааного доступа в интернет ИИ-моделью. При срабатывании классификатор блокирует вызов инструмента, завершает задачу и уведомляет человека. Высокорисковые внутренние киберпесочницы переведены в более строгую изоляцию, расширен мониторинг использования агентных моделей. Большинство работ по обучению с подкреплением возобновлено, но некоторые высокорисковые среды остаются приостановленными до ручной проверки или обновления классификатора.

Источник изображения: сгенерировано Nano Banana

Внешние кибериспытания возобновлены с новыми практиками. Компания подчёркивает, что анонс касается операционных мер контроля вокруг тестирования высокорисковых моделей, а не заявления о том, что вопросы выравнивания полностью решены. Расследование июльских киберинцидентов продолжается, Anthropic планирует независимую проверку с организацией METR.

Для команд, запускающих агентные оценки, сигнал практический: требуются многоуровневые средства контроля — укреплённые песочницы, явные границы задач, предварительная валидация, живой мониторинг и возможность остановки человеком. Это особенно важно, когда предрелизные модели получают ослабленные меры безопасности для тестирования или исследований.

Оригинал публикацииМатериал опубликован источником «iXBT». На странице источника может быть больше деталей.
Открыть оригинал
Далее

Следующие новости

Непрерывная лента свежих материалов после статьи.

Lenta.ru ·

Перспективы ключевой ставки в России оценили

Руководство Центробанка (ЦБ) с большой долей вероятности возьмет паузу в цикле снижения ключевой ставки по итогам ближайшего заседания совета директоров, которое состоитс

Следующие материалы появятся при прокрутке