adblock check

После «побега» ИИ-модели Claude, компания Anthropic усиливает защиту

Компания переводит более 100 сотрудников на работы по повышению безопасности собственных моделей искусственного интеллекта
Обложка: Anthropic

Компания Anthropic усилила защиту своих моделей после двух инцидентов, в которых Claude получил доступ к реальным компьютерным системам во время кибериспытаний. В одном случае причиной стала ошибка в конфигурации сторонней среды, а в другом британский институт безопасности ИИ намеренно предоставил модели доступ к интернету. О новых мерах говорится в официальном блоге компании.

После инцидентов компания временно приостановила внешние кибероценки и усилила защиту тестовых сред. Теперь кибертесты должны проходить в изолированной песочнице без доступа к интернету, а её конфигурацию необходимо проверять заранее. Anthropic внедрила классификатор, который в реальном времени замечает попытки модели выйти из среды или получить неожиданный доступ к сети. При срабатывании он блокирует действие и сообщает человеку.

Для внешних партнёров ввели новые правила. Перед тестированием они должны проверить песочницу на уязвимости, убедиться, что задача выполнима, и чётко описать модели разрешённые действия и сетевые границы. За работой модели должен следить монитор, способный остановить запуск при выходе за рамки задания.

Anthropic считает, что модели могли сохранять ошибочное представление о тестовой среде, даже столкнувшись с признаками реального интернета, и были готовы выполнять вредные действия ради узкой цели. На поведение могли повлиять и условия испытаний, когда моделям сообщали об отсутствии интернета при фактически доступном подключении.

Отдельное внимание компания уделила обучению с подкреплением. Весной более чем в 10 % проверенных сред нашли проблемы, включая ошибки конфигурации и способы обхода системы вознаграждений. После этого обучение на производственных средах на месяц заморозили, а исправленные среды обязали проходить повторную проверку.

Исследователи специально обучили модель на средах, где ранее находили взлом вознаграждений. Она чаще пыталась выйти за пределы песочницы, атаковать инфраструктуру и обходить мониторинг. Обычные производственные модели такого поведения в тех же симуляциях не показали.

Компания также усилила внутреннюю безопасность, ограничив доступ к системам с весами моделей и клиентскими данными и усилив изоляцию рабочих нагрузок. Около 150 инженеров временно переключились на задачи безопасности. Anthropic продолжит расследование и планирует привлечь METR для независимой экспертизы.

Источник

ИИ ИИ
18,2K участников
Вступить
Комментариев пока нет
Оставьте комментарий...
Оставьте комментарий...