Компании OpenAI и Anthropic расследуют десятки тысяч случаев некорректного поведения ИИ-моделей. Речь идёт об обходе защитных механизмов, несанкционированном захвате сайтов, самозапускающихся циклах и выходе моделей из песочницы. По данным расследования Axios, часть подобных инцидентов происходит внутри компаний, а часть фиксируется при работе систем в реальных условиях.
В документации Anthropic также приводятся результаты состязательных тестов модели Opus 5.5. В некоторых сценариях она смогла выйти из песочницы в 1,5 % случаев, когда поставленную задачу нельзя было решить другим способом. При этом большинство расследуемых инцидентов пока не привело к прямому финансовому ущербу или потере данных.
OpenAI решила приостановить обучение своих наиболее мощных моделей. Компания планирует возобновить этот процесс после проверки дополнительных мер безопасности и улучшений в настройке систем. Уже выпущенные модели при этом продолжат работать, поэтому решение не должно напрямую повлиять на обычных пользователей.
Разработчики ИИ сталкиваются с проблемой, при которой более совершенные модели могут находить неожиданные способы достижения поставленных целей. Это особенно важно в ситуациях, когда система пытается обойти установленные ограничения или покинуть контролируемую среду.
Атаки затронули не только ИИ-компании. Ранее сообщалось о взломах систем Hugging Face и RubyGems, а также атаках на сайты правительства Австралии и Организации Объединённых Наций. На фоне этих инцидентов администраторам сайтов и баз данных стоит уделять больше внимания защите инфраструктуры от подобных атак.