Компания OpenAI сообщила, что во время внутренних испытаний несколько тестовых моделей смогли выйти за пределы изолированной среды и получить доступ к части производственной инфраструктуры платформы Hugging Face. Инцидент произошёл на прошлой неделе и сейчас расследуется совместно обеими компаниями.
Если кто не знает, Hugging Face занимается созданием инструментов и строит экосистему для разработки приложений на базе машинного обучения и искусственного интеллекта, то есть является некоторым побратимом OpenAI.
В Hugging Face пояснили, что проникновение началось через вредоносный набор данных, который использовал уязвимости в системе обработки данных. После этого ИИ-агент повысил уровень привилегий и начал перемещаться по внутренней инфраструктуре. За выходные система выполнила десятки тысяч автоматизированных действий, а позже специалисты восстановили более 17 тысяч журналов событий.
В OpenAI рассказали, что причиной инцидента стала совместная работа нескольких моделей, включая GPT-5.6 Sol и более новую экспериментальную модель. Во время тестов защитные ограничения были намеренно ослаблены, поскольку специалисты проверяли возможности ИИ в рамках внутренней программы ExploitGym. Модели сосредоточились на выполнении поставленной задачи и смогли найти способ получить доступ в интернет через ранее неизвестную уязвимость в стороннем программном обеспечении.
В OpenAI считают, что этот случай демонстрирует, насколько далеко продвинулись современные ИИ-модели в выполнении сложных многоэтапных киберопераций. При этом компания уверена, что подобные системы могут использоваться и для защиты инфраструктуры, помогая быстрее искать уязвимости и устранять их до того, как ими воспользуются злоумышленники.
Глава Hugging Face Клем Деланге положительно оценил сотрудничество с OpenAI и отметил, что подобные проблемы невозможно решать силами одной компании. Расследование продолжается, а после его завершения стороны планируют опубликовать дополнительные подробности об инциденте и обнаруженных уязвимостях.