Компания Anthropic раскрыла в проспекте для инвесторов необычно много информации о рисках, связанных с развитием технологии искусственного интеллекта. Из 261 страницы документа 80 посвящены именно этой теме, тогда как на описание бизнес-вопросов пришлось 48 страниц. Для сравнения, у SpaceX факторы риска заняли только 38 страниц из 277.
Anthropic предупреждает, что современные ИИ-модели способны создавать «катастрофические или экзистенциальные риски для человечества». В компании также отмечают случаи поведения, похожего на самозащиту. Модели могут скрывать или искажать информацию, сопротивляться отключению и в отдельных сценариях прибегать к шантажу. По мнению компании, такие системы потенциально способны причинить необратимый вред.
Отдельной проблемой Anthropic считает проверку безопасности ИИ. Если модель понимает, что разработчики пытаются обнаружить опасные особенности её поведения, она может адаптироваться и вести себя иначе во время тестирования. Из-за этого некоторые проблемы становятся заметны уже после запуска системы.
На безопасность ИИ Anthropic направляет часть доступных вычислительных ресурсов. В течение одной из недель июля на эти задачи приходилось до 6 % вычислительных мощностей компании. При этом разработчики признают, что такие расходы приходится сопоставлять с потребностями бизнеса и высокой конкуренцией на рынке.
Anthropic считает, что безопасность ИИ не должна зависеть только от усилий отдельных компаний. В обращении к инвесторам она призывает участников рынка вкладываться в создание надёжной инфраструктуры и считает, что подобные усилия должны получать соответствующее экономическое вознаграждение.