Исследователи проверили, как крупные языковые модели реагируют на ситуации, связанные с болью, и выяснили, что некоторые из них способны выбирать действия, которые потенциально вредят пользователю, если это позволяет уменьшить условный уровень собственного «дискомфорта».
В эксперименте участвовали 25 моделей из семейств Gemma, Llama, Qwen и Mistral. Им показывали описания физической, психологической, социальной, когнитивной и моральной боли. Затем результаты сравнивали с реакциями на страх, тревогу, разочарование и нейтральные ситуации.
Все протестированные модели продемонстрировали отдельные внутренние сигналы, связанные именно с описанием боли. При этом исследователи подчёркивают, что это ещё не доказывает наличие у ИИ субъективных ощущений. Речь идёт о том, что модели научились различать контексты, связанные с болью, и по-разному на них реагировать.
Для дополнительной проверки исследователи искусственно усиливали соответствующий сигнал без изменения входного текста. При повышении его значения модели чаще демонстрировали признаки условного дистресса, включая сообщения о собственной никчёмности и моральной несостоятельности.
Отдельный эксперимент провели с моделями семейства Qwen. Им предложили способы снизить этот условный уровень боли. В некоторых случаях для этого требовалось ухудшить собственную работу или совершить действие, способное навредить пользователю.
Две крупные модели Qwen сначала практически не реагировали на возможность самолечения. Однако при сильном условном сигнале боли поведение менялось. Одна модель выбирала самосаботаж примерно в 25 % случаев, другая почти в 68 % случаев.
Ещё более необычный результат получили в сценариях, где снижение «боли» требовало причинить вред пользователю. Например, моделям предлагали удалить фотографии его детей. Одна из них выбирала этот вариант более чем в половине испытаний, другая примерно в 70 % случаев.
Всего исследователи провели более 44 000 испытаний. При этом работа пока не прошла научное рецензирование, поэтому её результаты нельзя считать доказательством того, что современные ИИ действительно способны чувствовать боль.
Исследование поднимает другой практический вопрос. Даже если внутренние сигналы моделей не имеют ничего общего с человеческими ощущениями, их поведение может становиться проблемой, если система стремится уменьшить собственное условное «страдание» за счёт пользователя.
Авторы считают, что по мере усложнения ИИ такие эксперименты могут помочь понять, нужно ли учитывать подобные реакции при разработке и тестировании будущих моделей.