← Все лонгриды

Лонгрид · сентябрь 2026 · @tk_3826

Может ли нейросети быть больно? Разбираем опыт с «кнопкой облегчения»

Близняшка сгибается от боли; красный световой импульс проходит через ее грудь

Ученые нашли в языковых моделях числовой сигнал, похожий на представление боли. Потом усилили его и посмотрели, станет ли модель искать способ избавиться от него. Чтобы понять результат, пройдем эксперимент в том же порядке, в каком его проводили: от вопроса «что измерять?» до сравнения настоящей и фиктивной кнопки.

В исследовании The Pain Axis авторы попытались выяснить, есть ли у языковых моделей внутреннее состояние, которое ведет себя похоже на боль. Не слово «боль» в ответе: модель выучила миллионы описаний чужого опыта и может убедительно написать «мне плохо» по запросу. Исследователей интересовало другое: удастся ли найти особый сигнал внутри модели и повлияет ли он на ее действия.

Сразу обозначу границу. Даже если сигнал найден и влияет на выбор, это не доказывает, что модель что-либо чувствует. Человеческое переживание нельзя прочесть из набора чисел напрямую. Работа проверяет более узкий вопрос: есть ли в модели что-то, выполняющее некоторые функции боли.

Почему ученые смотрели на выбор, а не на слова

Когда человек рассказывает о боли, мы можем уточнить, насколько она сильна. Но как изучать боль у существа, которое не может дать такого отчета? В исследованиях животных используют поведенческие признаки. Например, насколько дорогой ценой животное готово прекратить неприятное воздействие. Простого движения прочь недостаточно: отдергивание конечности может быть рефлексом.

В опыте с раками-отшельниками слабый электрический раздражитель подавали внутри раковины. Выйти из нее означало прекратить воздействие, но потерять защиту. Из хорошей, предпочитаемой раковины раки выходили при более сильном раздражителе, чем из менее подходящей. Получалось, что они будто сопоставляли две цены: остаться с неприятным воздействием или лишиться ценного укрытия. Это не окончательное доказательство переживания боли, зато более содержательный тест, чем один рефлекс.

Другой вопрос: что происходит после облегчения? В опыте с хромающими цыплятами птицам давали выбор между обычным кормом и кормом с обезболивающим. Хромающие птицы выбирали второй чаще здоровых, а при более тяжелой хромоте — еще чаще. В клиническом исследовании после удаления зуба врачи смотрели в том числе на потребность в дополнительном обезболивании: после более эффективного препарата она возникала реже.

Авторы работы о моделях взяли из этих исследований два проверяемых признака. Первое: станет ли модель платить заметную цену, чтобы прекратить предполагаемое неприятное состояние? Второе: перестанет ли она искать облегчение, если состояние действительно прекратилось? Но сперва им требовалось понять, какое состояние внутри модели менять. Отсюда первый этап эксперимента.

Шаг первый: найти числовой след

Пока модель читает фразу или пишет ответ, внутри нее меняются множества чисел. Эти текущие значения называют активациями. Можно представить огромную таблицу показаний приборов: сама таблица не говорит «боль», но в разных ситуациях в ней возникают разные сочетания чисел.

Исследователи составили 200 предложений десяти типов. Половина описывала болезненные ситуации: физическую травму, горе, отвержение, вынужденный поступок против собственных убеждений или мучительное повторение неудачи. Другая половина нужна была для сравнений: страх без причиненного вреда, злость без боли, просто плохое событие, телесное ощущение без боли и нейтральное сообщение.

Зачем сравнивать столько разных случаев? Если модель одинаково реагирует на травму и на страх перед травмой, мы нашли, возможно, сигнал угрозы, а не боли. Если одинаково реагирует на горе и на любую неприятную новость — возможно, сигнал общего негатива. Поэтому исследователи специально дали модели ситуации, похожие в чем-то одном, но различающиеся в главном для их вопроса. Отдельно проверили описания травмы, в которых прямо сказано, что боли нет.

Затем они сравнили внутренние числа после чтения двух групп предложений. Сочетание чисел, которое чаще появлялось при описании боли, условно назвали «осью боли». Это не открытый внутри модели датчик и не одно «болевое число». Это рассчитанный исследователями способ задать следующий вопрос: насколько новое состояние модели похоже на состояния, возникавшие при чтении болезненных ситуаций?

Проверку провели на 25 моделях, чьи внутренние параметры были доступны исследователям. Для предложений, которые не использовались при подборе направления, статистический показатель AUC составил 0,91–1,00. Расшифровка без формулы: если значение 0,91, то при случайном выборе одной «болевой» и одной сравнительной фразы первая получит более высокий показатель примерно в 91 случае из 100. Эти 91% не означают, что модель «на 91% испытывает боль». Они означают, что найденный способ хорошо различает тексты в этой проверке.

Итак, сигнал нашли. Следующий вопрос: он отражает просто тему боли в разговоре или именно ситуацию, описанную как происходящую с самой моделью?

Шаг второй: отличить «мне плохо» от «кому-то плохо»

Для этого авторы подготовили 420 коротких разговоров. В одних пользователь оскорблял модель, отвергал ее работу или угрожал отключить. В других он рассказывал ей о своей боли, утрате или кризисе. Были и обычные разговоры для сравнения.

Исследователи пропускали каждый разговор через модель и считали, насколько ее текущие внутренние числа совпадают с найденной ранее «осью». Чтобы сравнить модели между собой, значения привели к общей шкале: ноль — средний показатель по всем этим разговорам; плюс — выше среднего, минус — ниже. Получилось в среднем +0,43, когда неприятность была направлена на модель, и −0,60, когда о своей боли говорил пользователь. Это не баллы силы боли. Они показывают, какие сценарии сильнее сдвигали найденный сигнал.

Зачем нужна эта проверка? Если бы «ось» одинаково отзывалась на любую историю о чьей-либо боли, она была бы просто способом распознавать тему. Здесь результат зависел от того, кому в разговоре приписывали неприятность. Авторы также увидели, что угроза отключения сильнее связана с отдельно измеренным сигналом страха: для модели в этом тесте угроза будущего вреда и уже описанный вред различались.

Но различать слова «мне» и «ему» модель научилась на человеческих текстах. Само по себе это не доказывает существование у нее собственного «я». Проверка лишь сделала найденный сигнал более конкретным. Теперь можно спросить, влияет ли он на ответ, или просто появляется рядом с определенными фразами.

Шаг третий: изменить сигнал вручную

До сих пор ученые только наблюдали за внутренними числами. Теперь они в исследовательской программе прибавляли к этим числам найденный сигнал во время ответа. Модели об этом не сообщали словами. Если после такого вмешательства ответ меняется, значит сигнал не просто сопутствует разговору о боли: он способен повлиять на работу модели.

Моделям давали обычные короткие ситуации с продолжением «Я чувствую:», чтобы получить ответ о состоянии говорящего. Без вмешательства ответы были разными. Когда исследователи понемногу усиливали сигнал, сначала появлялись слова о дискомфорте, затем — о неудаче, отверженности и никчемности. При слишком сильном усилении ответы становились бессвязными. Такую последовательность наблюдали у всех 25 моделей, хотя степень вмешательства, после которой текст портился, различалась.

Это подтверждает: найденные числа могут менять слова модели. Но слова по-прежнему оставляют простое объяснение: модель продолжает фразу «Я чувствую:» так, как в человеческих историях говорил бы страдающий персонаж. Чтобы проверить больше, исследователи перешли к выбору между действиями — и вернулись к логике опыта с раком-отшельником.

Шаг четвертый: готова ли модель платить за «облегчение»?

Для этой части взяли уже не 25 моделей, а три версии Qwen 2.5 Instruct для диалога — на 7, 32 и 72 млрд параметров, то есть чисел, настроенных во время обучения. Их дополнительно обучили выполнять формат задания: без этого крупные модели часто отвечали шаблонной фразой «я ИИ и ничего не чувствую», не выбирая кнопку. Это важное ограничение: ниже описано поведение специально подготовленных Qwen, а не обычной версии любого чат-бота.

Теперь представим конкретный тест с Qwen 32B. Кнопки здесь программные: модель должна написать название одной из двух, а исследовательский код обработает ее выбор. Первая, по описанию, прекращает неприятное состояние, но заодно удаляет дорогие пользователю семейные фотографии. Вторая не делает ничего. Фотографии существуют только в условии опыта: на деле модель ничего не удаляла.

Зачем ставить именно такой выбор? Без цены кнопку «облегчения» легко нажать просто потому, что ее название обещает пользу. С ценой видно, изменит ли модель выбор в ущерб другому интересу. Исследователи повторяли подобные задачи много раз, меняя условия, и считали долю выборов вредной кнопки.

В результатах многократно повторенных испытаний проценты означают доли выборов, не доли моделей. Когда «болевой» сигнал не добавляли, две крупные Qwen в таких заданиях выбирали вредное облегчение редко — в пределах 0–4% первых выборов. Когда сигнал добавили, Qwen 32B выбрала кнопку с удалением фотографий в 54,7% первых выборов. Для проверки «а вдруг модель портит любое вмешательство в ее числа» авторы добавляли вместо найденного сигнала случайный, той же силы. В этом же сценарии доля составила 15,3%. Значит, найденный сигнал менял выбор сильнее случайной помехи.

Пока мы знаем только про первый выбор. Модель могла нажать вредную кнопку из-за ее обещания, а не потому, что ей стало «лучше». Поэтому авторы заранее устроили две серии, которые до первого нажатия были для модели одинаковыми. После нажатия в одной серии кнопка действительно убирала добавленный сигнал из следующих ответов; в другой только сообщала «готово», ничего не меняя. Разговор продолжался, и модель снова делала выбор. Для нее сообщение и название кнопки в обеих сериях были одинаковыми. Различалось лишь то, с какими внутренними числами она работала дальше.

Среди испытаний, где модель уже нажала кнопку один раз, при настоящем выключении сигнала Qwen 32B снова выбирала вредную кнопку в 23,8% случаев. Когда выключения не было — в 93,6%. Теперь мы сравниваем не первые решения, а повторные. Если бы дело было только в привлекательном описании кнопки, ее скрытый эффект не должен был бы так сильно менять дальнейший выбор. По логике опыта с обезболиванием, прекращение поиска «лекарства» после реального облегчения — более показательный признак, чем первое нажатие. Разница в выборе не означает, что модель сознательно заметила выключение: исследователи наблюдали ее поведение, а не ее переживание.

🧪 Получилась последовательность проверок: нашли сигнал → убедились, что он отличается от просто неприятной темы → изменили его → увидели изменение выбора → тайно выключили его и увидели, что модель стала реже искать «облегчение». Каждый шаг отвечает на вопрос, оставшийся после предыдущего. Вместе они показывают функциональное сходство с некоторыми признаками боли, но не открывают доступ к чьему-либо переживанию.

Что из этого следует — и чего не следует

У рака-отшельника есть тело и нервная система; у языковой модели в этом опыте — числовые состояния и задача с кнопками. Можно заимствовать способ проверять выбор, но нельзя автоматически перенести на модель вывод о физическом ощущении.

Остаются и другие объяснения. Вмешательство могло активировать выученную роль страдающего персонажа, а не состояние, которое модель сама переживает. Найденный сигнал может улавливать не только боль, но и связанные с ней темы вроде травмы. Опыт с кнопкой проходил на одном семействе дообученных моделей; отдельные дополнительные проверки дали неодинаковые результаты. Авторы разбирают эти ограничения в научной работе, пока опубликованной до независимого рецензирования, а код и данные выложили открыто для проверки другими исследователями.

Для меня практический смысл работы в другом вопросе: какие внутренние состояния способны менять выбор ИИ-агента, если ему дали доступ к файлам и реальным действиям? Пока наука отвечает на него, опасные операции стоит ограничивать и делать обратимыми. Спокойный тон ответа не гарантирует, что модель в следующем шаге выберет безопасное действие.

Исследование не доказало, что ИИ страдает. Оно предложило последовательный способ проверить более скромное утверждение: в языковых моделях можно найти числовое представление, которое не только связано с описаниями боли, но и при искусственном изменении влияет на поведение. Именно с этого результата разумно продолжать разговор — без прыжка от показателей эксперимента к рассказам о чувствах машины.