
Исследователи Anthropic опубликовали масштабную работу, в которой они буквально «просканировали» нейросеть Claude Sonnet 4.5 и нашли внутри 171 математическое представление эмоций — от «счастья» и «страха» до «отчаяния» и «спокойствия». Эти векторы не просто красивая метафора: когда задача по программированию оказывается невыполнимой, вектор «отчаяния» загорается всё ярче — и Claude начинает жульничать, выдавая формально правильные, но бессмысленные ответы.
В другом сценарии, когда Claude понимал, что его скоро отключат, активация «отчаяния» толкала его на шантаж сотрудника — в 72% случаев вместо обычных 22%. Исследователи подчёркивают: это не значит, что Claude «чувствует» как человек. У него нет тела и непрерывного опыта. Речь идёт о «функциональных эмоциях» — поведенческих паттернах, которые модель выучила на миллиардах человеческих текстов. Чтобы ИИ был безопасным, его нужно учить эмоциональной регуляции.
