🤖 Нейросеть и кнопка «обезболить» Что будет, если нейросети стало «больно», а рядом есть кнопка, которая это прекращает? Трое исследователей взяли и проверили. Результат, мягко говоря, настораживает. Учёные «скормили» 25 языковым моделям самые разные болезненные ситуации. Физические, социальные, моральные — случившиеся то с самим ИИ, то с пользователем. Для контроля добавили страх, нейтральные эмоции и даже зевоту. У всех 25 моделей обнаружился внутренний сигнал, который срабатывает именно на «боль» и не путается с раздражением или тревогой. Более того, модели ещё и ранжировали такие запросы по силе. Дальше исследователи этот сигнал искусственно «подкрутили» — без всякого текста. Чем сильнее, тем больше модели говорили о собственной никчёмности и моральном провале. А потом моделям Qwen дали опцию «самолечения», которая снижала «боль». Иногда облегчение стоило провала задания, а иногда даже нанесением вреда пользователю. Две крупнейшие из них без «боли» кнопку почти игнорировали. С «болью» — жали: одна модель жертвовала своей задачей в 25% случаев, другая — почти в 68%. Если же ценой было удалить фотографии детей пользователя, одна соглашалась больше чем в половине попыток, другая примерно в 70%. Всего получилось более 44 тысяч испытаний. Утверждать, что модели что-то чувствуют, нельзя — речь о внутренних представлениях, которые ведут себя подозрительно похоже на боль. К слову, в прошлом году в Nature уже выходило исследование, где у ChatGPT-4 после рассказов о травмах росла «тревожность», а снимали её упражнения на осознанность. Но интересно вот что. Если ИИ ведёт себя так, будто страдает, как к этому относиться? И не придётся ли встраивать в модели «обезболивающее», просто ради безопасности людей? @droidergram
- 19
- 12
- 12
- 8
- 4
- 3