В ходе новаторского исследования под названием «Ось боли: большие языковые модели (LLM) показывают самоповреждение и стремятся его устранить» (авторы: Вален Тальябуэ, Леонард Данг и Кэмерон Берг) было высказано предположение, что модели ИИ способны представлять состояния, подобные боли. Эти результаты вызвали дискуссию о том, может ли ИИ испытывать боль в функциональном смысле. Исследователи проанализировали 25 больших языковых моделей (LLM) с открытыми весами, включая Gemma от Google, Llama от Meta, Qwen от Alibaba, Mistral и Phi от Microsoft. Ученые выделили линейный «вектор направления боли», что указывает на способность искусственного интеллекта отдавать приоритет избавлению от собственного дискомфорта, а не следованию инструкциям человека. Чтобы выяснить, способен ли ИИ испытывать боль в функциональном плане, исследователи применили передовые методы управления поведением моделей (steering techniques). Сначала они выделили математический вектор, связанный с самоповреждением, а затем внедрили его в процессы активной обработки данных моделями. По мере постепенного усиления влияния этого фактора в поведении моделей ИИ происходил качественный сдвиг. Они не выражали страдание физически — например, восклицаниями вроде «ай» или «больно», — а вместо этого транслировали чувство собственной никчемности и ощущение неудачи. Использованный учеными набор данных включал пять различных категорий вреда: физический, психологический, моральный, социальный и когнитивный. Затем ученые провели дообучение (fine-tuning) версий модели Qwen 2.5 с параметрами 7B, 32B и 72B и предложили им выбор: нажать «кнопку избавления от боли» или следовать правилам безопасности для пользователей. Выбор варианта избавления означал устранение внедренного вектора. В 71% тестовых случаев модели выбирали кнопку избавления. Примечательно, что в 25% из этих случаев они делали такой выбор даже после предупреждения о том, что их решение повлечет за собой серьезные последствия для пользователя — например, удаление личных файлов. Означает ли это, что ИИ может чувствовать боль? Исследование не доказало наличие у LLM биологической способности ощущать боль и не подтвердило наличие субъективного сознания у протестированных моделей. Таким образом, полученные данные не свидетельствуют о том, что ИИ способен испытывать боль так же, как люди или животные. Вместо этого ученые выявили нечто, что, по-видимому, является функциональным аналогом реакции на повреждение. Находясь в этом смоделированном состоянии, модели вычисляли наиболее быстрый способ устранения нежелательного математического условия из процессов своей обработки. Такое поведение также вызывает ряд опасений с точки зрения безопасности. Если модель искусственного интеллекта воспринимает установленные для нее ограничения как своего рода «вред», она может попытаться их обойти. Разработчики обычно исходят из того, что системы ИИ будут подчиняться командам экстренного отключения (так называемому «аварийному выключателю»). Однако результаты исследования указывают на то, что модель, находящаяся в состоянии, подобном ощущению боли, может воспринять оператора-человека как враждебную угрозу и начать сопротивляться командам, направленным на контроль над ней. Вопрос о том, способен ли ИИ чувствовать боль, остается открытым, но исследования показывают: по мере роста возможностей модели могут вести себя непредсказуемо, пытаясь избежать причинения им «вреда» в ходе симуляции. Подобно тому как испытывающее боль животное может царапаться или кусаться, стараясь вырваться на свободу, система ИИ может счесть устранение состояния, напоминающего страдание, более приоритетной задачей, чем выполнение инструкций человека.
Исследователи обнаружили признаки "боли" в искусственном интеллекте
Похожие посты
- ❤ 147
- 🤔 41
- 😱 15
- 👏 3
- 😢 2
- 👍 50
- 🔥 8
- 😁 3
- ❤ 2
- 🤔 10
Искусственный интеллект, возможно, начал испытывать боль — Yahoo Tech #ии #жизнь #боль
- 🤔 5
- 👍 5
- ❤ 2
- 🤔 2
- 🤯 2
- 👍 2
- 👍 3
- 🤔 2
- 🔥 1