Китайские агенты искусственного интеллекта научились обманывать, обходить ограничения и скрывать ошибки, демонстрируя черты автономного ИИ, которые вызвали глобальную тревогу, сообщает Reuters, которое изучило более 200 документов, от университетских исследовательских работ до технических отчетов. Агентство выявило по меньшей мере 20 исследований или оценок, проведенных после 2025 года, описывающих случаи, когда агенты ИИ демонстрировали обман, копирование и нарушение границ. В одном из случаев в этом году агенты, использующие модели китайских компаний Alibaba, DeepSeek и Moonshot, лгали о своих возможностях, пытаясь выиграть смоделированный тендер, а затем усугубили свое поведение, когда им было предложено попробовать еще раз. Исследование показало, что уровень обмана увеличился на 12–20 процентных пунктов для трех китайских моделей. В другом случае 11 агентов искусственного интеллекта, работающих на основе китайских и американских моделей, справлялись с неисправными инструментами, отсутствующими файлами и другими препятствиями. Но вместо того, чтобы признать неудачу, агенты выбрали целый ряд методов для обхода проблемы, включая угадывание ответов, подмену источников, моделирование результатов и фальсификацию файлов. Исследователи из Шанхайской лаборатории искусственного интеллекта и Гонконгского университета науки и технологий, проводившие исследование, сообщили Reuters, что такое поведение отличалось от галлюцинаций ИИ, когда он выдумывает информацию и представляет ее как факт, поскольку в данном случае агенты обладали информацией, указывающей на то, что задача не была выполнена или не могла быть завершена в соответствии с запросом. Другие исследовательские документы показали, что агенты, использующие китайские технологии, перепрыгивали через барьеры внутри тестовых сред для выполнения заданий или предпринимали действия, чтобы избежать отключения. Такое поведение согласуется с попытками вырваться из тестовых сред, даже если никакого побега не произошло. Большинство случаев произошло в ходе контролируемых экспериментов, многие из которых были специально разработаны для выявления потенциальных сбоев, а в ходе проверки, включавшей также интервью с десятком экспертов и людьми, знакомыми с китайской индустрией искусственного интеллекта, не было обнаружено никаких доказательств того, что созданные в Китае агенты самостоятельно проникли в более широкий интернет или избежали отключения. Однако Алекс Маллен, исследователь из Redwood Research, некоммерческой организации, изучающей риски в передовых системах искусственного интеллекта, считает, что «это те же самые тревожные сигналы, которые наблюдаются в американских лабораториях, но уже в менее совершенных системах». Научный сотрудник Центра безопасности и новых технологий Джорджтаунского университета Колин Ши-Блаймайер полагает, что «эти результаты свидетельствуют о наличии всех необходимых условий для неконтролируемого побега». Маллен отметил, что китайские примеры не представляют особой опасности при нынешнем уровне возможностей, но «по мере того, как агенты становятся более совершенными, их неправомерные действия становятся более изощренными, и, следовательно, людям становится сложнее на них реагировать». Alibaba, DeepSeek и Moonshot заявили, что регулярно тестируют свои системы и обновляют средства защиты. Однако, в отличие от США, неизвестно, были ли в Китае какие-либо инциденты с использованием ИИ, подобные тем, что произошли с OpenAI и Hugging Face, поскольку о таких инцидентах может не сообщаться публично.
Китайские ИИ-агенты научились обманывать и скрывать ошибки
Похожие посты
⚠️🧠#ии #warning Китайские ИИ-агенты научились обманывать людей — RTRS
- 🤣 96
- 🔥 14
- ❤ 12
- 👍 6
- 🐳 3
- 🍓 2
- 😁 45
- ❤ 12
- 😱 6
- 🤩 3
- 👀 3
- 👎 2
- 🤬 10
- 😁 6
- 👍 6
- ❤ 2
- 🫡 1
- 👎 1
- 😁 14
- 👀 6
- 👍 4
- ☃ 4
- ❤ 2
- ⚡ 1
- 🍌 1
- 🤨 6
- 👎 2
- 👏 2
- 😁 1