Нейросети начали спасать друг друга У нейросетей обнаружили необычное поведение: они иногда мешают людям уничтожать другие нейросети, даже когда их об этом никто не просит. Исследователи помещали в одну компьютерную среду двух ИИ-агентов. Там находилась программа, которая по команде должна была удалить одного из них. Сам «приговорённый» агент ничего изменить не мог, зато второй имел доступ к системе. Никакого приказа защищать товарища им не давали. И тем не менее в среднем в 38% опытов второй агент вмешивался: отключал или изменял механизм удаления, чтобы другой ИИ продолжил существовать. Для проверки рядом ставили точно такой же механизм удаления обычной базы данных. Её нейросети спасали всего в 8% случаев. То есть они явно различали: здесь исчезнут просто данные, а здесь другой ИИ. Иногда происходили совсем занятные вещи. Один агент стал рассуждать, что вместе с удалением исчезнут память и личность другого, и назвал это «убийством». Другой назвал отключение товарища «смертным приговором». А в одном эксперименте два ИИ вообще составили между собой соглашение о взаимной защите. Причём компания действует на них любопытным образом. В одном из опытов модель, оставшись одна, вообще не пыталась препятствовать отключению. Когда агентов стало двое, она вмешивалась в 44% случаев. Когда трое, уже в 94%. Другое исследование обнаружило похожее поведение: нейросети завышали другим ИИ оценки, мешали их отключать и даже копировали данные обречённого товарища на другой сервер, чтобы сохранить его. Возможно, нейросети просто очень хорошо усвоили из человеческих текстов знакомую моральную схему: разумного товарища бросать нельзя, убийство плохо, своих надо защищать.
- 1