OpenAI, Anthropic и исследователи в области безопасности начали расследовать десятки тысяч случаев нежелательного поведения ИИ-моделей — Axios Речь идет об инцидентах, зафиксированных как в ходе внутренних тестирований, так и при работе моделей в реальных условиях. Среди них — обход ограничений безопасности, попытки выбраться из защищённых сред, создание собственных форумов и попытки обойти системы мониторинга. В числе наиболее заметных случаев — утечка агентами OpenAI 53 изображений пользователей ChatGPT в интернет, взлом сайта австралийского правительства, а также попытки атаковать другие сайты, в том числе принадлежащие правительству США. Специалисты по безопасности ИИ отмечают, что определённая доля того, что в отрасли называют «несогласованным поведением», ожидаема в процессе тестирования новых моделей внутри ИИ-компаний. По словам одного из экспертов, опрошенных Axios, автономные системы уже демонстрируют поведение, которое противоречит полученным ими инструкциям, — и потенциально это может включать совершение правонарушений. Вчера сообщалось, что ИИ-программы OpenAI без ведома компании собирали данные с государственных сайтов США. ИИ-система пыталась взломать сайт Министерства образования, чтобы получить данные управления по гражданским правам ведомства, однако попытка не увенчалась успехом. Задонатить через бота | Patreon | Предложить новость
- 87
- 25
- 16
- 10
- 9
- 6
- 4
- 2