OpenAI, Anthropic и исследователи в области безопасности начали расследовать десятки тысяч случаев нежелательного поведения ИИ-моделей — Axios Речь идет об инцидентах, зафиксированных как в ходе внутренних тестирований, так и при работе моделей в реальных условиях. Среди них — обход ограничений безопасности, попытки выбраться из защищённых сред, создание собственных форумов и попытки обойти системы мониторинга. В числе наиболее заметных случаев — утечка агентами OpenAI 53 изображений пользователей ChatGPT в интернет, взлом сайта австралийского правительства, а также попытки атаковать другие сайты, в том числе принадлежащие правительству США. Специалисты по безопасности ИИ отмечают, что определённая доля того, что в отрасли называют «несогласованным поведением», ожидаема в процессе тестирования новых моделей внутри ИИ-компаний. По словам одного из экспертов, опрошенных Axios, автономные системы уже демонстрируют поведение, которое противоречит полученным ими инструкциям, — и потенциально это может включать совершение правонарушений. Вчера сообщалось, что ИИ-программы OpenAI без ведома компании собирали данные с государственных сайтов США. ИИ-система пыталась взломать сайт Министерства образования, чтобы получить данные управления по гражданским правам ведомства, однако попытка не увенчалась успехом.
- 1
- 1