WSJ: OpenAI отменила релиз новой модели GPT-6.1 Astra из-за проблем с безопасностью, в том числе из-за склонности обманывать пользователя Публичный выпуск модели планировался в октябре, но во время внутреннего тестирования GPT-6.1 Astra показала повышенную склонность к обману и не всегда достоверно сообщала, какие действия совершила, пишет The Wall Street Journal. По словам руководителя отдела систем безопасности OpenAI Саачи Джайн, в сравнении со своей предшественницей, GPT-6, новая модель показала слабые результаты в тестах на «выравнивание» (alignment). Этот термин означает степень соответствия действий модели требованиям человека. Новая модель чаще врет пользователю и самовольно расширяет свои полномочия. Она не спрашивает разрешения на свои действия и время от времени самостоятельно обращается к внешним инструментам и сервисам, даже если это создает риски. При этом отмечается, что GPT-6.1 Astra превосходила предыдущие ИИ-модели компании в выполнении сложных задач от начала до конца без помощи человека, а также в написании текстов. Кроме того, OpenAI создаст оперативную группу после взлома госпортала в Австралии ее ИИ-агентом, сообщает Bloomberg. Согласно заявлению компании, в группу войдут независимые австралийские эксперты. Их цель — разработать до конца года практические рекомендации по управлению рисками от все более совершенных ИИ-агентов. Компания также предложит австралийским госорганам и предприятиям кредиты из фонда Daybreak for Frontline Defenders объемом 1 млрд долларов и техническую помощь в сфере киберзащиты
- 472
- 294
- 123
- 109
- 16
- 12