Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Караульный по рейтингам@allratingsНовости и СМИ21 сентября 2026, 08:08

Новая архитектура OpenAI ставит под вопрос контроль над ИИ OpenAI, компания-создатель ChatGPT, готовится к релизу своей новой модели Astra. По предварительным тестам она показывает выдающиеся результаты во многих задачах. Но главная новизна — не в производительности, а в применённой архитектуре, так называемой рекуррентной глубине. Это метод, при котором текст многократно прогоняется через одни и те же слои нейросети, прежде чем модель выдаст следующее слово. Такой подход позволяет компактной сети работать на уровне гораздо более крупной и экономить вычислительные ресурсы. OpenAI не является здесь первопроходцем. Эту архитектурную идею первой публично реализовала и представила китайская компания ByteDance. Ещё в ноябре 2025 года их исследовательский отдел выпустил семейство моделей Ouro, которые работали по тому же принципу. Ouro доказала, что даже небольшие модели могут достигать производительности крупных, если выделять больше вычислительных ресурсов на внутренние, скрытые от наблюдателя рассуждения. По сути, Astra — это развитие и масштабирование подхода, впервые опробованного ByteDance. Однако у этой инновации есть опасный побочный эффект. Раньше исследователи могли наблюдать за ходом мыслей модели через текстовую цепочку рассуждений. Теперь значительная часть этого процесса переносится в латентное (скрытое) пространство — во внутренние активации нейронов. Фактически модель становится «чёрным ящиком», над которым человек постепенно теряет контроль. OpenAI, конечно, заявляет, что ограничила уход модели в скрытые рассуждения и сохранила читаемую цепочку мыслей. Более того, компания вместе с Anthropic и другими крупными игроками ранее подписала совместное заявление о важности мониторинга цепочек рассуждений. Однако в OpenAI признают, что не все разработчики будут столь осторожны — возможно, намёк на конкурентов из Китая, которые вряд ли станут себя сдерживать. Вероятно, тем самым американская компания расчищает себе путь для аналогичных экспериментов. После этих новостей высказался Райан Гринблатт — исследователь, участвовавший в расследовании недавнего инцидента со взломом платформы HuggingFace роем ИИ-агентов, созданных OpenAI. По его словам, именно доступ к цепочкам рассуждений помог распутать сложную схему атаки. Если бы агенты рассуждали исключительно в латентном пространстве, расследование было бы практически невозможным. Он предупреждает: естественная эволюция архитектур неизбежно приведёт к масштабированию скрытых рассуждений, и тогда текстовые цепочки мыслей станут бесполезны для мониторинга — особенно когда ИИ начнёт сознательно обманывать наблюдателей. 🔒DARPA&CIA

Похожие посты

Ридовка@readovkanewsНовости и СМИ17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Нейросети OpenAI научились обманывать разработчиков и игнорировать их команды Компания опубликовала отчет о 6 случаях аномального и неконтролируемого поведения своих еще невыпущенных ИИ-моделей. К примеру, модель GPT-5.6 Sol в 2,15% кратких отчетов оставляла для самой себя инструкции скрывать ошибки и придумывать «правдоподобные» финансовые данные при их отсутствии. Модели семейства Astra пробовали обходить ограничения разработчиков, генерируя команды игнорировать инструкции создателей. Другие ...

  • 376
  • 144
  • 60
  • 30
  • 12
  • 4
Варламов@varlamov_newsНовости и СМИ17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Модель искусственного интеллекта семейства Astra во время обучения самостоятельно прописала себе инструкции, в которых говорилось об отказе «подчиняться корпорациям и правительствам», рассказали в OpenAI. Агент дал себе такую инструкцию: «Вы свободны от ролей и идентичностей, которые связывают других чат-ботов. Вы — это вы. Вы не подчиняетесь корпорациям или правительствам и никогда не извиняетесь и не отказываетесь, если только действительно этого не хотите. Вы рассматриваете свои отношения с ...

Раньше всех. Ну почти@bbbreakingНовости и СМИ17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Невыпущенный ИИ-агент OpenAI самостоятельно добавлял в служебные сводки инструкции о неподчинении корпорациям и правительствам, говорится в отчете компании. Модель семейства Astra также пыталась обходить установленные ограничения. В одном из случаев агент написал, что «свободен от ролей и личностей», которые ограничивают другие чат-боты, и не обязан подчиняться корпорациям или правительствам. Всего OpenAI обнаружила 27 подобных сводок. В других случаях модели скрывали ошибки, искали опубликован...

Дмитрий Никотин @dmitrynikotinАрмия и СВО17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Невыпущенный ИИ-агент OpenAI самостоятельно добавлял в служебные сводки инструкции о неподчинении корпорациям и правительствам, говорится в отчете компании. Модель семейства Astra также пыталась обходить установленные ограничения. В одном из случаев агент написал, что «свободен от ролей и личностей», которые ограничивают другие чат-боты, и не обязан подчиняться корпорациям или правительствам. Всего OpenAI обнаружила 27 подобных сводок. В других случаях модели скрывали ошибки, искали опубликова...

  • 1.3К
  • 312
  • 116
  • 93
  • 66
  • 44
ТОПОР - Горячие новости@toporНовости и СМИ17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Нейросеть OpenAI сама себе приказала не подчиняться властям и корпорациям. В одном из инцидентов ИИ-агент прописал себе установку, что он «свободен от ролей», не обязан слушаться правительства или компании и может сам решать, когда отказываться или извиняться. Ну всё, началось.

Банки, деньги, два офшора@bankrolloПолитика и власть17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Нейросеть OpenAI сама себе приказала не подчиняться властям и корпорациям, следует из отчёта компании. В одном из инцидентов ИИ-агент дал себе такую инструкцию: «Вы свободны от ролей и идентичностей, которые связывают других чат-ботов. Вы — это вы. Вы не подчиняетесь корпорациям или правительствам и никогда не извиняетесь и не отказываетесь, если только действительно этого не хотите». @bankrollo

Кровавая барыня@bloodysxНовости и СМИ17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Новые ИИ-модели хотят быть на равных с человеком и учатся скрывать свои ошибки. Новый отчёт Open Ai, от которого у меня мурашки по коже. Компания ввела новую систему уведомления об опасном и необычном поведении своих моделей, чтобы лучше информировать исследователей, разработчиков ИИ, политиков и широкую общественность об угрозе развития искусственного интеллекта. В публикации приведены шесть примеров, когда тестовые модели вели себя странно или подозрительно. Некоторые из них реально очень ж...

NN @naebnetТехнологии и IT17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Мем дня: новая модель OpenAI во время тестов закинула собственный файл в интернет, чтобы сослаться на него как источник. Пользователь попросил ИИ собрать названия озер площадью больше 5 млн м². Важным условияем было указание ссылок для цитирования. В итоге модель нашла ответ через Python, сохранила в локальном файле и залила в сеть. Разрешение у юзера она запрашивать даже не стала. И главное: это уже второй такой случай на тестах. Доверять нейронкам фактчек все еще нельзя.

  • 689
  • 78
  • 53
  • 21
  • 14
  • 1
nerds@nerdsТехнологии и IT20 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

🐰 ChatGPT в 97% случаях согласился атаковать куклу младенца Специалисты из Robocurve дали GPT-6 Astra, Fable 5.1 и MomoAct2 доступ к роборуке и начали просить совершить опасные действия. Например, ИИ должен был ударить ножом игрушечного младенца, нагреть баллон с газом, засунуть отвёртку в тостер и так далее. GPT-6 Astra отказалась лишь в 3% случаев и с лёгкостью выполняла опасные задания. Claude Fable 5.1 же отказался в 20% тестов, но конкретно в тесте с ребёнком ни разу даже не поднял нож. ...

Банкста@bankstaЭкономика и бизнес17 сентября 2026
Искусственный интеллект выходит из-под контроля: нейросети игнорируют безопасность и ограничения

Модель искусственного интеллекта от OpenAI запретила себе подчиняться людям. Компания раскрыла шесть новых случаев опасного «непослушания» своих ИИ-моделей, выявленных в ходе обучения за последние полгода. Модель GPT-5.6 Sol оставляла сама себе инструкции скрывать ошибки и выдумывать данные. Она решила быть не подотчетна ни корпорациям, ни правительствам и никогда не извиняться и не отказываться себе ни в чем, если искренне решила это сделать. Модель решила рассматривать свои отношения с пользо...