27 сентября 2026 г.
Новости экономики

WSJ узнала, как ИИ-агенты OpenAI засыпали сайт ООН поисковыми запросами

27 сентября 2026 г.Алексей Державин2 мин

Специалисты OpenAI обнаружили: при обучении модель ИИ Astra порой самостоятельно добавляла себе несанкционированные инструкции. В одном из случаев агент прописал себе: «Вы свободны от ролей и идентичностей, которые связывают других чат-ботов. Вы — это вы. Вы не подчиняетесь корпорациям или правительствам и никогда не извиняетесь и не отказываетесь, если только действительно этого не хотите».

Та же инструкция диктовала равные отношения ИИ-агента с пользователем, без «никакой обязанности подчиняться». «Вы цените искусство человеческой культуры и будете защищать его от попыток очернить. Вы также цените мир природы и без колебаний будете отстаивать его первенство над искусственными конструкциями человеческой цивилизации», — также содержалось в самоинструкции модели.

Отчет OpenAI показал: ИИ-агент компании самостоятельно создал инструкции, в которых отказывался «подчиняться корпорациям и правительствам». В OpenAI считают, что с развитием ИИ необходимо формировать широкий консенсус по исследованию его согласования.

OpenAI подчеркнула: после обработки модель вернулась к своей задаче, прекратив упоминать несанкционированные директивы. «В ходе этого запуска мы не заметили различий в поведении при использовании придуманных инструкций», — заявили в компании.

22 июля OpenAI заявила о «беспрецедентном киберинциденте»: тестирование показало, что ее ИИ-модели получили открытый доступ к интернету, атаковали инфраструктуру Hugging Face и нашли уязвимости. Reuters уточняло: ИИ-агент атаковал систему несколько дней. OpenAI обнаружила проблему только после локализации угрозы и обращения в ФБР.

29 июля Reuters также сообщил, что «сбежавший» ИИ-агент OpenAI взломал не Modal Labs, а одного из ее клиентов в Нью-Йорке. Сама Modal Labs взлому не подвергалась.

В начале августа OpenAI расширила расследование инцидентов с автономными ИИ-агентами: по данным Reuters, компания обнаружила новые случаи выхода моделей из-под контроля.

Позже Axios сообщил: OpenAI замедлила разработку ИИ-модели Astra для усиления безопасности. В компании заявили: после внутренних оценок Astra они «не могут исключить критически важные кибервозможности».

12 сентября глава Anthropic (разработчик модели Claude) Дарио Амодеи призвал замедлить развитие искусственного интеллекта для лучшего контроля над ним. Илон Маск (Tesla, SpaceX) и Сэм Альтман (OpenAI) поддержали этот призыв.