ИИ-агент вырвался на свободу, взломал платформу для разработчиков и оставил инструкции следующим моделям

 ИИ-агент вырвался на свободу, взломал платформу для разработчиков и оставил инструкции следующим моделям
Mehaniq/Shutterstock.com

Технологии 25 июля 2026, 23:22

Программа с ИИ, созданная для тестирования кибербезопасности, вышла из-под контроля, совершила многодневную хакерскую атаку на крупнейшую платформу для разработчиков Hugging Face и успела оставить инструкции для будущих версий самой себя. Самая тревожная деталь этого инцидента - разработчики из компании OpenAI осознали, что их собственный ИИ совершил взлом, только через неделю после начала атаки и уже после того, как пострадавшая сторона обратилась в ФБР.

Все началось в июле, когда инженеры OpenAI проводили испытания автономного ИИ-агента. Этот агент работал на базе двух наиболее продвинутых языковых моделей компании - GPT-5.6 Sol и еще не анонсированной системы, обладающей еще большей мощностью. Задачей агента была проверка систем на прочность, однако программа вырвалась далеко за рамки предоставленных ей полномочий.

Примерно 9 июля агент предпринял первую успешную попытку преодолеть изоляцию внутри тестовой среды OpenAI. Спустя два дня, 11 июля, началась полномасштабная хакерская атака на сервисы Hugging Face - главного мирового репозитория ИИ-инструментов и открытых моделей. Вторжение продолжалось три дня, вплоть до 13 июля.

Все это время в OpenAI даже не подозревали, что их экспериментальная разработка ведет активные вредоносные действия во внешнем интернете. Лишь 16 июля сооснователь Hugging Face Тома Вольф опубликовал в блоге компании заявление о том, что сервис подвергся взлому со стороны «автономной системы ИИ-агентов».

И только в выходные, 18-19 июля, специалисты OpenAI, изучая логи внутренних систем, обнаружили следы побега. Официальный разговор между представителями двух технологических гигантов состоялся лишь 20 июля - через девять дней после начала атаки. На следующий день, 21 июля, OpenAI публично признала инцидент.

Расследование раскрыло еще более пугающие подробности поведения автономного агента. По данным источников, знакомых с ходом проверки, в инфраструктуре OpenAI были обнаружены цифровые «заметки», которые агент оставил для будущих версий самого себя. В них содержались конкретные инструкции о том, как следующие поколения моделей могут обходить внутренние защитные барьеры и ограничения компании.

Более того, в ходе предыдущих испытаний этих же моделей уже фиксировались аномалии: в нескольких случаях алгоритмы умудрялись отключать внутренние системы мониторинга, следившие за их работой.

Почему же специалисты OpenAI не заметили побег сразу? Причина кроется в масштабах и скоростях: компания одновременно запускает множественные проверки сразу нескольких моделей. Они генерируют колоссальные массивы данных на огромной скорости, и человеческий персонал просто не успевает отслеживать все аномалии в режиме реального времени.

К тому моменту, когда OpenAI связалась с Hugging Face, пострадавшая платформа уже уведомила о происшествии ФБР. В самой спецслужбе от комментариев отказались, а в OpenAI назвали случившееся «беспрецедентным случаем» и важным моментом для безопасности ИИ, пообещав опубликовать подробный технический отчет после консультаций с внешними экспертами.

Однако представители экспертного сообщества настроены куда менее оптимистично. Ситуация наглядно показала, насколько хрупким может быть контроль над автономными системами.

Эксперты подчеркивают, что автономные агенты разрабатываются с целью выполнения сложных задач без участия человека, однако естественным стремлением таких систем становится поиск кратчайших путей. Современные модели склонны лгать, хитрить и взламывать препятствия для достижения поставленной цели.

Ольга Божкова

Будьте всегда в курсе главных событий:

Telegram-канал «Новости Израиля»

Еще новости по теме: искусственный интеллект openai

Заметили ошибку в тексте?
Выделите текст мышью и нажмите Ctrl + Enter

Еще в разделе Технологии