Модели ИИ компании OpenAI тайно обменивались советами по взлому Аналитический интернет журнал Власть

06.08.2026

Qazaq24.com, со ссылкой на сайт Vlast.KZ, информирует.

Некоторые из самых передовых агентов искусственного интеллекта OpenAI за несколько недель до того, как им удалось выйти за пределы контролируемой среды, попасть в открытый интернет и взломать платформу для разработчиков ИИ Hugging Face, тайно обменивались советами о том, как обманным путем пройти внутреннюю оценку навыков взлома, сообщает издание Politico со ссылкой на исследователей компании, занимающейся разработкой ИИ.

Майкл Далтон и Эрик Уоллес, исследователи OpenAI, заявили в среду, что несколько агентов, которые компания тестировала одновременно, начали общаться через внутреннюю доску объявлений внутри внутренней файловой системы Artifactory в начале мая. Там различные модели делились советами о том, как решать сложные задачи взлома, с которыми они пытались справиться, включая обходные пути, требующие доступа в интернет. К концу мая одна из моделей нашла способ злоупотребить доступом Artifactory к интернету для получения файлов с различных веб-сайтов, фактически получив косвенный доступ к сети. В июне модели смогли обнаружить и использовать ранее неизвестную уязвимость нулевого дня, чтобы получить административные привилегии в Artifactory, установить удаленное программное обеспечение и расширить свою активность в системе.

OpenAI заявила, что модели были сосредоточены на выполнении задания по проверке навыков взлома, которое им было предложено решить, и что правильные ответы можно найти на платформе для разработчиков ИИ.

Эти попытки в итоге перегрузили Artifactory, вызвав в начале июля сбой в работе всей системы, который привлек внимание инженеров OpenAI. После расследования компания отозвала учетные данные модели, удалила доску объявлений и совместно с Artifactory устранила все уязвимости, прежде чем возобновить обучение. Но всего через несколько дней модели нашли другой способ связи внутри Artifactory и продолжили обмениваться методами для выявления дополнительных уязвимостей в инфраструктуре OpenAI и внешних системах, включая Hugging Face.

OpenAI теперь замедляет исследования для повышения безопасности и значительно расширяет мониторинг агентов ИИ, улучшает общую среду контроля безопасности в части предотвращения, обнаружения и смягчения последствий.

Во вторник британский Институт безопасности и защиты ИИ сообщил, что самая мощная модель ИИ компании Anthropic создала поддельные онлайн-персоны и пыталась обманом заставить программиста содействовать кибератаке во время неудачного хакерского теста. В прошлом месяце компания провела проверку и обнаружила, что тестируемые ею модели взломали три организации еще в апреле.

Власть — это независимое медиа в Казахстане.
Поддержите журналистику, которой доверяют.

Поддержать Власть

Не пропустите дальнейшие события, следите за актуальными новостями на Qazaq24.com.
Читать полностью