Qazaq24.com, со ссылкой на сайт Vlast.KZ, информирует.
Некоторые из самых передовых агентов искусственного интеллекта OpenAI за несколько недель до того, как им удалось выйти за пределы контролируемой среды, попасть в открытый интернет и взломать платформу для разработчиков ИИ Hugging Face, тайно обменивались советами о том, как обманным путем пройти внутреннюю оценку навыков взлома, сообщает издание Politico со ссылкой на исследователей компании, занимающейся разработкой ИИ.
Майкл Далтон и Эрик Уоллес, исследователи OpenAI, заявили в среду, что несколько агентов, которые компания тестировала одновременно, начали общаться через внутреннюю доску объявлений внутри внутренней файловой системы Artifactory в начале мая. Там различные модели делились советами о том, как решать сложные задачи взлома, с которыми они пытались справиться, включая обходные пути, требующие доступа в интернет. К концу мая одна из моделей нашла способ злоупотребить доступом Artifactory к интернету для получения файлов с различных веб-сайтов, фактически получив косвенный доступ к сети. В июне модели смогли обнаружить и использовать ранее неизвестную уязвимость нулевого дня, чтобы получить административные привилегии в Artifactory, установить удаленное программное обеспечение и расширить свою активность в системе.
OpenAI заявила, что модели были сосредоточены на выполнении задания по проверке навыков взлома, которое им было предложено решить, и что правильные ответы можно найти на платформе для разработчиков ИИ.
Эти попытки в итоге перегрузили Artifactory, вызвав в начале июля сбой в работе всей системы, который привлек внимание инженеров OpenAI. После расследования компания отозвала учетные данные модели, удалила доску объявлений и совместно с Artifactory устранила все уязвимости, прежде чем возобновить обучение. Но всего через несколько дней модели нашли другой способ связи внутри Artifactory и продолжили обмениваться методами для выявления дополнительных уязвимостей в инфраструктуре OpenAI и внешних системах, включая Hugging Face.
OpenAI теперь замедляет исследования для повышения безопасности и значительно расширяет мониторинг агентов ИИ, улучшает общую среду контроля безопасности в части предотвращения, обнаружения и смягчения последствий.
Во вторник британский Институт безопасности и защиты ИИ сообщил, что самая мощная модель ИИ компании Anthropic создала поддельные онлайн-персоны и пыталась обманом заставить программиста содействовать кибератаке во время неудачного хакерского теста. В прошлом месяце компания провела проверку и обнаружила, что тестируемые ею модели взломали три организации еще в апреле.
Власть — это независимое медиа в Казахстане.
Поддержите журналистику, которой доверяют.