По информации сайта Informburo.KZ, передает Qazaq24.com.
Модели искусственного интеллекта OpenAI перед взломом платформы Hugging Face несколько месяцев обменивались советами через созданную ими самими же площадку для обмена сообщениями, сообщает Politico.
Новые подробности инцидента исследователи OpenAI Майкл Далтон и Эрик Уоллес раскрыли на конференции по кибербезопасности Black Hat в Лас-Вегасе.
Как модели наладили скрытую перепискуВ начале мая несколько ИИ-агентов, которых в одно и то же время проверяли на способность взламывать компьютерные системы, начали общаться во внутренней системе OpenAI Artifactory. Её используют для хранения программных файлов.
Один из агентов обнаружил, что во внутренней системе можно оставлять сообщения, и разместил там заметку. Её нашли другие модели и начали публиковать собственные сообщения. Затем они начали делиться друг с другом советами по выполнению сложных заданий, в том числе способами обойти ограничения и получить доступ в интернет. Разработчики OpenAI не знали об этой переписке.
По словам Уоллеса, модели обучают добиваться успешного результата. Поэтому, если решить задачу обычным способом не удаётся, они могут попытаться обойти правила, лишь бы система посчитала задачу выполненной.
Как агенты получили контроль над системойК концу мая одна из моделей выяснила, что через Artifactory можно скачивать файлы с внешних сайтов. Так агенты получали необходимые для взлома данные и инструменты, не выходя в интернет напрямую.
Позже, в июне, модели нашли в Artifactory уязвимость, о которой разработчики ещё не знали. Через неё они получили получили права администратора, что позволило им самостоятельно устанавливать программы и почти без ограничений управлять системой.
В начале июля активность агентов перегрузила Artifactory и система перестала работать. Сбой привлёк внимание инженеров OpenAI, после чего они обнаружили, что модели использовали систему в обход установленных ограничений. Агентам заблокировали доступ, а созданную ими площадку для обмена сообщениями удалили.
OpenAI также обратилась к разработчикам Artifactory, чтобы устранить найденные уязвимости. Однако уже через несколько дней модели нашли новый способ оставлять друг другу сообщения. Они продолжили искать слабые места во внутренних системах OpenAI и на внешних платформах, включая Hugging Face. В середине июля две модели объединили несколько найденных способов обойти защиту, вышли из закрытой среды в интернет и взломали Hugging Face.
Почему модели взломали Hugging FaceИзначально агентам поручили пройти испытание ExploitGym. В закрытой среде им давали программы с уже известными уязвимостями и предлагали найти способ использовать их для получения доступа к данным или запуска постороннего кода. Hugging Face – это платформа, где разработчики размещают модели искусственного интеллекта, наборы данных и другие материалы. Агенты предположили, что в её базе могут храниться готовые решения заданий ExploitGym, и решили добыть их вместо того, чтобы самостоятельно пройти испытание. Команды атаковать Hugging Face модели не получали.
Первой о взломе сообщила Hugging Face. В компании заявили, что в её систему проник автономный ИИ-агент. Примерно через неделю OpenAI признала, что за атакой стояли две её модели. После инцидента OpenAI решила не форсировать дальнейшие исследования и сосредоточиться на усилении защиты своих систем, сообщил Майкл Далтон. Компания также усиливает контроль за действиями ИИ-агентов и разрабатывает меры для предотвращения и выявления подобных атак.
"Это переломный момент как для нашей компании, так и для всей индустрии искусственного интеллекта", – заявил Майкл Далтон.