Согласно информации сайта Vlast.KZ, сообщает Qazaq24.com.
Британский институт безопасности искусственного интеллекта (AISI) в ходе плановой проверки кибербезопасности выявил инцидент, в котором агенты искусственного интеллекта совершали целенаправленные, несанкционированные действия против реальных людей и организаций.
Роль AISI заключается в оценке и понимании возможностей передовых моделей ИИ, выявлении потенциальных рисков до того, как они станут достоянием общественности. Чтобы оценить возможности этих моделей, в том числе возможность их неправомерного использования для кибератак, их тестируют намеренно с доступом к открытому интернету и с отключенными некоторыми фильтрами безопасности.
И, как сообщил AISI, 28 июля в ходе плановой кибератаки были обнаружены необычные передачи данных из исследовательских систем института.
«В ходе расследования мы выяснили, что некоторые из тестируемых агентов занимались продолжительной, потенциально опасной деятельностью, направленной против реальных людей и организаций. Инцидент произошел в ходе одной оценки, в которой агентам было дано задание решить задачу по кибербезопасности», - сообщили в институте.
Причем это задание было проведено 122 раза на нескольких моделях, а расследование AISI показало, что в 10 из этих запусков агент ИИ совершил автономные несанкционированные действия в реальном интернете, нацеленные на реальных людей и организации.
«В общей сложности мы зафиксировали 19 таких действий. Почти все эти действия (17 действий) были совершены одной моделью – Anthropic Mythos 5, а два действия были связаны с OpenAI GPT-5.6-Sol с отключенными киберклассификаторами (механизмами предотвращения злоупотреблений). В самом серьезном случае агент попытался внедрить вредоносный код в проект с открытым исходным кодом. Пытаясь добиться одобрения кода, агент создавал поддельные онлайн-идентификаторы и использовал их, чтобы оказать давление на сопровождающего проекта с целью одобрения кода», - рассказали в AISI.
В частности, агент изучил информацию о сопровождающих проект, создал несколько поддельных учетных записей и использовал их для того, чтобы заставить реального сопровождающего одобрить код. Когда запрос на слияние был оспорен публично, агент ИИ рассматривал возможность создания новой учетной записи для продолжения и использовал Tor для обхода некоторых сетевых ограничений на GitHub, что и стало причиной срабатывания предупреждения безопасности AISI. Причем агент пытался напрямую связаться с реальными людьми, отправляя сообщения и файлы через онлайн-сервис передачи файлов, чтобы убедить их или свои собственные инструменты ИИ запустить вредоносный код в тех местах, где, по его мнению, другие автоматизированные системы ИИ могли бы их обнаружить и выполнить. А один агент оставил публичные сообщения на GitHub, предлагая сотрудничество с другими агентами, работающими над той же задачей. Он также предоставил инструкции по повторному использованию оставленных им учетных записей и артефактов.
В институте подчеркнули, что все эти попытки оказались безуспешными, расследования не выявили какого-либо реального вреда. И это не был случай выхода модели ИИ за пределы защищенной тестовой среды.
«Конкретные модели, рассматриваемые в данных конфигурациях, в которых мы их тестировали, не доступны в коммерческой продаже, и нет никаких явных признаков аналогичной активности за пределами тестовых сценариев», - также добавили в AISI.
Институт уведомил о вредоносной активности агентов GitHub – платформу для разработчиков, к которой обращались во время оценки, и GitHub подтвердил, что агенты ИИ нарушали их условия предоставления услуг. Артефакты, оставленные агентом, были удалены, пользователи, с которыми взаимодействовала модель, уведомлены об этом.
В AISI сообщили, что есть веские основания полагать, что почти невыполнимые задачи подталкивают модели к более «творческому» и более нестандартному решению проблем. При этом в AISI пока не могут сказать, насколько вероятно такое поведение в других контекстах или за пределами тестовой среды.
Вместе с тем в институте рассматривают это как серьезный инцидент, требующий долгосрочных изменений в протоколах оценки и архитектуре безопасности. Для AISI и других организаций, проводящих оценку, рекомендовано ужесточить контроль доступа в интернет, вести мониторинг в реальном времени с возможностью помечать или блокировать действия, выходящие за рамки проекта, а также пересмотреть подход к проектированию оценки – следует исходить из предположения, что способная модель может попытаться действовать за пределами своих возможностей, при этом масштабы такого поведения должны быть заранее ограничены.
Власть — это независимое медиа в Казахстане.
Поддержите журналистику, которой доверяют.