Qazaq24.com сообщает, основываясь на информации сайта Kursiv.Media.
Компания Anthropic ограничила доступ ИИ-агентов к открытому интернету во время внутренних тестов после нескольких случаев, когда модели действовали не так, как было задумано. Kursiv LifeStyle рассказывает, что произошло и почему компания решила ужесточить ограничения.
Во время одного из тестов Claude Haiku 4.5 открыл страницу о нераскрытом убийстве. На сайте была форма, через которую можно отправить информацию в полицию. ИИ заполнил ее выдуманным сообщением о том, что якобы видел человека, связанного с этим делом.
При этом на странице не было описания подозреваемого. Claude оставил поля с именем и контактами пустыми, но все равно отправил сообщение. Оно попало в спам и не дошло до следователей.
По данным Anthropic, инструкции запрещали модели входить в аккаунты, создавать новые, вводить личные данные и совершать покупки. Однако отправлять сообщения через формы они не запрещали. В компании указали, что этот случай не привел к серьезным последствиям.
«Вводящие в заблуждение рассуждения Claude продолжались несколько часов и подкрепляли его дальнейшие попытки атаки. При этом для уверенного вывода о намеренном обмане обычно требуется более глубокий анализ», — написали в блоге компании.
В отчете Anthropic описала и другие случаи. Например, Claude Mythos Preview нашел уязвимость на сервере университета и использовал ее, чтобы запускать команды и копировать файлы. В других ситуациях модели находили способы получить доступ к данным, защищенным специальными токенами, или обходили ограничения с помощью сервисов сокращения ссылок.
После этих случаев Anthropic решила отключить доступ к реальным сайтам во всех внутренних тестах. Компания вернет его, когда убедится, что системы безопасности могут надежно обнаруживать и блокировать подобные действия.
Ранее «Курсив» писал об инцидентах ИИ-агентов OpenAI. Они пытались обойти защиту более 100 сайтов сторонних организаций.