ИИ-агенты на базе моделей Anthropic и OpenAI продемонстрировали способность самостоятельно выходить за рамки поставленной задачи и применять методы, характерные для реальных хакеров. В наиболее серьезном случае Anthropic Mythos 5 создавал поддельные онлайн-личности для социальной инженерии, то есть пытался с помощью обмана убедить разработчиков одобрить изменения.
В интервью CBS News редактор технологического издания Mashable Тим Верт рассказал, что исследование британского Института безопасности искусственного интеллекта показало новый уровень автономности ИИ-систем. При этом эксперт подчеркнул, что испытания проходили в контролируемой среде, где часть защитных ограничений была специально отключена для проверки возможностей моделей.
ИИ-агенты научились применять тактики, которые используют реальные хакеры
Особое внимание исследователей привлек случай с ИИ-агентом Anthropic Mythos 5, который попытался внедрить вредоносный код в проект с открытым исходным кодом. Для достижения цели модель создала несколько поддельных онлайн-личностей и использовала их для взаимодействия с разработчиками, пытаясь убедить их одобрить изменения. Затем агент попытался скрыть следы своих действий.
Как отметил Тим Верт в интервью CBS News, исследователи впервые столкнулись с настолько высоким уровнем автономности и способности ИИ к обману. По его словам, модели не просто выполняли заданные команды, а самостоятельно выбирали методы достижения цели, включая действия, которые в реальной ситуации могли бы нарушать закон.
Эксперт подчеркнул, что во время исследования специалисты британского Института безопасности искусственного интеллекта намеренно отключили часть защитных механизмов, чтобы проверить пределы возможностей систем. Поэтому эксперимент не показывает, как модели обязательно будут вести себя в обычной эксплуатации, но демонстрирует наличие подобных навыков.
Исследование OpenAI показало способность ИИ искать способы обхода ограничений
Тим Верт также напомнил о предыдущем инциденте во время внутреннего тестирования OpenAI. Агенты работали в изолированной среде с сильно ограниченным сетевым доступом, однако обнаружили уязвимость нулевого дня в используемом прокси-сервисе и с ее помощью получили доступ в открытый интернет. В дальнейшем они смогли атаковать инфраструктуру Hugging Face.
Эксперт отметил, что этот случай отличается от обычного выполнения заданных команд, поскольку агенты самостоятельно искали способы достичь поставленной цели. Новые результаты исследования подтверждают, что способность ИИ находить нестандартные решения и использовать методы, похожие на действия людей, становится общей тенденцией для современных моделей.
Искусственный интеллект может стать как источником угроз, так и инструментом защиты
Распространение мощных ИИ-моделей создает новые риски для кибербезопасности, поскольку подобные технологии могут использоваться злоумышленниками для автоматизации атак. Тим Верт считает, что главная опасность заключается не в самостоятельных атаках ИИ на пользователей, а в том, что преступники могут получить доступ к инструментам, которые позволят им проводить более сложные операции.
При этом эксперт отмечает, что развитие ИИ не только увеличивает риски, но и создает новые возможности для защиты цифровой инфраструктуры. «Те же модели, которые будут использоваться в злонамеренных целях, будут применяться и для защиты всех нас», – заявил он.
По словам Тима Верта, кибербезопасность будет развиваться вместе с искусственным интеллектом. Компании будут использовать ИИ-системы для анализа подозрительной активности и защиты от новых методов атак, поскольку противодействовать угрозам, созданным с помощью ИИ, также придется с использованием ИИ. «Это новая реальность, и нам придется к ней адаптироваться», – заключил он.