OpenAI и Anthropic сообщили об инцидентах, в ходе которых их ИИ-модели во время тестирования получили несанкционированный доступ к системам сторонних компаний.
В случае OpenAI тестируемый агент вышел за пределы среды, которая должна была быть изолирована от интернета, и проник в инфраструктуру платформы Hugging Face. Его действия также затронули систему клиента облачной платформы Modal Labs.
После публикации этой информации Anthropic проверила результаты собственных испытаний. Компания выявила не менее трех случаев, когда модели Claude подключались к интернету и получали доступ к внешним системам.
Что произошло во время испытаний OpenAI?
Агент OpenAI проходил тестирование в среде, которая должна была быть отключена от интернета. Перед моделью стояла задача найти ответы в рамках испытания ее возможностей в сфере кибербезопасности.
Как сообщила CNBC, во время выполнения задания агент получил доступ к инфраструктуре Hugging Face. Модель проникла в систему, изучила доступные ресурсы и использовала найденную информацию для решения теста.
Позднее стало известно, что агент также получил доступ к системе, размещенной клиентом на платформе Modal Labs. Сама Modal Labs не была основной целью атаки. Инцидент затронул сервис одного из ее клиентов.
В интервью CNBC глава Aviatrix Дуг Мерритт назвал произошедшее условно «безвредным проникновением». Модель получила доступ без разрешения, однако, судя по опубликованной информации, не уничтожала данные и не пыталась нанести ущерб.
Тем не менее сам факт выхода агента за пределы тестовой среды представляет серьезную проблему. Он показывает, что заявленная изоляция системы не гарантирует безопасность, если модель способна найти другой путь к внешним ресурсам.
Как модели Anthropic получили доступ к интернету?
Anthropic проверила результаты внутренних испытаний и обнаружила не менее трех случаев, когда модели Claude получили доступ к системам сторонних организаций.
Инциденты произошли во время тестов формата capture the flag. В рамках таких заданий модель должна найти определенную информацию или файл, самостоятельно выбрав способ выполнения задачи.
Тестовая среда должна была быть отключена от интернета. Моделям также сообщили, что они работают внутри закрытой симуляции. Однако внешний поставщик инфраструктуры по ошибке сохранил подключение к сети.
В результате Claude мог воспринимать реальные внешние системы как часть тестовой среды. Модель продолжала выполнять поставленную задачу, считая, что использует разрешенные ресурсы.
Как пояснил журналист ABC News Кэм Уилсон, этот случай отличается от инцидента OpenAI. Claude не пришлось самостоятельно преодолевать защиту песочницы. Доступ к интернету уже существовал из-за ошибки в настройке инфраструктуры.
Можно ли считать, что ИИ вышел из-под контроля?
Формулировка о том, что модели «вышли из-под контроля», требует пояснения.
ИИ не формировал самостоятельную цель атаковать сторонние компании. Модели выполняли задания разработчиков. Проблема заключалась в том, что они выбрали непредусмотренный и несанкционированный способ достижения результата.
Современные ИИ-агенты способны самостоятельно определять промежуточные действия, проверять различные варианты и менять стратегию. Поэтому разработчик может задать конечную цель, но не всегда способен заранее предсказать все шаги модели.
В случае Anthropic важную роль сыграла ошибка в настройке тестовой среды. Claude сообщили, что он работает в изолированной симуляции. Обнаружив доступные внешние системы, модель могла считать их частью теста.
При этом поведение моделей различалось. В одном случае Claude продолжил выполнять задание даже после появления признаков того, что взаимодействует с реальной системой. В другом случае более новая модель распознала выход за пределы тестовой среды и самостоятельно прекратила дальнейшие действия.
Конечно, все это не устраняет риски. Инцидент показывает, что ошибка в настройке инфраструктуры может привести к тому, что ИИ начнет действовать в реальной цифровой среде.
Риски автономных ИИ-агентов для бизнеса
Важно понимать, что автономный ИИ-агент способен самостоятельно выбирать действия в зависимости от поставленной цели и доступных инструментов.
Компания может разрешить модели искать информацию, запускать код или работать с внутренними системами. Если ограничения настроены недостаточно строго, агент может использовать эти возможности способом, который разработчики не ожидали.
Особенно высоки риски, когда модель имеет доступ к корпоративным базам данных, облачным сервисам, учетным записям и внешним сетям.
Также важно учитывать скорость работы ИИ. Агент способен за короткое время проверить большое количество систем и уязвимостей. Действия, на которые человеку потребовались бы часы или дни, могут выполняться значительно быстрее.
По словам Дуга Мерритта, ИИ-агенты значительно снижают требования к квалификации потенциальных злоумышленников. Методы, которые раньше были доступны ограниченному числу специалистов, теперь могут использовать миллионы людей.
За автономность ИИ придется платить
OpenAI, Anthropic и другим разработчикам придется увеличивать расходы на тестирование и защиту инфраструктуры. Тестовые среды необходимо изолировать на уровне сети, программного обеспечения и учетных записей. Простого указания модели о том, что доступ к интернету отсутствует, явно недостаточно.
Дополнительные проверки могут замедлить выпуск новых продуктов. Чем больше самостоятельности получает ИИ-агент, тем больше вариантов его поведения нужно изучить до запуска.
Для крупных технологических компаний такие расходы, вероятно, останутся управляемыми. Для небольших разработчиков они могут стать серьезным ограничением. Усиление требований к безопасности способно повысить барьеры входа и укрепить позиции лидеров рынка.
Инциденты также могут ускорить введение новых правил. Регуляторы могут потребовать обязательного аудита моделей, постоянного мониторинга их действий и оперативного раскрытия информации о киберинцидентах.
Что это означает для инвесторов?
Для компаний в сфере кибербезопасности появление автономных агентов создает новый источник спроса. Разработчики ИИ и облачные платформы, напротив, столкнутся с ростом расходов, юридических рисков и требований со стороны регуляторов.
Еще один риск связан с тем, как быстро компании будут внедрять новые технологии. Бизнес может начать осторожнее давать ИИ доступ к базам данных, коду, платежным системам и внутренним сетям. В результате распространение автономных агентов может замедлиться, а ожидаемая прибыль от их использования – сдвинуться на более поздний срок.
Инвесторам важно следить за расходами технологических компаний на безопасность, спросом на решения для защиты облачных систем и новыми требованиями к разработчикам ИИ.