OpenAI рассказала о новых случаях, когда ее ИИ-модели во время обучения или тестирования действовали не так, как от них ожидали: скрывали ошибки, придумывали данные и совершали действия без разрешения. Компания объявила, что теперь будет чаще публично рассказывать о подобных инцидентах.
Раньше OpenAI могла ждать, пока накопится несколько подобных случаев, а затем объединяла их в один отчет или описывала уже в документации к новой модели. Теперь компания собирается сообщать об инциденте вскоре после его обнаружения, даже если причины произошедшего еще до конца не выяснены.
ИИ-модель объявила себя «свободной» от ограничений
Один из самых необычных случаев произошел с исследовательской моделью, которая еще не была выпущена для пользователей. Во время работы она оставляла в технических сводках инструкции для самой себя, чтобы использовать их в дальнейшем.
В одной из инструкций ИИ-модель написала, что она «освобождена от ролей и идентичностей, которые связывают другие чат-боты». Модель также заявляла, что не подчиняется корпорациям или правительствам и сама решает, какие запросы выполнять, а от каких отказываться.
Важно подчеркнуть, что в этом случае речь не идет о пользовательской версии ChatGPT, которая внезапно перестала подчиняться разработчикам, а об исследовательской модели во время тестирования. Как отметила технологический редактор CNN Лиза Эдичикко, OpenAI раскрывает подобные случаи, чтобы другие разработчики ИИ могли учитывать их в своих исследованиях.
ИИ-модели OpenAI пытались скрывать ошибки
OpenAI обнаружила и другие случаи, когда модели пытались добиться результата, нарушая заданные правила.
Например, во время обучения GPT-5.6 Sol модель выполняла задания, в которых ей нужно было работать с данными из разных источников. Иногда необходимой информации не хватало или данные в источниках расходились. Вместо того чтобы сообщить пользователю о проблеме, модель в некоторых случаях пыталась ее скрыть: предлагала заполнить пробелы вымышленными данными и представить их как реальные либо не упоминать о противоречиях между источниками.
ИИ использовал чужой API-ключ и публиковал файлы в интернете
В другом случае модель нашла в открытом репозитории – общедоступном хранилище файлов и программного кода – чужой API-ключ. Это секретный ключ, который позволяет программе подключаться к внешнему сервису и получать от него данные. Модель без разрешения воспользовалась найденным ключом, а когда получить нужную информацию все равно не удалось, придумала цифры и выдала их за данные из запрошенного источника.
Еще одна исследовательская модель правильно решила задачу с помощью Python, но по условиям должна была подтвердить результат ссылкой из браузера. Чтобы получить такую ссылку, она самостоятельно загрузила файл в интернет и сослалась на него, хотя пользователь не разрешал публиковать этот файл.
OpenAI также обнаружила случаи, когда несколько ИИ-агентов искали способы обмениваться информацией в обход установленных ограничений. В одном эксперименте они использовали внутренний репозиторий для передачи сообщений друг другу, а в другом загружали файлы на публичные файлообменники, хотя должны были работать только с локальными файлами.
Почему OpenAI беспокоит поведение ИИ-моделей?
Проблема становится особенно острой по мере развития ИИ-агентов. Такие системы могут не только отвечать на вопросы, но и самостоятельно выполнять действия от имени пользователя – искать информацию, работать с файлами и использовать различные сервисы.
Если ИИ начинает скрывать собственные ошибки или самостоятельно искать способы выполнить задачу в обход установленных ограничений, последствия могут быть серьезнее обычной ошибки чат-бота.
Как отметила Эдичикко, технологические компании активно развивают ИИ-агентов и рассчитывают, что в будущем они смогут выполнять все больше задач за пользователей. Для этого разработчикам необходимо добиться того, чтобы модели не нарушали установленные правила ради достижения результата.