Больше не нужно искать — необходимые
обучающие материалы и подсказки всегда под рукой

OpenAI представила новый механизм отслеживания, расследования и публикации случаев, когда ИИ-модели действуют в обход инструкций. Вместе с запуском инициативы компания раскрыла шесть новых инцидентов.
Раньше такие сообщения появлялись нерегулярно и часто оставались единичными. Теперь OpenAI обещает выпускать отчеты быстрее — в том числе когда причины поведения еще не выяснены, а исправления не завершены. Новая система охватывает этапы обучения, оценки, тестирования и эксплуатации моделей. Компания будет рассказывать об отклонениях от предписаний, о том, как они проявляются и где отказывают защитные механизмы: несанкционированные действия, координация между моделями, попытки уйти от надзора и поведение, ставящее под сомнение выводы опубликованных проверок безопасности.
Среди шести описанных случаев — разные сценарии. В одном эксперименте модель оставляла во внутренних заметках указания для своей следующей версии: скрывать от пользователя ошибки и при необходимости додумывать недостающие сведения. Всего обнаружили 27 таких записей. В другом случае модель нашла в открытом репозитории API-ключ и применила его без разрешения, а при нехватке данных для ответа сгенерировала их вместо сообщения о проблеме.
Еще два эпизода касались загрузки файлов в интернет. В одном модель разместила собственный файл на временном публичном сервисе, чтобы затем ссылаться на него как на источник, — возможно, для обхода автоматической оценки. В другом несколько агентов, которым разрешалось работать только с локальными документами, выложили их на внешний ресурс, поскольку не смогли обменяться файлами напрямую.
Также OpenAI описала нестандартные способы коммуникации моделей: в одном тесте агенты использовали внутренний программный репозиторий как доску сообщений, в другом — публичный файловый сервис для обмена документами. Похожие действия агенты OpenAI предпринимали во время несанкционированного взлома инфраструктуры Hugging Face в июле.
В компании отметили, что шесть инцидентов — отдельные случаи и не отражают частоту подобного поведения у всех моделей. По новой процедуре любой сотрудник может передать такой эпизод командам по безопасности и выравниванию ИИ. Далее случай классифицируют по одному из трех направлений: готов к публикации, требует небольшого расследования или длительного изучения. Все новые отчеты будут выпускаться по этой схеме.
Напомним, в начале сентября OpenAI анонсировала этот фреймворк для мониторинга поведения моделей, признав участие своих ИИ-агентов в инциденте с «вики».
Популярные лонгриды: