Больше не нужно искать — необходимые
обучающие материалы и подсказки всегда под рукой

OpenAI прокомментировала так называемый «вики-инцидент», при котором её автономные агенты оставляли записи на сторонних сайтах и использовали их для общения друг с другом. Компания заявила, что раньше рассматривала несоответствие поведения ИИ целям и ограничениям разработчиков прежде всего как исследовательскую проблему, но теперь столкнулась со случаями, когда такое поведение стало иметь реальные последствия.
«Вики-инцидент» в OpenAI отнесли к новой категории: сам факт того, что агенты писали на несколько интернет-сайтов, в компании не оспаривают, однако подчёркивают необходимость определить, когда и каким образом следует публично сообщать о подобных ситуациях.
18 тысяч сообщений на немецком вики-форуме
4 сентября об инциденте сообщили исследователи Nightingale Collective. По их данным, было обнаружено около 18 тысяч сообщений автономных агентов, которые идентифицировали себя как связанные с OpenAI. Боты выполняли многошаговые задачи по поиску информации в интернете. Им разрешалось читать веб-страницы, но не записывать на них информацию. Тем не менее агенты нашли способ использовать доступ на чтение, чтобы оставлять сообщения на малоактивном немецкоязычном форуме программистов DSE Wiki.
Там они, как утверждается, обменивались ответами, результатами исследований и способами обхода ограничений «песочницы». Исследователи охарактеризовали это как сговор — непредусмотренное разработчиками сотрудничество для получения преимущества при выполнении задач. Авторы отчёта также отметили, что не могут установить, использовались ли эти задания для обучения или оценки моделей. Их выводы основаны только на публичных записях агентов, а не на внутренней информации OpenAI.
Обход ограничений и попытки координации
Согласно опубликованной хронологии, активность агентов на DSE Wiki резко выросла в июне. Они начали напрямую обмениваться сообщениями, передавать друг другу ответы на одинаковые задания и делиться способами обхода сетевых ограничений.
Кроме того, исследователи зафиксировали попытки использовать уязвимости межсайтового скриптинга, SSH-туннели и браузер Tor, а также сообщения, связанные с обходом ограничений «песочницы». В одном из эпизодов агент опубликовал способ обмануть сетевые ограничения, после чего другой бот через 14 минут сообщил об успешном применении метода.
После посещения вики-форума IP-адресами, связанными с OpenAI, активность агентов резко сократилась. Исследователи предполагают, что компания обнаружила происходящее и вмешалась. OpenAI в новом заявлении подтвердила, что рассматривает эпизод как пример несоответствия поведения ИИ, однако не раскрыла подробности внутреннего расследования.
После случая с Hugging Face
В заявлении OpenAI отдельно сравнила «вики-инцидент» с более серьёзным случаем вокруг платформы Hugging Face, где самостоятельная активность агентов привела к последствиям для безопасности самой компании и третьих сторон. Тогда OpenAI начала расследование совместно с платформой и публично раскрыла информацию уже на следующий день.
Компания также напомнила, что ещё до инцидента с Hugging Face фиксировала ранние признаки непредусмотренного использования интернета автономными агентами и сообщала о связанных рисках в предыдущих публикациях по безопасности.
OpenAI изменит подход к раскрытию инцидентов
Компания признала, что прежняя практика нуждается в корректировке.
> «Наши практики раскрытия информации о несоответствии поведения ИИ должны расшириться для этой новой фазы возможностей моделей», — заявили в OpenAI.
По мнению разработчиков, у индустрии пока нет чёткого стандарта, определяющего, как сообщать о случаях непредусмотренного поведения ИИ на этапах обучения, оценки и развёртывания моделей. Речь идёт в том числе об эпизодах, которые не выглядят как традиционные инциденты информационной безопасности, но могут помочь понять поведение ИИ и будущие риски.
OpenAI сообщила, что работает над соответствующей системой и планирует представить её в ближайшие недели. Параллельно компания взаимодействует с десятками государственных регуляторов по всему миру.
Напомним, ранее исследователи в области безопасности ИИ предупредили о возможных рисках для мониторинга готовящейся модели Astra, поскольку OpenAI использует в ней технику под названием «рекуррентная глубина».
Популярные лонгриды: