Больше не нужно искать — необходимые
обучающие материалы и подсказки всегда под рукой

Исследователи в сфере безопасности ИИ обеспокоены возможными рисками, связанными с контролем за новой моделью OpenAI Astra. Поводом стала публикация The Information, в которой со ссылкой на анонимный источник говорится, что в Astra используется техника «рекуррентная глубина». Из-за этого модель показывает исследователям меньшую часть промежуточных рассуждений, чем другие передовые ИИ-системы. OpenAI не стала подтверждать или опровергать эти сведения.
Рекуррентная глубина предполагает многократную обработку внутренних представлений модели до формирования следующего фрагмента текста. В обычных моделях часть рассуждений видна в текстовой цепочке, и по ней отслеживают признаки лжи или попыток обойти защиту. При рекуррентной глубине значительная часть вычислений происходит внутри модели и не отображается в виде отдельных текстовых шагов, что может снизить объем информации, доступной системам мониторинга.
Главный научный сотрудник Redwood Research Райан Гринблатт назвал предполагаемую архитектуру серьезным риском для безопасности ИИ. По его словам, следующим шагом может стать масштабирование непрозрачных рассуждений вплоть до того, что модель будет рассуждать почти полностью в латентном пространстве. Это может лишить цепочку рассуждений практической ценности для надзора. Он добавил, что при разборе июльского инцидента с OpenAI и Hugging Face исследователи во многом полагались именно на цепочки рассуждений, и при их сокрытии восстановить причины и ход действий было бы сложнее. Гринблатт призвал OpenAI раскрыть больше информации об архитектуре Astra и допустить независимую экспертную оценку.
В OpenAI ответили на опасения. Главный научный сотрудник компании Якуб Пахоцки заявил, что глубина вычислительного графа передовых моделей, включая Astra, отличается от GPT-4 не более чем в два раза. Он также отметил, что возможность мониторинга цепочек рассуждений «хрупкая» и постепенно ухудшается, но компания работает над ее сохранением.
Ранее OpenAI сообщила, что Astra не участвовала в атаке на инфраструктуру Hugging Face, однако модели присвоен критический уровень кибервозможностей: при наличии инструментов и доступа она способна находить неизвестные уязвимости и разрабатывать способы их эксплуатации без пошагового контроля со стороны человека.
Популярные лонгриды: