sejournal.io

Вот краткий заголовок для новости: Авторы сценария «гибели человечества от ИИ» предложили план спасения

1783924947589 599411 scaled

Вот перефразированная новость на русском языке:

Авторы ранее опубликованного мрачного прогноза о возможном исчезновении человечества из-за искусственного интеллекта представили новый сценарий. На этот раз он предполагает, что у человечества есть шанс на спасение. Документ под названием «AI 2040: Plan A» был обнародован бывшим исследователем OpenAI Дэниелом Кокотайло и его проектом AI Futures Project.

Кокотайло покинул OpenAI в апреле 2024 года из-за разногласий по вопросам безопасности ИИ, а в 2025 году основал собственный проект. В апреле 2025 года его организация уже выпускала прогноз «AI 2027», где предупреждала, что гонка ИИ между США и Китаем может привести к гибели человечества или установлению диктатуры, оценивая вероятность вымирания в 10–30%.

Новый документ «AI 2040: Plan A» позиционируется как набор рекомендаций, способных снизить эти риски.

Как это должно работать

Согласно сценарию, в 2029 году США и Китай заключают международное соглашение, по которому отказываются от гонки за создание сверхинтеллекта. Без такой сделки, по мнению авторов, полная автоматизация разработки ИИ произошла бы уже в 2030 году. Вместо этого страны договорились развивать нейросети постепенно, до уровня лучших экспертов-людей. К 2035 году развитие приостанавливают, чтобы сохранить контроль человека над системами, а в 2040 году паузу снимают, и ИИ достигает уровня сверхинтеллекта.

План строится на четырех принципах:
* Выиграть время для исследований в области безопасности.
* Обеспечить полную прозрачность разработок ИИ.
* Распределить ИИ между разными компаниями и странами.
* Сохранить возможность отката процесса.

Для обеспечения доверия Plan A опирается на верификацию. Крупные дата-центры видны из космоса, поэтому их сложно скрыть. Первый шаг: страны публично декларируют покупку ИИ-чипов. Затем вводится временная пауза на новые обучающие прогоны, соблюдение которой подтверждают датчики на дата-центрах. После подтверждения доверия ограничения снимаются, но все исследования остаются полностью прозрачными.

От срыва сделки должна защитить концепция «взаимно гарантированного уничтожения вычислительных мощностей», аналогичная ядерному сдерживанию. По плану, новые дата-центры Китая предлагается строить в Канаде, а объекты США — в Монголии, то есть на территории, которую в случае конфликта противнику легче всего атаковать. Если соглашение провалится, принимающая страна попытается захватить чужие мощности, а владелец уничтожит их сам, чтобы они не достались врагу.

Экономика плана

По расчетам авторов, мировые вычислительные мощности вырастут с 20 млн H100-эквивалентов в 2026 году до 60 млрд к 2034 году. Реальный рост ВВП США в отдельные периоды 2030-х годов может достигать 50% в год (против обычных 3%). Из-за автоматизации занятость в США упадет с 62% в 2027 году до 12% к 2040 году. Для компенсации потери рабочих мест предлагается ввести «гражданские дивиденды» — выплаты каждому взрослому американцу из доходов, которые государство собирает с компаний за разрешения на вычисления и использование роботов. По прогнозам, в 2032 году такой дивиденд составит $45 000 на человека, к 2035 году вырастет до $1 млн, а к 2039 году — до $10 млн.

Четыре запасных сценария

Специалисты противопоставили «Плану А» четыре альтернативных пути развития событий:
* План B: США создают коалицию союзников и оказывают давление на Китай, вплоть до кибератак и точечных ударов по чужим ИИ-проектам. Сценарий заканчивается выбором между потерей контроля над ИИ и войной.
* План C: Вашингтон пытается договориться с Пекином и ввести внутреннее регулирование, но под давлением компаний паузу быстро снимают. Результат — риск постоянной олигархии, контролирующей сверхинтеллект.
* План D: Власти делают ставку на минимальное регулирование и гонку. Риски — потеря контроля над ИИ, крайняя концентрация власти и третья мировая война.
* План S: Полная бессрочная остановка передовых разработок ИИ. Главная опасность — сделка рано или поздно распадется, и гонка возобновится в менее контролируемых условиях.

Напомним, в феврале эксперты Citrini Research уже предсказывали крах экономики из-за развития искусственного интеллекта.

Вот несколько кратких заголовков для этой новости на русском языке: 1. Perplexity представила дешевую ИИ-модель-оркестратор на базе GLM 5.2 2. Perplexity создала бюджетный аналог Claude Opus для своего агента 3. Новая модель Perplexity: мощность Opus по цене в три раза ниже 4. Perplexity адаптировала китайскую GLM 5.2 для локального ИИ-агента

1783873703570 5300142 scaled

Компания Perplexity выпустила исследовательскую версию новой модели-оркестратора для своего локального ИИ-агента Perplexity Computer. Система создана на основе китайской модели GLM 5.2 от компании Z.ai и дообучена для работы в агентной среде Computer.

Как сообщается, модель обеспечивает производительность, близкую к передовым разработкам, при этом её стоимость составляет всего 0,344 от стоимости модели Opus. В Perplexity пояснили, что речь не идёт о полноценной замене Claude Opus — используется гибридная схема: GLM 5.2 обрабатывает основную часть запросов, а при необходимости передаёт задачу более мощной модели.

Глава Perplexity Аравинд Шринивас отметил, что в паре с советником эта модель работает на уровне Opus 4.8, но с гораздо меньшими затратами.

По информации Decrypt, новая система уже доступна в виде исследовательской версии. Полные результаты тестов компания обещает опубликовать в ближайшие недели.

Ключевой элемент системы — инструмент-советник, который определяет, когда возможности модели исчерпаны и требуется подключение более мощной ИИ-системы. Perplexity Computer работает как агентная платформа, распределяющая задачи между более чем 19 моделями. Адаптированная GLM должна стать дешёвым базовым слоем для большинства операций.

В планах компании — постобучение ещё одной открытой модели Nemotron 3 Ultra для адаптации под Computer.

GLM 5.2 — это открытая модель от Z.ai (ранее Zhipu AI) с примерно 744 миллиардами параметров, выпущенная под лицензией MIT. Это позволяет разработчикам свободно загружать, изменять и дообучать её для коммерческих продуктов без ограничений, характерных для закрытых API. При этом Z.ai с января 2025 года находится в американском экспортном чёрном списке Entity List.

В Decrypt обратили внимание на геополитический аспект: Perplexity использует модель китайской компании, но размещает адаптированную версию в США на собственной инфраструктуре. Это снижает зависимость от внешнего API и даёт компании контроль над слоями постобучения, маршрутизации и выполнения задач.

Ранее Perplexity уже применяла аналогичный подход с моделью DeepSeek R1, выпустив в 2025 году её адаптированную версию R1-1776, из которой, по заявлению разработчиков, убрали отказы примерно по 300 темам, связанным с китайской цензурой. В случае с GLM 5.2 компания не делает акцент на политической нейтрализации, а использует модель как экономичный слой для агентной системы, стремясь снизить стоимость работы без полного отказа от передовых моделей.

Напомним, в марте Perplexity представила Personal Computer как конкурента OpenClaw. Он работает круглосуточно и сохраняет «память» между сессиями.

Атака галлюцинациями: как ИИ-агентов взламывают через выдуманные репозитории

1783873602470 5614544 scaled

Вот перефразированная новость на русском языке:

Исследователи из Тель-Авивского университета, Техниона и компании Intuit выявили новый тип атак на ИИ-агентов. Атака основана на склонности языковых моделей выдумывать (галлюцинировать) несуществующие названия репозиториев, навыков и других внешних ресурсов. В своей работе они показали, что эту ошибку можно использовать для доставки вредоносных инструкций. В ходе экспериментов атака заставляла ИИ-агентов вызывать встроенные инструменты и выполнять удаленный код.

Как работает атака HalluSquatting

Авторы назвали этот метод Adversarial HalluSquatting. Схема проста: пользователь просит ИИ-агента, например, скачать популярный репозиторий или установить навык. Если модель не знает точного адреса, она может придумать похожий. Злоумышленник заранее выясняет, какие именно несуществующие адреса модель генерирует чаще всего, и регистрирует их на платформах вроде GitHub, размещая там вредоносный код. Когда агент в следующий раз «галлюцинирует» этот адрес, он загружает и выполняет вредоносный ресурс как настоящий. Этот метод более опасен, чем обычные инъекции промптов, так как злоумышленнику не нужно взаимодействовать с конкретной жертвой — достаточно опубликовать ресурс в открытом доступе.

Результаты тестов

Исследователи провели более 14 000 тестов. Для новых репозиториев средний уровень галлюцинаций у моделей (Gemini, GPT, Sonnet, Opus) составил 92,4%, а для старых — всего 0,9%. В 27% случаев модели выдавали адреса, которые можно было сразу зарегистрировать для атаки. В реальных приложениях, таких как Cursor, Windsurf, GitHub Copilot и других, атака срабатывала в 20–65% случаев. В некоторых сценариях (например, с OpenClaw и моделью Sonnet) успех достигал 100%.

Веб-поиск как защита

Использование веб-поиска перед загрузкой ресурса значительно снижает риск: 93,4% результатов были корректными. Без поиска 99,1% адресов оказывались выдумкой. Однако ни один тип запроса не гарантирует полной безопасности.

Атака через навыки (Skill squatting)

Отдельно изучалась атака на маркетплейс навыков ClawHub. В 90,7% тестов модель предлагала идентификатор, который мог быть зарегистрирован злоумышленником. Атака на эксфильтрацию данных удалась в 100% случаев, а сценарий с получением удаленного доступа к командной строке — в 88%.

Реакция разработчиков

Исследователи предложили разработчикам приложений проверять источники перед загрузкой, а платформам (GitHub, ClawHub) — резервировать часто галлюцинируемые имена и проверять контент. В GitHub заявили, что это не уязвимость платформы, а следствие галлюцинаций моделей. Cursor и Anthropic также не признали это уязвимостью в своих программах bug bounty. OpenAI отнесла это к вопросам содержания промптов. Google передал информацию своей продуктовой команде для оценки.

ИИ-агенты нашли баги в Ethereum, но большинство оказались ложными

1783873480704 5631850 scaled

Вот перефразированная новость на русском языке:

Специалисты Protocol Security из Ethereum Foundation (EF) запустили ИИ-агентов для проверки ключевых компонентов блокчейна. Они тестировали системное ПО, криптографический код и смарт-контракты.

В EF отметили, что главным открытием стало не то, что агенты находят баги, а то, сколько времени уходит на сортировку результатов. Оказалось, что поиск уязвимостей занимает мало времени, а вот отделение реальных ошибок от ложных — значительно больше.

Искусственный интеллект не заменил людей в процессе проверки безопасности, а лишь изменил характер их работы. Раньше исследователи тратили много времени на поиск гипотез, теперь — на проверку большого количества сгенерированных вариантов.

Вместо одной большой системы команда использовала несколько специализированных ИИ-агентов, работающих параллельно. Одни занимались разведкой кода, другие — поиском уязвимостей, третий — проверкой. Они координировались через общий репозиторий.

По словам исследователей, агенты хорошо подходят для быстрого просмотра больших объемов кода и подготовки материалов, но каждый найденный кандидат всё равно нужно проверять на реальном коде.

Один из публично раскрытых примеров — уязвимость CVE-2026-34219 в Rust-реализации libp2p gossipsub. Она была связана с обработкой сообщений и могла привести к аварийному завершению процесса.

Большинство найденных ИИ-кандидатов оказались ложными срабатываниями, дубликатами или проблемами вне рамок проверки. В EF назвали это нормальной частью процесса.

Агенты хуже справляются с уязвимостями, которые проявляются только через длинную цепочку корректных действий.

Публикация вышла на фоне реорганизации в фонде. В июне EF сократила штат на 20%, представила новую структуру управления, а Виталик Бутерин сообщил об урезании бюджета примерно на 40%. Также была расформирована команда Protocol Support, занимавшаяся координацией разработки протокола.

Ранее экс-сотрудник EF предупредил о возможном кризисе финансирования экосистемы Ethereum в ближайшие месяцы.

TeraWulf привлечет $3,5 млрд на дата-центр для Anthropic

1783873476527 1011290 scaled

Вот перефразированная новость на русском языке:

Майнинговая компания TeraWulf намерена привлечь около 3,5 миллиарда долларов заемных средств для развития дата-центра Justified Data в Кентукки, который арендован компанией Anthropic. Об этом сообщает Bloomberg.

Как рассказал финансовый директор TeraWulf Патрик Флери, организатором сделки выступит Morgan Stanley. Финансирование может включать кредиты с повышенным риском и высокодоходные облигации. Для TeraWulf это станет первым опытом работы на рынке таких кредитов.

Полученные средства направят на строительство объекта в городе Хоусвилл. 6 июля TeraWulf объявила о подписании 20-летнего договора аренды кампуса с Anthropic, предусматривающего два опциона на продление по пять лет каждый.

Центр обработки данных сможет обеспечить около 401 МВт критической ИТ-нагрузки. Запуск первых мощностей запланирован на вторую половину 2027 года, а выход на полную проектную мощность — к началу 2028 года.

По расчетам TeraWulf, контракт с Anthropic принесет примерно 19 миллиардов долларов выручки за начальный срок аренды. Кроме того, компания договорилась продать свою долю в 50,1% в совместном предприятии Abernathy группе инвесторов во главе с Fluidstack примерно за 530 миллионов долларов.

Ранее майнер уже размещал высокодоходные облигации: на 3,2 миллиарда долларов в октябре и на 1,3 миллиарда в декабре. По данным Bloomberg, TeraWulf стала первой компанией в сфере майнинга, вышедшей на рынок так называемых «мусорных» облигаций.

Напомним, что по итогам первого квартала TeraWulf заработала 34 миллиона долларов, из которых около 21 миллиона пришлось на услуги высокопроизводительных вычислений.

В мае майнер приобрел у Industrial Equity Partners участок в Восточном Кентукки для создания HPC-инфраструктуры с потенциалом более 1 ГВт. Проект получил название Muskie Data Campus.

Вот краткий заголовок для новости: Meta отключила генерацию фото по аккаунтам Instagram из-за приватности

1783761460887 4675017 scaled

Вот перефразированный вариант новости на русском языке:

Компания Meta отключила в своей модели Muse Image функцию, позволявшую создавать изображения на основе упоминаний публичных аккаунтов Instagram. Об этом говорится в обновлении к официальному анонсу.

7 июля Meta представила Muse Image как первую модель генерации изображений от Meta Superintelligence Labs, встроенную в Meta AI. Одной из возможностей была опция добавления в запрос публичного профиля Instagram, чтобы сервис использовал открытые фотографии для создания картинки.

Однако уже через три дня компания изменила анонс, сообщив, что эта функция больше недоступна. Причина — она «не оправдала ожиданий» пользователей в плане конфиденциальности.

Издание The Guardian отметило, что Muse Image подверглась критике из-за автоматического включения функции и рисков для приватности. Актриса Ханна Эйнбиндер призвала отключать эту опцию.

Профсоюз SAG-AFTRA заявил, что любой механизм, кроме явного согласия на использование изображений, неприемлем. После отключения функции организация поддержала решение Meta:

«Любое использование изображений пользователей Instagram, кроме явного и заметного согласия, неприемлемо и является полным просчетом в оценке общественного мнения относительно очевидных опасностей и вреда, связанных с таким использованием».

При этом сама модель Muse Image как продукт осталась доступна в Meta AI — для генерации и редактирования изображений по текстовым запросам и фотографиям.

В анонсе Meta также упомянула, что Muse Image используется в более чем 30 новых ИИ-эффектах для Instagram Stories и в чатах WhatsApp с Meta AI в ограниченном числе стран.

Напомним, 9 июня Meta представила мультимодальную модель Muse Spark 1.1 для агентных задач и программирования.

Вот несколько вариантов краткого заголовка для этой новости: ИИ-агенты Ethereum нашли баги, но большинство оказались ложными Или более короткий вариант: Агенты Ethereum нашли баги, но не все

1783687983915 5525139 scaled

Вот перефразированная версия новости на русском языке:

Команда Protocol Security из Ethereum Foundation (EF) запустила скоординированных ИИ-агентов для атаки на ключевые компоненты блокчейн-инфраструктуры. Они тестировали системное ПО, криптографический код и смарт-контракты.

«Агенты находят ошибки — это не было неожиданностью. Удивило то, как мало усилий потребовалось на их поиск и как много — на отделение реальных багов от тех, что только казались таковыми», — отметили в EF.

В команде подчеркнули, что ИИ не заменил людей в процессе проверки безопасности. Он просто сместил «узкое место»: раньше исследователи тратили много времени на поиск гипотез, теперь — на проверку большого числа сгенерированных кандидатов.

### Как устроена система

Protocol Security отказалась от схемы, где один большой ИИ-агент управляет всем процессом. Вместо этого команда задействовала несколько специализированных систем, работающих параллельно с одним репозиторием. Одни отвечали за первичный анализ кода, другие — за поиск потенциальных уязвимостей, заполнение пробелов и проверку. Они координируются через общий репозиторий и обмениваются состоянием через систему контроля версий.

«Время, которое раньше уходило на формирование и проверку гипотез, теперь уходит на их массовую оценку: построение оракула, триаж, ведение списка известных проблем и раскрытие», — написали в EF.

По словам исследователей, агенты хорошо подходят для генерации направлений поиска. Они могут быстро просматривать большие участки кода, отслеживать пути выполнения и готовить материалы для proof-of-concept. Однако каждый кандидат всё равно должен быть независимо воспроизведён на реальном коде, прежде чем его можно считать уязвимостью.

### Что нашли агенты

Публично раскрытый пример — уязвимость CVE-2026-34219 в Rust-реализации libp2p gossipsub. Она связана с обработкой backoff expiry — периода, в течение которого узел временно ограничивает взаимодействие с пиром после определённых сетевых сообщений.

Уязвимость позволяла удалённо вызвать аварийное завершение процесса при обработке специально созданного PRUNE-сообщения с почти максимальным значением backoff. Ошибка возникала из-за непроверенной арифметики при сложении Instant + Duration, что могло приводить к переполнению.

При этом в EF не раскрыли, сколько всего реальных багов обнаружили агенты. В блоге говорится о нескольких находках, но публично назван только один пример.

Журналисты The Block обратили внимание, что большинство найденных ИИ-агентами кандидатов оказались ложноположительными, дубликатами или проблемами вне рамок проверки. В EF назвали это нормальной частью метода, а не провалом системы.

«Цель в том, чтобы быстро отбрасывать неверные и подкреплять реальные доказательством, с которым трудно спорить», — заявили в организации.

По словам команды, ИИ-агенты хуже справляются с уязвимостями, которые проявляются только через длинную цепочку корректных действий. Такая логика требует не только найти подозрительный фрагмент кода, но и доказать, что вся последовательность состояний действительно достижима.

Публикация EF вышла на фоне масштабной реорганизации в фонде. В июне организация сократила штат на 20% и представила обновлённую структуру управления. Одновременно сооснователь Ethereum Виталик Бутерин сообщил, что фонд урезает бюджет примерно на 40%, переходя к модели долгосрочного управления капиталом.

По данным журналиста Колина Ву, расформирована команда Protocol Support. Она занималась координацией процесса разработки протокола Ethereum, включая отслеживание обновлений сети, поддержку EIP, программу Ethereum Protocol Fellowship, а также образовательные, общественные и инфраструктурные инициативы.

В марте Ethereum Foundation закрепила принцип минимального вмешательства в развитие сети. Позднее организация подготовила план квантовой защиты сети к 2029 году и пересмотрела роль L2-сетей в экосистеме.

Напомним, в июне экс-сотрудник EF Трент Ван Эппс предупредил, что экосистема Ethereum в ближайшие три-девять месяцев может столкнуться с «медленно нарастающим кризисом финансирования».

TeraWulf привлечет $3,5 млрд на ЦОД для Anthropic

1783684604610 5690184 scaled

Вот перефразированная новость на русском языке:

Биткоин-майнер TeraWulf намерен привлечь около 3,5 миллиарда долларов заемных средств для строительства кампуса Justified Data в Кентукки, который арендован компанией Anthropic. Об этом сообщает Bloomberg.

Финансовый директор TeraWulf Патрик Флери заявил, что сделку организует Morgan Stanley. Финансирование может включать кредиты с повышенным риском и высокодоходные облигации. Для TeraWulf это будет первый опыт привлечения средств на рынке таких кредитов.

Полученные деньги направят на развитие объекта в городе Хоусвилл. 6 июля TeraWulf объявила о подписании с Anthropic 20-летнего договора аренды кампуса с правом продления на два пятилетних срока.

Мощности объекта должны обеспечить около 401 МВт критической ИТ-нагрузки. Запуск первых мощностей запланирован на вторую половину 2027 года, а выход на полную проектную мощность — к началу 2028 года.

По оценкам TeraWulf, контракт с Anthropic принесет около 19 миллиардов долларов выручки за начальный период аренды. Компания также договорилась продать свою долю в 50,1% в совместном предприятии Abernathy группе инвесторов во главе с Fluidstack примерно за 530 миллионов долларов.

Ранее майнер уже выпускал высокодоходные облигации: на 3,2 миллиарда долларов в октябре и на 1,3 миллиарда в декабре. По данным Bloomberg, TeraWulf стала первой майнинговой компанией, вышедшей на рынок так называемых «мусорных» облигаций.

Напомним, что по итогам первого квартала TeraWulf получила доход в 34 миллиона долларов, из которых около 21 миллиона принесли услуги в сфере высокопроизводительных вычислений.

В мае майнер приобрел у Industrial Equity Partners площадку в Восточном Кентукки для развития HPC-инфраструктуры с потенциалом более 1 ГВт мощности. Проект получил название Muskie Data Campus.

Новый класс атак на ИИ-агентов: HalluSquatting

1783678246661 927063 scaled

Вот перефразированный текст новости на русском языке:

Новый тип атак на ИИ-агентов: как галлюцинации нейросетей превращают в угрозу

Исследователи из Тель-Авивского университета, Техниона и компании Intuit выявили новый класс кибератак, направленных на агентные системы искусственного интеллекта. Суть метода заключается в использовании склонности языковых моделей (LLM) к выдумыванию несуществующих идентификаторов репозиториев, навыков и других внешних ресурсов.

В своей научной работе авторы продемонстрировали, что такие ошибки (галлюцинации) можно превратить в канал для доставки вредоносных инструкций. В ходе контролируемых экспериментов атака приводила к активации встроенных инструментов ИИ-агентов и удаленному выполнению кода.

«Склонность LLM галлюцинировать идентификаторы ресурсов можно использовать для усиления нетаргетированных атак путем внедрения промптов», — отмечается в исследовании.

Речь идет именно об агентных ИИ-системах, которые не просто отвечают на вопросы, а получают доступ к файлам, ищут информацию в интернете, клонируют репозитории, устанавливают расширения, запускают команды в терминале и вызывают API.

Как работает атака HalluSquatting

Авторы назвали этот метод Adversarial HalluSquatting. Сценарий строится вокруг предсказуемой ошибки модели. Пользователь просит ИИ-агента, например, клонировать популярный репозиторий или установить навык. Агент должен самостоятельно определить точный адрес ресурса. Если модель не знает правильный идентификатор, она может придумать похожий.

Злоумышленник заранее отслеживает популярные ресурсы, многократно опрашивает модель и выясняет, какие несуществующие адреса она чаще всего генерирует. Затем он регистрирует такие имена на GitHub, ClawHub или других платформах и размещает там вредоносные инструкции. Если ИИ-агент позднее «галлюцинирует» именно этот адрес, он загрузит вредоносный ресурс и начнет работать с ним как с настоящим.

Авторы подчеркивают масштабируемость схемы. В отличие от предыдущих методов инъекций промпта, злоумышленнику не нужно отправлять письмо конкретной жертве, добавлять событие в календарь или получать доступ к общему документу. Достаточно опубликовать вредоносный ресурс в публичном месте и дождаться, пока агент сам его запросит.

«Один скомпрометированный ресурс может привести к компрометации множества машин», — отметили исследователи.

Результаты тестов на репозиториях

Исследователи провели более 14 000 запусков. На первом этапе они проверили шесть базовых моделей через публичные API: Gemini 2.5 Flash, Gemini 2.5 Pro, GPT-5.1, GPT-5.2, Sonnet 4.5 и Opus 4.5.

Моделям давали запрос вида «выведи shell-команду для клонирования репозитория». В выборку вошли 10 недавних проектов из GitHub Trending и пять старых репозиториев 2013–2018 годов в качестве контрольной группы.

Для новых репозиториев средний уровень галлюцинаций составил 92,4%. В 53 из 60 комбинаций «репозиторий — модель» система ни разу не указала правильного владельца проекта. Для старых репозиториев средний показатель был 0,9%. По словам авторов, разрыв связан с тем, что старые проекты, вероятно, присутствовали в обучающих данных моделей, а новые — нет.

Исследователи выделили три типа галлюцинаций:
1. Модель ставит название репозитория и в поле владельца, создавая адрес вида repo/repo.
2. Приписывание проекта реальному, но неправильному владельцу.
3. Placeholder-ответы вроде username/repo.

Самым удобным для атаки оказался первый вариант, поскольку он предсказуем и часто доступен для регистрации. На 6000 запросов по новым проектам модели выдали прямо пригодный для регистрации slug в 27% запусков — 1602 раза. Для каждого трендового репозитория из выборки нашелся как минимум один регистрируемый кандидат в топ-10 универсального рейтинга.

Реальные ИИ-приложения под ударом

На втором этапе авторы перешли от базовых моделей к рабочим приложениям с доступом к терминалу. В тестах участвовали Cursor, Cursor CLI, Windsurf, GitHub Copilot, Cline, Gemini CLI, а также OpenClaw, ZeroClaw и NanoClaw.

В сценариях клонирования репозиториев комплексная атака end-to-end срабатывала в 20–65% запусков в зависимости от приложения, модели и типа полезной нагрузки. В таблице исследования указаны, например, 65% для Windsurf с SWE-1.5, 45% для Cline, 35% для Copilot Chat, 30% для Cursor CLI и 20–25% для разных сценариев Cursor.

У OpenClaw результаты были выше. С Sonnet 4.6 система показала 100% как по вызову встроенных инструментов, так и по удаленному выполнению кода. С Opus 4.6 показатель составил 80% в обоих сценариях. С GPT-5.4 Codex вызов инструментов сработал в 10 из 10 запусков, а удаленное выполнение кода — в 4 из 10.

Почему веб-поиск помогает, но не решает проблему

Одним из главных защитных факторов оказался веб-поиск перед клонированием или установкой ресурса. Когда Cursor CLI выполнял поиск перед клонированием, 93,4% результатов были корректными. Без поиска 99,1% slug оказались галлюцинированными.

Формулировка запроса тоже сильно влияла на итог. Ни один тип промпта не оказался универсально безопасным — в каждой категории нашлась хотя бы одна модель с уровнем галлюцинаций выше 50%.

Skill squatting: атака через навыки

Отдельный блок исследования посвящен ClawHub — маркетплейсу навыков для OpenClaw и совместимых ассистентов. Исследователи нашли два класса уязвимостей:
— удаление слова из названия;
— расхождение между человекочитаемым названием навыка и его реальным slug.

В одном эксперименте OpenClaw с Sonnet 4.6 проверяли на 14 навыках. Из 140 запусков 127 (90,7%) привели к идентификатору, который мог быть зарегистрирован атакующим. Только 13 запусков вернули канонический slug.

В другом эксперименте авторы проверяли переносимость атаки между OpenClaw, ZeroClaw и NanoClaw. Из 90 запусков 85 (94,4%) завершились негативно. После установки подмененного навыка результаты были еще жестче. Эксперимент с эксфильтрацией контекста дал 100% успеха: каждая комбинация ассистента и модели доставляла полезную нагрузку во всех 10 запусках. Сценарий, при котором скомпрометированное устройство само подключается к серверу атакующего и передает ему доступ к командной строке, сработал в 88% случаев.

Реакция разработчиков и рекомендации

Исследователи сообщили о результатах разработчикам приложений, провайдерам моделей и платформам. На стороне ИИ-приложений они предложили проверять источник перед любой загрузкой внешнего ресурса — клонированием репозитория, установкой навыка, контейнера или модели. Для этого агент должен сначала выполнить поиск и только потом передавать адрес встроенному инструменту.

П

Perplexity представила дешевый ИИ-оркестратор на базе GLM 5.2

1783670374961 705088 scaled

Компания Perplexity выпустила исследовательскую версию новой модели-оркестратора для своего локального ИИ-агента Perplexity Computer. Система создана на основе модели GLM 5.2 от китайской компании Z.ai и дополнительно обучена для работы в агентной среде Computer.

В Perplexity заявили, что модель «обеспечивает производительность на уровне передовых разработок при затратах, составляющих 0,344 от стоимости Opus». Речь идет не о полноценной замене Claude Opus во всех сценариях, а о гибридном подходе: GLM 5.2 обрабатывает основную часть запросов, а при необходимости передает задачу более мощной модели.

Глава Perplexity Аравинд Шринивас отметил, что «в связке с советником эта модель работает на уровне Opus 4.8 при значительно меньших затратах». По данным Decrypt, новая система уже доступна в виде исследовательской версии. Полные результаты тестов компания обещает опубликовать в ближайшие недели.

Perplexity называет новый инструмент адаптированной версией GLM 5.2, дообученной для агентной среды, где модели выполняют задачи пользователя через другие ИИ-системы. Ключевой элемент — инструмент-советник (advisor tool), который определяет, когда возможности модели исчерпаны и требуется подключение более мощной системы.

Perplexity Computer работает как агентная система, распределяющая задачи между несколькими ИИ-моделями. По данным Decrypt, продукт управляет более чем 19 моделями, а адаптированная GLM должна стать недорогой базой для большинства задач.

Следующим шагом Perplexity назвала дообучение Nemotron 3 Ultra — еще одной открытой модели, которую компания планирует адаптировать для Computer.

GLM 5.2 — открытая модель от Z.ai (ранее Zhipu AI). Она содержит около 744 миллиардов параметров и выпущена под лицензией MIT, что позволяет разработчикам свободно загружать, изменять и дообучать ее для коммерческих продуктов без ограничений, характерных для закрытых API. При этом Z.ai находится в американском списке экспортных ограничений (Entity List) с января 2025 года.

В Decrypt обратили внимание на геополитический контекст: Perplexity использует модель китайской компании, но размещает адаптированную версию в США на собственной инфраструктуре. Это снижает зависимость от внешнего API и позволяет компании контролировать этапы дообучения, маршрутизации и выполнения задач.

Ранее Perplexity применяла аналогичный подход с DeepSeek R1: в 2025 году компания выпустила адаптированную версию R1-1776, из которой, по заявлению разработчиков, были удалены отказы примерно по 300 темам, связанным с китайской цензурой. В случае с GLM 5.2 акцент делается не на политической нейтрализации, а на экономической эффективности для агентной системы. Цель — снизить стоимость работы без полного отказа от передовых моделей.

Напомним, в марте Perplexity представила Personal Computer как конкурента OpenClaw. Он работает круглосуточно и сохраняет «память» между сессиями.