sejournal.io

DeepSeek начал разработку собственного ИИ-чипа

1783521907417 956832 scaled

Вот перефразированная новость на русском языке:

Китайский стартап в сфере ИИ DeepSeek начал разработку собственного процессора для своих моделей. Об этом сообщает Reuters со ссылкой на источники. По их данным, работа над чипом ведется уже около года.

Уточняется, что процессор предназначен для инференса — этапа использования нейросети после ее обучения, а не для самого обучения. Пока проект находится на начальной стадии: компания ведет переговоры с внешними партнерами по дизайну чипов, контрактному производству и памяти.

В последние месяцы DeepSeek в закрытом режиме нанимает инженеров по проектированию чипов. На запрос Reuters о комментарии в компании не ответили.

Создание собственного «железа» может снизить зависимость от Nvidia и Huawei. Ранее стартап использовал их решения: базовая модель для R1 обучалась на Nvidia H800, адаптированном для китайского рынка. Позже компания активнее применяла чипы Huawei. В апреле DeepSeek представила модель V4, оптимизированную для процессоров Ascend. В Huawei подтвердили, что их процессоры использовались при обучении части V4-Flash.

Попытка создать собственное оборудование происходит на фоне экспортных ограничений со стороны США и растущего спроса на решения для инференса. Основатель DeepSeek Лян Вэньфэн еще в 2024 году называл экспортный контроль над чиками серьезной проблемой для компании.

Сейчас в гонке за создание собственной ИИ-инфраструктуры лидируют OpenAI, Broadcom, Anthropic, Alibaba и Baidu. В Reuters отметили, что успех проекта DeepSeek не гарантирован из-за высокой конкуренции, значительных финансовых затрат и ограниченного доступа к передовым зарубежным фабрикам.

Напомним, в мае стало известно, что DeepSeek формирует новую команду для разработки Code Harness — инструмента для автономного программирования. Он станет прямым конкурентом Claude Code от Anthropic и Codex от OpenAI.

Скандал с ИИ-моделью Рио: чужой код под видом своей разработки

1781602762927 712869 scaled

Вот перефразированная версия новости на русском языке:

Муниципальная IT-компания Рио-де-Жанейро IplanRIO представила открытую ИИ-модель Rio 3.5 Open 397B, обученную на государственные деньги. Заявлялось, что она превосходит DeepSeek V4 Pro и Qwen 3.7 Plus по ряду тестов. Однако на следующий же день компания-разработчик ИИ Nex заявила, что эта модель является прямым слиянием их собственной Nex-N2-Pro и Qwen3.5-397B-A17B.

После этих обвинений IplanRIO обновила описание модели на Hugging Face. Теперь там указано, что Rio 3.5 создана путем слияния Nex-N2-Pro и Qwen3.5-397B-A17B с последующей дистилляцией от более мощной модели.

Как представляли Rio 3.5

IplanRIO выложила Rio 3.5 Open 397B на Hugging Face 13 июня 2026 года под лицензией MIT. Изначально проект называли ИИ-системой общего назначения «передового уровня» и утверждали, что модель дообучена на базе Qwen3.5-397B-A17B.

В характеристиках указывалось 397 млрд параметров, из которых 17 млрд активируются при обработке каждого токена (архитектура Mixture-of-Experts). Также заявлялось контекстное окно на 1,01 млн токенов и использование фреймворка SwiReasoning.

В первой версии описания приводились результаты тестов, по которым Rio 3.5 обходила Qwen 3.7 Plus и DeepSeek V4 Pro. Например, на Terminal-Bench 2.1 модель набрала 70,8% против 70,3% у Qwen и 67,9% у DeepSeek.

После релиза мэр Рио-де-Жанейро Эдуардо Кавальери написал в X, что открытая ИИ-модель, обученная в Рио на государственные средства, «превзошла все остальные модели».

Что заявила Nex

14 июня Nex опубликовала обращение в своем репозитории на GitHub. Компания заявила, что Rio 3.5 Open 397B представлена как оригинальная модель IplanRIO, но ее веса выглядят как прямое поэлементное слияние Nex-N2-Pro и Qwen3.5-397B-A17B.

По оценке Nex, Rio 3.5 примерно на 60% состоит из Nex-N2-Pro и на 40% из Qwen3.5-397B-A17B. Компания утверждает, что не нашла признаков самостоятельного обучения IplanRIO.

Nex привела два аргумента: после удаления системного промпта «You are Rio» модель называла себя «Nex, from Nex-AGI» в 79% ответов, и каждый тензор весов Rio повторяет пропорцию 0,6/0,4 между Nex и Qwen во всех 60 слоях модели.

«Невинного объяснения этому нет», — говорится в заявлении Nex.

В отдельном посте компания сформулировала претензию проще: Rio 3.5, по сути, является open-source-моделью Nex N2 Pro «в другой обертке».

Почему бенчмарки вызвали вопросы

Decrypt обратил внимание, что Nex-N2-Pro в собственных тестах показывает более высокие результаты, чем Rio 3.5 в первоначальной карточке. В описании Nex-N2-Pro указано 75,3% на Terminal-Bench 2.1 против 70,8% у Rio 3.5. Как отметило издание, если Rio действительно является смесью моделей, то ее более слабые результаты выглядят ожидаемо. Сами бенчмарки Rio 3.5 убрали из основного описания после обновления карточки.

Как ответила IplanRIO

После претензий IplanRIO изменила README модели на Hugging Face. В актуальной версии указано, что Rio 3.5 Open 397B построена через слияние Nex-N2-Pro и Qwen3.5-397B-A17B, а затем прошла дистилляцию.

Дистилляция — метод обучения, при котором одна модель перенимает поведение более сильной модели. IplanRIO утверждает, что должна была опубликовать не базовую версию, а финальную дистиллированную модель.

«Мы сожалеем о путанице и приносим извинения», — говорится в обновленном README.

Команда также сообщила, что работает над повторной загрузкой корректной модели. Отдельного развернутого публичного комментария IplanRIO на момент публикации не было.

В чем суть спора

Использование открытых моделей само по себе не является нарушением. Nex-N2-Pro опубликована под лицензией Apache 2.0, а Qwen3.5-397B-A17B также доступна как открытая модель.

Спор возник из-за презентации Rio 3.5. Первоначальная карточка создавала впечатление самостоятельной разработки и дообучения на базе Qwen3.5-397B-A17B, но не указывала Nex-N2-Pro как один из источников. В open-source-сообществе это воспринимают как проблему прозрачности.

Ранее Alibaba представила семейство «гибридных» ИИ-моделей Qwen3, а китайский стартап DeepSeek представил DeepSeek-R1 в январе 2025 года.

Вот краткий заголовок для этой новости на русском языке: DeepSeek создает конкурента Claude Code и OpenAI Codex

1779443506323 685843 scaled

Китайский стартап в сфере искусственного интеллекта DeepSeek создает новую команду для разработки инструмента автономного программирования под названием Code Harness. Об этом рассказал инженер компании Дели Чен.

В социальных сетях он опубликовал две вакансии: менеджера по продукту и инженера-исследователя. Обе должности предполагают работу в Пекине.

Новый продукт составит конкуренцию Claude Code от Anthropic и Codex от OpenAI.

Как отметил Чен, команда будет разрабатывать Code Harness «с нуля». Он назвал проект «DeepSeek Code или чем-то подобным».

В описании вакансий компания использует формулу: «модель + harness = агент».

Под термином harness подразумевается надстройка над большой языковой моделью (LLM), отвечающая за управление контекстом, планирование действий, память, вызов инструментов, работу с файлами, терминалом, тестами и обратной связью.

DeepSeek планирует создать не просто помощника для написания кода, а агентный продукт, способный выполнять многошаговые задачи в среде разработки.

От соискателей требуется опыт работы с Claude Code, Codex, Cursor, GitHub Copilot, Manus и OpenClaw. Также необходимы знания агентных циклов, протокола MCP, многоагентных систем, управления контекстом и вайб-кодинга.

Новая команда будет тесно сотрудничать с исследователями DeepSeek.

DeepSeek V4 уже поддерживает интеграцию с Claude Code через API, совместимый с Anthropic. Версия V4 Flash, выпущенная 24 апреля, стоит $0,14 за 1 млн входных токенов. Для сравнения, у Claude Opus 4.7 цена составляет $15 за тот же объем.

Напомним, в феврале Anthropic обвинила три китайских ИИ-стартапа — DeepSeek, Moonshot и MiniMax — в масштабном использовании Claude для улучшения своих моделей.

Китай разрешил DeepSeek и IT-гигантам закупить чипы Nvidia H200

1769782867324 3250700 scaled

Китайские власти разрешили ведущему ИИ-стартапу DeepSeek приобрести высокопроизводительные чипы H200 от компании Nvidia. Соответствующая информация поступила от агентства Reuters со ссылкой на информированные источники.

Кроме DeepSeek, одобрение на закупку получили и другие технологические гиганты — ByteDance, Alibaba и Tencent. В общей сложности эти компании смогут импортировать более 400 000 микросхем.

При этом генеральный директор Nvidia Дженсен Хуанг заявил, что ему не известно о финальном решении. По его словам, китайские регуляторы всё ещё завершают оформление лицензионных условий. Хуанг выразил надежду, что правительство КНР даст добро на продажу чипов.

Как сообщает Reuters, Министерство промышленности и информатизации Китая согласовало импорт при выполнении определённых требований, которые в настоящее время прорабатываются под руководством Национальной комиссии по развитию и реформам.

Ранее, в январе, администрация президента США Дональда Трампа официально разрешила экспорт в Китай чипов H200 — вторых по мощности в линейке Nvidia. Однако китайская сторона дала понять, что будет одобрять такие закупки лишь в особых случаях, например, для университетских исследований.

Согласно американским правилам, перед поставкой чипы должны быть проверены независимой лабораторией на предмет их возможностей в сфере искусственного интеллекта. Также объём поставок в КНР не может превышать 50% от общего числа чипов, продаваемых клиентам в США.

Nvidia обязана подтвердить наличие достаточных запасов H200 для американского рынка, а китайские покупатели — предоставить гарантии безопасности и обязательство не использовать чипы в военных целях.

Напомним, что в декабре 2025 года Nvidia представила технологию для отслеживания местоположения своих процессоров.