Больше не нужно искать — необходимые
обучающие материалы и подсказки всегда под рукой

Вот перефразированная новость на русском языке:
В ходе технического эксперимента компании Nvidia точность модели Cosmos 3 Nano в тесте с выбором правильного ответа из четырёх вариантов выросла с 54,41% до 93,35% менее чем за сутки. Основные этапы дообучения выполнил ИИ-агент Codex, действовавший по заранее подготовленным инструкциям с использованием инструментария TAO.
Результат был получен на специализированном наборе данных Woven Traffic Safety от компании Woven by Toyota. Этот датасет содержит видеозаписи дорожных ситуаций и вопросы с четырьмя вариантами ответов. Для обучения и проверки модели использовалось более 8000 примеров.
Без дополнительной адаптации модель Cosmos 3 Nano правильно отвечала на 54,41% вопросов. Затем разработчики поручили агенту Codex оценить базовую модель и провести её дообучение с помощью метода LoRA.
Агент выбрал подходящую инструкцию Cosmos-reason, проверил аннотации датасета и обнаружил, что отсутствует параметр частоты кадров. После исправления конфигурации он загрузил веса модели, подготовил настройки и запустил обучающий контейнер.
Метод LoRA не изменяет все параметры модели, а обучает лишь небольшие дополнительные адаптеры. По расчётам Nvidia, в этом эксперименте такой подход потребовал примерно в семь раз меньше графического процессорного времени, чем полное дообучение Cosmos 3 Nano.
Один цикл обучения с помощью LoRA занял около 30 минут на восьми ускорителях NVIDIA A100 с 80 ГБ памяти. Точность модели после этого выросла до 87,14%.
Вторым запросом разработчики запустили инструмент TAO AutoML для подбора оптимальной скорости обучения, размера пакета, параметров LoRA и других настроек. Система провела 43 параллельных испытания. Лучший результат, полученный с помощью байесовской оптимизации, составил 93,35%. Этот этап занял 19,5 часа на нескольких узлах A100 в облачной инфраструктуре Oracle.
В ходе эксперимента агент Codex не ограничивался анализом результатов. Он выбирал рабочий процесс, проверял данные, исправлял конфигурацию, запускал контейнеры и сравнивал показатели. При этом автономность агента оставалась ограниченной — он действовал строго по заранее подготовленным инструкциям.
Показатель 93,35% отражает точность ответов на проверочной части одного исследовательского датасета. Он не оценивает безопасность автономного вождения и не подтверждает способность модели принимать решения в реальном времени.
Напомним, что в июне исследователи Nvidia, Университета Карнеги-Меллона и Калифорнийского университета в Беркли представили фреймворк ENPIRE, который позволяет ИИ-агентам для программирования улучшать алгоритмы управления роботами на реальном оборудовании.
Популярные лонгриды: