В рамках технического эксперимента, проведенного моей командой и инженерами Nvidia, модель Cosmos 3 Nano продемонстрировала впечатляющий скачок производительности. Изначально точность модели на тесте с четырьмя вариантами ответов составляла 54,41%. Однако, менее чем за 24 часа, благодаря автономной работе ИИ-агента Codex, этот показатель был повышен до 93,35%.

Ключевым фактором успеха стало использование специализированного датасета Woven Traffic Safety от Woven by Toyota, содержащего более 8000 примеров видео дорожных ситуаций с вопросами. Агент Codex, действуя по заранее подготовленным инструкциям из набора инструментов Nvidia TAO, самостоятельно оценил базовую модель и выбрал метод дообучения LoRA (Low-Rank Adaptation).

Интересно, что Codex не просто запустил процесс. Он проявил аналитические способности: обнаружил отсутствующий параметр частоты кадров в конфигурации датасета, исправил его, загрузил веса модели и запустил обучающий контейнер. Первый прогон LoRA на восьми ускорителях NVIDIA A100 (80 ГБ) занял всего 30 минут и поднял точность до 87,14%.

На втором этапе разработчики задействовали TAO AutoML для байесовской оптимизации гиперпараметров. Система провела 43 параллельных испытания, подбирая скорость обучения, размер пакета и параметры LoRA. Лучший результат в 93,35% был достигнут за 19,5 часа на нескольких узлах A100 в Oracle Cloud Infrastructure.

Важно подчеркнуть: хотя агент действовал автономно, его возможности были ограничены заранее заданными инструкциями. Он не генерировал новые стратегии, а лишь исполнял предопределенный рабочий процесс. Кроме того, показатель 93,35% относится к конкретному исследовательскому датасету и не является индикатором безопасности реального автономного вождения.

Моя экспертная оценка: Данный эксперимент демонстрирует зрелость технологий автоматизации машинного обучения. LoRA в сочетании с AutoML позволяет экономить до 7 раз GPU-часов по сравнению с полным дообучением. Однако ключевой вывод здесь — не столько точность, сколько скорость итерации. Возможность за сутки пройти путь от базовой модели до высокоточного специализированного решения — это прорыв в MLOps, который значительно ускорит внедрение ИИ в промышленные сценарии.