Alibaba выводит Qwen в физический мир: представлен набор ИИ-моделей для управления роботами

Китайский технологический гигант Alibaba сделал важный шаг в направлении так называемого «воплощенного искусственного интеллекта» (Embodied AI), представив Qwen-Robot Suite. Это не просто очередная языковая модель, а полноценный программный стек из трех специализированных фундаментальных моделей, предназначенных для того, чтобы наделить роботов способностью воспринимать, планировать и действовать в физическом мире. Речь идет о Qwen-RobotNav для навигации, Qwen-RobotManip для манипуляции объектами и Qwen-RobotWorld — модели мира, прогнозирующей последствия действий.
Ключевое отличие этого подхода от традиционных LLM в том, что физическим агентам недостаточно просто понимать текст или изображение. Им нужно преобразовывать команду на естественном языке в точные движения, учитывать трехмерное пространство, физику объектов и ограничения собственных сенсоров. Alibaba Cloud уже запустила пилотные испытания этого набора у корпоративных клиентов в сфере робототехники.
Qwen-RobotNav: универсальный навигатор
Модель Qwen-RobotNav, построенная на базе Qwen3-VL, решает пять ключевых задач навигации в рамках одной архитектуры: следование инструкциям, движение к цели, поиск объектов, отслеживание цели и автономное вождение. Обученная на 15,6 миллионах образцов, она демонстрирует впечатляющие результаты: 76,5% успешности на бенчмарке VLN-CE RxR и 90% на EVT-Bench. По сути, это «мозг» для перемещения, который может быть интегрирован в более крупные агентные системы, где верхнеуровневая модель ставит задачу, а Qwen-RobotNav отвечает за её физическую реализацию.
Qwen-RobotManip: мастерство взаимодействия
Вторая модель, Qwen-RobotManip, фокусируется на физическом взаимодействии с объектами — захвате, перемещении и размещении. Главная инновация здесь — попытка решить проблему несовместимости данных от разных типов роботов (манипуляторы, двуручные платформы, мобильные системы). Модель учится на огромном массиве данных, превышающем 38 100 часов, включая видео действий человека от первого лица. Результат — первое место в треке универсальных моделей RoboChallenge Table30 v1 и, что более важно, устойчивость к новым инструкциям и перенос навыков между различными роботизированными платформами.
Qwen-RobotWorld: предсказание будущего
Qwen-RobotWorld представляет собой видеомодель мира, управляемую текстом. Она получает текущее наблюдение и команду, а затем генерирует вероятное видео того, как изменится среда. Это критически важно для планирования сложных действий и создания синтетических данных для обучения. Корпус Embodied World Knowledge, на котором обучалась модель, включает 8,6 млн пар «видео-текст» и охватывает более 500 категорий действий. Модель уже заняла первые места в бенчмарках EWMBench и DreamGen Bench, а также, по заявлениям разработчиков, демонстрирует высокую согласованность с базовыми физическими законами.
Аналитический комментарий: Безусловно, Qwen-Robot Suite — это мощная заявка на лидерство в сегменте Physical AI. Однако не стоит обольщаться: от лабораторных бенчмарков до реальной работы на складе или в доме — дистанция огромного размера. Шум сенсоров, износ механики и миллионы редких сценариев остаются серьёзными препятствиями. Alibaba пока не раскрыла ни стоимость доступа, ни сроки публичного запуска, что говорит о том, что до массового внедрения «умных» роботов на базе Qwen ещё далеко. Тем не менее, сам факт появления такого «стека» от одного из крупнейших облачных провайдеров мира задаёт новый вектор развития всей индустрии.