Alibaba выводит ИИ в физический мир: представлен стек моделей Qwen-Robot Suite для управления роботами

Китайский технологический гигант Alibaba совершил стратегический прорыв, анонсировав Qwen-Robot Suite — комплексный набор моделей искусственного интеллекта, предназначенных для управления роботами и решения задач в физической среде. Это не просто очередное обновление языковой модели, а полноценный шаг в сторону «воплощенного ИИ» (embodied AI), где алгоритмы учатся взаимодействовать с реальным миром, а не только с текстом и картинками.
Пакет включает три специализированные модели. Qwen-RobotNav отвечает за навигацию, Qwen-RobotManip — за манипуляции с объектами, а Qwen-RobotWorld представляет собой видеомодель мира, способную прогнозировать развитие сцены на основе текстовых команд. В Alibaba прямо называют этот набор «полным стеком для воплощенного интеллекта». На данный момент пилотные испытания проходят у отдельных корпоративных клиентов Alibaba Cloud в сфере робототехники.
Почему языковых моделей недостаточно для роботов
Ключевая проблема, которую решает Qwen-Robot Suite, — разрыв между цифровым восприятием и физическим действием. Современные LLM отлично справляются с текстами, изображениями и видео, но роботу необходимо не просто понять команду, а перевести её в точное движение, учесть трение, гравитацию, ограничения сенсоров и пространственные свойства объектов. Alibaba называет это направление physical AI, подчеркивая, что модель должна работать с «цифрой» и «физикой» одновременно.
Qwen-RobotNav: универсальный навигатор на базе Qwen3-VL
Модель объединяет пять ключевых задач навигации в одном алгоритме: следование инструкциям, движение к заданной точке, поиск объектов, отслеживание цели и автономное вождение. Она построена на архитектуре Qwen3-VL и обучена на 15,6 миллиона образцов, связанных с планированием маршрутов и визуально-языковым рассуждением. Результаты впечатляют: 76,5% успешности на бенчмарке VLN-CE RxR и 90% на EVT-Bench. В практических сценариях робот может найти потерянный предмет в офисе или проверить, открыта ли дверь в здании, собирая визуальные доказательства и возвращая ответ пользователю.
Qwen-RobotManip: унификация физических действий
Одна из главных головных болей робототехники — несовместимость форматов команд между разными типами устройств. Манипулятор, двуручная платформа и мобильный робот «говорят» на разных языках координат и суставов. Qwen-RobotManip решает эту задачу, приводя данные к общему представлению. Для обучения было использовано более 38 100 часов данных, включая 11 320 часов открытых робототехнических записей и 24 808 часов синтетических демонстраций. Модель уже заняла первое место в RoboChallenge Table30 v1, продемонстрировав устойчивость к незнакомым объектам и переносу навыков между роботами.
Qwen-RobotWorld: предсказание физики
Эта модель — настоящий прорыв в области симуляции. Qwen-RobotWorld генерирует вероятное будущее состояние среды на основе текущего наблюдения и текстовой команды. Она обучена на корпусе Embodied World Knowledge, который включает 8,6 млн пар «видео-текст» и более 200 млн кадров, охватывающих 20 типов роботических платформ. Модель заняла первое место в EWMBench и DreamGen Bench, а также превзошла все открытые аналоги в WorldModelBench. Важно, что она демонстрирует высокую согласованность с базовыми физическими законами — движением, сохранением массы и гравитацией.
Экспертное мнение
Alibaba сделала мощный задел, но важно понимать: Qwen-Robot Suite — это пока набор инструментов для разработчиков, а не готовый потребительский продукт. Реальные сценарии внедрения сталкиваются с шумом сенсоров, износом приводов и бесчисленными редкими ситуациями, которые сложно смоделировать. Тем не менее, унификация навигации, манипуляции и прогнозирования мира в одном стеке — это именно то, чего не хватало индустрии для перехода от лабораторных демонстраций к коммерческим роботам. Если Alibaba сможет масштабировать эту технологию и снизить порог входа для разработчиков, мы станем свидетелями качественного скачка в развитии физического ИИ.