Alibaba выводит ИИ в физический мир: представлен стек моделей Qwen-Robot Suite для управления роботами

Alibaba официально представила Qwen-Robot Suite — комплексный набор фундаментальных ИИ-моделей, предназначенных для решения задач в физической среде. В пакет вошли три специализированные модели: Qwen-RobotNav для навигации, Qwen-RobotManip для манипуляции объектами и Qwen-RobotWorld для прогнозирования развития сцены. Разработчики позиционируют этот проект как «полный стек для воплощенного искусственного интеллекта» (embodied AI). Речь идет о программных моделях, которые позволяют физическим агентам — роботам — воспринимать окружающее пространство, планировать действия и выполнять команды, отданные на естественном языке. На данный момент Qwen-Robot Suite проходит пилотные испытания у избранных корпоративных клиентов Alibaba Cloud в сфере робототехники.
Зачем Alibaba выводит Qwen в физический мир
Современные большие языковые и мультимодальные модели блестяще справляются с текстом, изображениями и видео, но для роботов этого категорически недостаточно. Физическим агентам требуется не просто понимать команду, но и трансформировать ее в точное движение, учитывая пространственные ограничения, свойства объектов, шумы сенсоров и последствия каждого действия. Alibaba называет это направлением physical AI, или «воплощенного ИИ», где модель оперирует не только цифровыми данными, но и реальной физической средой.
Qwen-RobotNav: пять задач навигации в одной модели
Модель Qwen-RobotNav, построенная на базе Qwen3-VL и обученная на 15,6 миллиона образцов, объединяет пять ключевых навигационных задач: следование инструкциям, движение к заданной точке, поиск объектов, отслеживание цели и автономное вождение. Результаты впечатляют: 76,5% успешности на бенчмарке VLN-CE RxR и 90% на EVT-Bench. Ключевая особенность — модель может выступать в роли исполнительного инструмента для более крупных агентных систем, где верхнеуровневая модель планирует задачу, а Qwen-RobotNav отвечает за физическое перемещение. В демонстрациях показаны сценарии поиска потерянного предмета в помещении или проверки состояния конкретного объекта, где робот не просто движется, а собирает визуальные доказательства.
Qwen-RobotManip: действия с объектами и перенос навыков
Qwen-RobotManip решает одну из фундаментальных проблем робототехники — несовместимость форматов команд между различными типами устройств (манипулятор, двуручная платформа, мобильная система). Модель приводит данные к общему представлению, позволяя переносить навыки, полученные на одном типе робота, на другой. Для обучения было использовано более 38 100 часов данных, включая 11 320 часов открытых робототехнических данных, 1933 часа видео действий человека и 24 808 часов синтетических демонстраций. Модель заняла первое место в RoboChallenge Table30 v1 и продемонстрировала устойчивость к новым инструкциям и незнакомым объектам.
Qwen-RobotWorld: видеомодель мира для прогнозирования
Qwen-RobotWorld представляет собой видеомодель мира, управляемую естественным языком. Получив текущее наблюдение и текстовую команду, она генерирует вероятное будущее состояние среды. Корпус Embodied World Knowledge, собранный для обучения, включает 8,6 млн пар «видео-текст» и более 200 млн кадров, охватывающих 20 типов роботических платформ и 500 категорий действий. Модель заняла первые места в EWMBench и DreamGen Bench, превзойдя все открытые аналоги в WorldModelBench и PBench. Разработчики утверждают, что модель демонстрирует высокую согласованность с базовыми физическими закономерностями — движением, сохранением массы и гравитацией.
До массовых роботов еще далеко
Несмотря на впечатляющие заявленные показатели, Qwen-Robot Suite остается набором исследовательских моделей, а не готовой потребительской платформой. Реальное внедрение сталкивается с шумом сенсоров, износом приводов и огромным количеством редких сценариев, которые невозможно смоделировать в бенчмарках. Alibaba пока не раскрыла стоимость доступа, сроки публичного запуска или конкретный список клиентов, тестирующих систему.
Мнение эксперта: Alibaba делает стратегически верный шаг, объединяя навигацию, манипуляцию и прогнозирование в единый стек. Однако рынок видел много многообещающих робототехнических платформ, которые так и не вышли из лабораторий. Ключевым фактором успеха станет не столько точность на бенчмарках, сколько способность моделей адаптироваться к реальному хаосу физического мира. Пока что это сильный сигнал для индустрии, но не революция.