Alibaba выводит Qwen в физический мир: представлен стек ИИ-моделей для управления роботами

Китайский технологический гигант Alibaba совершил стратегический прорыв в области робототехники, представив Qwen-Robot Suite — комплексный набор фундаментальных моделей искусственного интеллекта, предназначенных для управления физическими агентами. Этот шаг знаменует собой переход от чисто цифровых LLM к так называемому «воплощенному интеллекту» (embodied AI), где ИИ учится взаимодействовать с реальным миром.
Пакет включает три ключевые модели: Qwen-RobotNav для навигации, Qwen-RobotManip для манипуляции объектами и Qwen-RobotWorld для прогнозирования развития сцены. В отличие от традиционных языковых моделей, которые оперируют текстом и изображениями, эти системы должны воспринимать пространство, планировать траектории и выполнять команды на естественном языке в реальных условиях. Уже сейчас Suite проходит пилотные испытания у корпоративных клиентов Alibaba Cloud в сфере робототехники.
Пять задач навигации в одной модели
Модель Qwen-RobotNav, построенная на базе Qwen3-VL, решает целый спектр задач: от следования инструкциям и движения к заданной точке до поиска объектов, отслеживания целей и автономного вождения. Она обучена на 15,6 миллиона образцов, связанных с визуально-языковым рассуждением. Показатели впечатляют: 76,5% успешности на бенчмарке VLN-CE RxR и 90% на EVT-Bench. Это позволяет использовать модель как «двигатель» для более крупных агентных систем, где верхнеуровневый планировщик ставит задачу, а Qwen-RobotNav отвечает за физическое перемещение.
Универсальный манипулятор и модель мира
Qwen-RobotManip решает одну из самых сложных проблем робототехники — гетерогенность данных. Разные роботы (манипуляторы, двуручные платформы, мобильные системы) используют различные системы координат и форматы команд. Модель приводит эти данные к общему представлению, обучаясь на более чем 38 100 часах данных, включая 11 320 часов открытых роботических данных и 24 808 часов синтетических демонстраций. Результат — первое место в RoboChallenge Table30 v1 и устойчивость к новым инструкциям и незнакомым объектам.
Qwen-RobotWorld — это видеомодель мира, управляемая естественным языком. Она прогнозирует, как изменится сцена после заданного действия, что критически важно для планирования и создания синтетических обучающих данных. Корпус Embodied World Knowledge включает 8,6 млн пар «видео-текст» и более 200 млн кадров, охватывающих 20 типов роботических платформ. Модель заняла первые места в EWMBench и DreamGen Bench, продемонстрировав высокую согласованность с физическими законами, включая гравитацию и сохранение массы.
Мой анализ: Alibaba делает ставку на создание универсального «мозга» для роботов, что является логичным продолжением гонки LLM. Однако путь от впечатляющих бенчмарков до массового внедрения в реальном мире с его шумом сенсоров и редкими сценариями остается крайне сложным. Пока это скорее мощный инструмент для разработчиков, а не готовый продукт для потребителя.