Alibaba внедряет ИИ в физический мир: представлен стек моделей Qwen-Robot Suite для управления роботами

Китайский технологический гигант Alibaba сделал значительный шаг в сторону «воплощенного искусственного интеллекта» (Embodied AI), представив набор фундаментальных моделей Qwen-Robot Suite. Этот комплекс из трех специализированных моделей предназначен для решения ключевых задач, стоящих перед физическими роботами: навигация, манипуляция объектами и прогнозирование развития сцены. Речь идет не о готовом роботе, а о программном «мозге», который, по замыслу разработчиков, должен стать универсальным инструментом для управления различными типами механизмов.
Крупные языковые модели (LLM) уже доказали свою эффективность в работе с текстом, изображениями и видео. Однако для роботов этого недостаточно. Им требуется не просто понимать команду на естественном языке, но и переводить её в последовательность физических действий, учитывая геометрию пространства, свойства объектов и ограничения собственных датчиков. Именно эту проблему и призван решить Qwen-Robot Suite, объединив восприятие, планирование и исполнение в едином стеке.
Qwen-RobotNav: универсальный навигатор
Первая модель из набора, Qwen-RobotNav, сфокусирована на передвижении. Она объединяет в себе пять различных навигационных задач: следование инструкциям, движение к заданной точке, поиск объектов, отслеживание цели и элементы автономного вождения. Построенная на базе мультимодальной модели Qwen3-VL, она была обучена на 15,6 миллиона образцов данных, связанных с планированием маршрутов и визуально-языковыми рассуждениями.
Результаты тестирования впечатляют: модель демонстрирует 76,5% успешности на бенчмарке VLN-CE RxR и 90% на EVT-Bench. Alibaba позиционирует Qwen-RobotNav не как изолированное решение, а как исполнительный модуль для более крупных агентных систем, где верхнеуровневая модель ставит задачу, а навигатор отвечает за её физическую реализацию.
Qwen-RobotManip: мастер манипуляций
Вторая модель, Qwen-RobotManip, отвечает за взаимодействие с объектами: захват, перемещение и размещение предметов. Ключевая инновация здесь — попытка решить проблему гетерогенности робототехнических платформ. Разные роботы (манипуляторы, двуручные системы, мобильные платформы) используют различные системы координат и форматы команд. Qwen-RobotManip стремится создать универсальное представление действий, позволяя переносить навыки, полученные на одном типе робота, на другой.
Для обучения модели был собран колоссальный объем данных — более 38 100 часов, включающий как открытые робототехнические наборы, так и видео действий человека. Это позволило Qwen-RobotManip занять первое место в престижном бенчмарке RoboChallenge Table30 v1 и продемонстрировать устойчивость к новым, незнакомым инструкциям и объектам.
Qwen-RobotWorld: предсказатель будущего
Третья модель, Qwen-RobotWorld, представляет собой «видеомодель мира», управляемую языком. Она анализирует текущее состояние среды и текстовую команду, а затем генерирует видео, прогнозирующее, как будет развиваться сцена после выполнения действия. Такой подход критически важен для планирования сложных манипуляций, автономного вождения и создания синтетических данных для обучения роботов без риска поломок в реальном мире.
Корпус данных для Qwen-RobotWorld, названный Embodied World Knowledge, включает 8,6 миллионов пар «видео-текст» и более 200 миллионов кадров, охватывающих свыше 20 типов роботов и 500 категорий действий. Модель уже заняла первые места в бенчмарках EWMBench и DreamGen Bench, а также превзошла все открытые аналоги в WorldModelBench и PBench.
Аналитический вывод
Несмотря на впечатляющие заявления и высокие показатели в бенчмарках, Qwen-Robot Suite остается набором исследовательских моделей, а не готовым коммерческим продуктом. Реальные условия эксплуатации роботов полны «шума», износа и непредвиденных ситуаций, которые сложно смоделировать. Тем не менее, сам подход Alibaba к созданию «полного стека» для воплощенного ИИ является крайне перспективным. Если компании удастся интегрировать эти модели в реальные производственные и сервисные сценарии, мы станем свидетелями качественного скачка в развитии робототехники. Однако до массового внедрения и публичного доступа, судя по отсутствию конкретных сроков и цен, остается еще как минимум несколько лет интенсивных испытаний.