Новости криптомира

17.06.2026
11:33

Alibaba выводит ИИ в физический мир: представлен стек моделей Qwen-Robot Suite для управления роботами

Tool_AI

Alibaba Cloud совершила значительный шаг в развитии физического искусственного интеллекта (Physical AI), представив Qwen-Robot Suite. Это не просто очередная языковая модель, а полноценный стек из трех специализированных моделей, каждая из которых решает конкретную задачу робототехники: навигацию, манипуляцию объектами и прогнозирование физических сцен. Команда Qwen называет этот проект «полным стеком для воплощенного интеллекта».

Суть прорыва в том, что большие языковые модели (LLM) уже отлично работают с текстом, изображениями и видео, но для взаимодействия с реальным миром этого недостаточно. Роботам необходимо не просто понимать команду на естественном языке, но и переводить ее в физическое действие: двигаться, хватать, учитывать гравитацию и свойства объектов. Qwen-Robot Suite призван закрыть этот разрыв между цифровым и физическим.

Qwen-RobotNav: Универсальный навигатор

Первая модель из стека, Qwen-RobotNav, построена на базе Qwen3-VL и представляет собой универсальный решатель для пяти типов навигационных задач: следование инструкциям, движение к точке, поиск объектов, отслеживание цели и автономное вождение. Модель обучена на 15,6 миллиона образцов, связанных с визуально-языковым рассуждением.

Результаты впечатляют: 76,5% успешности на сложном бенчмарке VLN-CE RxR и 90% на EVT-Bench. В реальных сценариях это означает, что робот может не просто перемещаться, а, например, найти потерянный предмет в офисе и предоставить визуальное доказательство пользователю. Qwen-RobotNav может работать как исполнительный модуль для более крупных агентных систем, где верхнеуровневая модель планирует задачу, а эта модель отвечает за перемещение.

Qwen-RobotManip: Мастер манипуляции

Вторая модель, Qwen-RobotManip, решает одну из ключевых проблем робототехники — гетерогенность оборудования. Разные роботы (манипуляторы, двуручные платформы, мобильные системы) используют разные системы координат и форматы команд. Qwen-RobotManip пытается создать единое представление, позволяя переносить навыки между различными типами роботов.

Для обучения было использовано более 38 100 часов данных, включая 11 320 часов открытых робототехнических данных, 1933 часа видео действий человека и 24 808 часов синтетических демонстраций. Модель уже заняла первое место в RoboChallenge Table30 v1 и демонстрирует устойчивость к новым инструкциям и незнакомым объектам.

Qwen-RobotWorld: Предсказатель будущего

Третья модель, Qwen-RobotWorld, — это видеомодель мира, управляемая текстом. Она получает текущее наблюдение и команду, а затем генерирует вероятное будущее состояние среды. Это критически важно для планирования действий и создания синтетических данных для обучения.

Корпус Embodied World Knowledge, на котором обучалась модель, включает 8,6 млн пар «видео-текст» и более 200 млн кадров, охватывающих 20 типов роботов и 500 категорий действий. Qwen-RobotWorld уже заняла первые места в бенчмарках EWMBench и DreamGen Bench, а также превзошла все открытые модели в WorldModelBench и PBench, демонстрируя высокое понимание физики (движение, гравитация, жидкости).

Мой анализ: Qwen-Robot Suite — это стратегически верный шаг. Alibaba не пытается создать игрушечного робота, а строит фундаментальную платформу для будущего. Однако до массового внедрения еще далеко. Реальные условия полны шума, износа и нестандартных ситуаций, которые симуляторы не учитывают. Тем не менее, именно такие «стеки» — ключ к будущему, где ИИ не просто болтает, а действует.