Лондонская компания Humanoid представила KinetIQ Ascend — новаторский подход к обучению гуманоидных роботов, основанный на методе проб и ошибок непосредственно в реальных производственных условиях. Разработчик утверждает, что технология способна довести точность манипуляций до 99,9% на скорости, сопоставимой с человеческой или даже превышающей её.

Как работает KinetIQ Ascend

KinetIQ Ascend расширяет возможности фреймворка KinetIQ, лежащего в основе роботов Humanoid. Ключевое отличие — использование обучения с подкреплением (reinforcement learning, RL). В отличие от пассивного копирования действий человека, система самостоятельно повторяет задачу, получает обратную связь об успехе или ошибке и на основе этого улучшает свои алгоритмы поведения.

Важно, что Humanoid запускает RL не только в симуляции, а в круглосуточном режиме на реальном оборудовании и в производственных сценариях. По моим данным, это первая опубликованная демонстрация сквозного RL на основе зрения для vision-language-action (VLA) моделей, обученных на реальной двурукой гуманоидной платформе в условиях развертывания. Это принципиально меняет подход к отработке навыков.

Почему ставка на RL оправдана

Ранее Humanoid, как и большинство конкурентов, обучала роботов через имитацию человеческих демонстраций. Однако у этого метода есть фундаментальное ограничение: модель, копирующая демонстрации, не способна превзойти демонстратора ни по скорости, ни по качеству и не учится на ошибках. По убеждению компании, последние проценты надежности и переход на сверхчеловеческую скорость требуют иного подхода. KinetIQ Ascend закрывает этот разрыв за счет непрерывной практики на реальных задачах, сравнивая процесс с масштабированием больших языковых моделей — чем дольше обучение, тем выше успешность.

Результаты тестирования

Humanoid провела тесты на трех производственных задачах. В первой — робот должен был брать стальные подшипниковые кольца из контейнера и размещать их на конвейере. После RL-обучения пропускная способность выросла на 42%, до 412 колец в час против 291 у базовой модели. Во второй задаче — передача предмета из контейнера человеку — пропускная способность увеличилась на 85%, средняя длительность эпизода снизилась на 35%, а успешность поднялась с 80% до 98%. В третьей — двуручный подъем контейнера со стола в произвольной ориентации — после нескольких дней обучения пропускная способность выросла с 122 до 279 контейнеров в час, средняя длительность эпизода сократилась с 22,9 до 12,8 секунды, а успешность поднялась с 77,6% до 98,9%.

Компания подчеркивает, что замеры проводились через параллельное A/B-сравнение с текущей базовой моделью, а не против старой базы. Это критически важно для реальных производственных сред, где результат может меняться из-за освещения, положения объектов или износа оборудования.

Экспертное мнение

Прорыв Humanoid — это не просто очередной шаг в робототехнике, а смена парадигмы. Переход от пассивного копирования к активному обучению с подкреплением на реальных задачах может стать тем самым катализатором, который выведет гуманоидных роботов из лабораторий на массовые заводы. Если компания сможет масштабировать этот подход, мы станем свидетелями резкого ускорения автоматизации в промышленности.