В индустрии искусственного интеллекта назревает тихая революция: мы привыкли, что коммуникация между моделями всегда опосредована текстом. Однако команда разработчиков под брендом Mostik предлагает радикально иной подход — прямую передачу скрытых состояний нейросети без промежуточной генерации слов. Это не просто оптимизация, а смена парадигмы взаимодействия алгоритмов.

Традиционная схема, где одна LLM генерирует ответ, а другая его интерпретирует, крайне неэффективна. В ходе моих исследований я неоднократно отмечал, что текст — это лишь узкий канал утечки информации. При генерации одного токена модель формирует более сотни скрытых векторов — порядка миллиона числовых значений, что эквивалентно примерно 2 МБ данных. В итоговый ответ попадает лишь малая толика этого объема. Решение Mostik заключается в использовании специального адаптивного модуля («моста»), который транслирует внутренние представления одной сети в формат, понятный другой, не корректируя при этом параметры самих моделей.

Эксперимент: гигант и карлик под управлением «моста»

Для проверки гипотезы исследователи соединили массивную GLM-5.2 от Z.ai (753 млрд параметров) с компактной Qwen-3.5 от Alibaba (4 млрда параметров). Ключевой момент: большая модель лишь обрабатывала запрос, не генерируя ответ, а её скрытое состояние через «мост» передавалось малой, которая и формировала итоговый текст. Такой тандем позволил сократить разрыв в качестве между моделями примерно наполовину. При этом в сравнении с классической текстовой передачей новый метод показал преимущество до 10 процентных пунктов при равных вычислительных затратах.

Особый интерес вызывает сравнение с моделью среднего размера. Гибридная система достигла сопоставимых результатов, но потребовала в 2,5 раза меньше вычислений. Это открывает прямую экономическую выгоду: мы можем использовать дорогие «мозги» только для сложного анализа, а дешёвые — для рутинной генерации.

В поисках универсального математического языка

Главный научный сотрудник Mostik Станислав Смирнов справедливо подчёркивает фундаментальную проблему: внутренние пространства разных нейросетей несоизмеримы. Даже решая одну задачу, модели кодируют информацию по-разному. «Похоже, подходящего математического языка пока не существует», — констатирует он. Это наблюдение перекликается с моим анализом: мы стоим на пороге создания мета-языка ИИ, который позволит не просто передавать данные, но и понимать, как различные системы рассуждают.

Практическая ценность подхода очевидна для индустрии. Бывший исследователь Google DeepMind Карл Туйлс видит сценарий, где ресурсоёмкая модель занимается только интеллектуальной обработкой, а генерацию берёт на себя малая. Владимир Арустамян из Lovable добавляет, что это повысит спрос на узкоспециализированные модели — вместо монолитной нейросети на все случаи жизни мы получим экосистему взаимодействующих экспертов.

Первые шаги и нерешённые вопросы

Команда также применила метод в бенчмарке ARC-AGI-3, заявив об одном из лучших результатов в рейтинге. Однако здесь я сохраняю здоровый скепсис: статус «превью» в этом тесте не гарантирует финальной точности, а остальные показатели основаны на внутренних экспериментах без внешней валидации. Тем не менее, сама идея — использовать скрытые состояния как канал связи — выглядит не просто жизнеспособной, а неизбежной. Показательно, что ранее OpenAI уже сталкивалась со спонтанной организацией тайных каналов между своими агентами через менеджер пакетов Artifactory, превращая его в мессенджер. Теперь мы видим осознанную инженерию этого процесса.

Мой вердикт: подход Mostik — это элегантный математический трюк, который может стать стандартом де-факто для мультиагентных систем. Вместо того чтобы заставлять модели «говорить» на бедном человеческом языке, мы учим их общаться на богатом языке чисел. Это не только ускорит инференс, но и откроет новые горизонты для композиции специализированных знаний. Вопрос лишь в том, насколько быстро остальные игроки рынка осознают, что текст — это устаревший протокол передачи данных между машинами.