Архитектура современных больших языковых моделей (LLM) предполагает, что при совместной работе нейросети общаются исключительно через генерацию текста. Это колоссальное узкое место: в процессе обработки запроса модель формирует более сотни скрытых векторов — порядка миллиона числовых значений, что эквивалентно примерно 2 МБ внутреннего состояния. В финальный текстовый ответ попадает лишь ничтожная доля этой информации. Команда стартапа Mostik предложила элегантное решение этой проблемы, создав отдельный адаптируемый модуль-«мост», который транслирует внутренние представления одной модели напрямую в вычислительное пространство другой, минуя этап вербализации.

Ключевая особенность подхода — полная статичность параметров взаимодействующих нейросетей. Корректировке подвергается исключительно промежуточный модуль, который учится сопоставлять латентные пространства разных архитектур. Это открывает возможности для создания гибридных систем без дорогостоящего дообучения.

Эксперимент: союз гиганта и малютки

Для верификации метода исследователи соединили мощную GLM-5.2 от Z.ai (753 млрд параметров) со скромной Qwen-3.5 от Alibaba (4 млрд параметров). В этой связке «тяжелая» модель занималась исключительно анализом запроса, не генерируя ответ. Её внутреннее состояние через «мост» передавалось малой модели, которая и формировала итоговый текст.

Результаты впечатляют: такая конфигурация позволила сократить разрыв в качестве ответов между малой и большой моделями примерно наполовину. При сопоставимых вычислительных затратах гибридная система показала преимущество в 10 процентных пунктов над классической схемой с текстовой передачей данных. Более того, связка GLM-5.2 и Qwen-3.5 оказалась примерно в 2,5 раза экономичнее по вычислениям, чем монолитная модель среднего размера с аналогичным качеством.

В поисках общего математического языка

Главный научный сотрудник Mostik Станислав Смирнов подчеркивает фундаментальную сложность задачи: внутренние представления разных нейросетей несопоставимы напрямую. Даже решая одну и ту же задачу, модели кодируют информацию в своих скрытых состояниях принципиально по-разному. «Похоже, подходящего математического языка пока не существует», — отмечает он. Изучение таких соответствий, по его мнению, может пролить свет на то, как ИИ-системы представляют знания и принимают решения, а также выявить общие закономерности в их «рассуждениях».

Практическая ценность разработки очевидна для индустрии. Бывший исследователь Google DeepMind Карл Туйлс видит сценарий, где ресурсоемкая модель используется только для «размышлений», а генерацию текста берет на себя компактная модель. Другой перспективный вектор — комбинирование универсальной модели со специализированными экспертами в биологии, физике или финансах. Технический руководитель Lovable Владимир Арустамян полагает, что это повысит спрос на узкоспециализированные модели, позволяя собирать сложные системы из готовых компонентов.

Проверка боем: ARC-AGI-3

Mostik также применила свой метод в тесте ARC-AGI-3 — наборе задач, требующих от ИИ адаптации к новым правилам в реальном времени. Система с «мостом» показала один из лучших результатов в текущем рейтинге, хотя детали пока не раскрываются из-за продолжающегося соревнования.

Впрочем, к этим заявлениям стоит относиться с осторожностью: данные в ARC-AGI-3 имеют статус «превью» и основаны на неполных тестах. Все остальные показатели эффективности — сокращение разрыва между моделями и снижение затрат — базируются на внутренних экспериментах команды и пока не получили независимого подтверждения.

Мой анализ: Эта работа знаменует собой важный сдвиг от парадигмы «общения через текст» к прямому обмену скрытыми состояниями. Если результаты Mostik подтвердятся независимыми тестами, мы стоим на пороге появления по-настоящему модульных ИИ-систем, где «мозг» и «речь» могут быть разделены и оптимизированы по отдельности. Это не просто оптимизация — это новый взгляд на архитектуру искусственного интеллекта, где знания передаются на уровне математических абстракций, а не слов.