В индустрии искусственного интеллекта назревает тихий, но значимый сдвиг. Мы привыкли к тому, что коллаборация между нейросетями происходит через генерацию промежуточного текста — этакий «перевод» мыслей на человеческий язык для передачи другому алгоритму. Однако команда разработчиков под брендом Mostik предлагает радикально иной путь: прямой обмен внутренними состояниями, минуя вербальную стадию.

Суть метода заключается в использовании специального адаптируемого модуля, который я называю «мостиком». Он трансформирует скрытые векторы одной модели в формат, понятный другой, при этом параметры самих нейросетей остаются нетронутыми. Это принципиально важно: мы не дообучаем модели, а лишь создаем прослойку для их бесшовного взаимодействия.

Цифры и эксперименты: проверка на гигантах

Разработчики утверждают, что при генерации одного токена большая языковая модель формирует более сотни скрытых векторов — это около миллиона числовых значений или примерно 2 МБ данных. В текстовый ответ попадает лишь малая толика этого богатства. Их канал передачи нацелен именно на эти богатые внутренние представления.

Эмпирическая проверка выглядит впечатляюще. В связке гигантской GLM-5.2 от Z.ai (753 млрд параметров) и компактной Qwen-3.5 от Alibaba (4 млрд параметров) большая модель обрабатывала запрос, но не генерировала ответ. Вместо этого её внутреннее состояние через «мост» передавалось малой модели, которая и формировала итоговый текст. Такой тандем, по заверениям авторов, закрыл около половины разрыва в качестве между моделями. При сравнении с классической передачей текста новый метод показал преимущество до 10 процентных пунктов при равных вычислительных затратах. Более того, гибридная система потребовала примерно в 2,5 раза меньше вычислений, чем модель среднего размера с сопоставимым результатом.

Главная проблема: поиск общего «языка»

Ключевая сложность, которую признают сами исследователи, — отсутствие единого математического пространства для разных архитектур. Главный научный сотрудник Mostik Станислав Смирнов справедливо отмечает: «Похоже, подходящего математического языка пока не существует». Внутренние кодировки информации у разных сетей могут кардинально различаться даже при решении идентичных задач. Именно поэтому «мост» должен быть адаптируемым — он учится переводить с одного «диалекта» скрытых состояний на другой.

Практическая ценность подхода очевидна: мы можем использовать тяжелую модель только для сложной мыслительной работы, а генерацию ответа делегировать легковесной. Это открывает путь к созданию гибридных систем, объединяющих универсальные и узкоспециализированные модели без необходимости обучать монстра на всех данных сразу.

Оценка и скепсис

Несмотря на интригующие результаты в тестах ARC-AGI-3, где система показала один из лучших результатов, следует сохранять здоровый скепсис. Все заявленные показатели базируются на внутренних экспериментах команды и пока не получили внешнего подтверждения. Тем не менее, если метод подтвердится, мы стоим на пороге новой парадигмы в масштабировании ИИ, где эффективность достигается не наращиванием параметров, а умной коммуникацией между специализированными агентами.

Мой вердикт: это смелый и потенциально прорывной шаг, но до продакшена ему далеко. Ключевой вопрос — насколько стабильно «мост» будет работать на разнородных архитектурах и задачах вне лабораторных условий. Следим за развитием.