OpenAI сделала очередной шаг в эволюции голосовых интерфейсов, анонсировав GPT-Live — новое поколение голосовых моделей, интегрированных в режим «Разговор» ChatGPT. Это не просто обновление, а фундаментальный сдвиг в том, как мы взаимодействуем с искусственным интеллектом.
Ключевая инновация — полнодуплексная архитектура. В отличие от предшественников, GPT-Live способен одновременно слушать и говорить, не дожидаясь пауз. Модель распознает междометия, естественно делает паузы и не перебивает пользователя, даже если тот задумался. Это приближает диалог с ИИ к человеческому общению.
Архитектурно процесс разделен: пока GPT-Live поддерживает беседу, другая модель (на старте — GPT-5.5) в фоновом режиме обрабатывает сложные запросы — поиск в интернете или вычисления. Это позволяет ИИ переводить речь в реальном времени и решать задачи без прерывания диалога.
Тесты подтверждают превосходство GPT-Live в научных рассуждениях и извлечении данных. В интерфейсе ChatGPT также появились визуальные карточки с погодой, курсами акций и спортивными результатами — шаг к более мультимодальному опыту.
OpenAI выпустила две версии: мощную GPT-Live-1 и упрощенную GPT-Live-1 mini. Доступность варьируется: пользователи платных тарифов Plus и Pro получили доступ к основной модели, бесплатная версия ChatGPT использует mini-версию. В ближайшее время компания откроет API для разработчиков.
Безопасность также получила обновления: новые фильтры блокируют имитацию голосов и ограничивают контент, связанный с насилием или самоповреждением. Для подростков предусмотрен родительский контроль.
Этот запуск — стратегически важный шаг. GPT-Live не просто улучшает голосовой интерфейс, но и меняет саму парадигму: ИИ теперь может быть полноценным собеседником, а не просто инструментом. Однако истинный потенциал раскроется с открытием API — тогда разработчики смогут встроить эту технологию в свои продукты, что может переопределить рынок голосовых ассистентов.