OpenAI представила GPT-Live-1 — голосовые модели, способные слушать и говорить одновременно
Новое поколение голосового взаимодействия
OpenAI выпустила большое обновление голосового режима ChatGPT: состоялся запуск GPT-Live-1 и GPT-Live-1-mini. Разговор с новыми голосовыми моделями сравнивают с «разговором с другим человеком» — это самая умная голосовая ИИ-модель в истории компании. Модели получили полнодуплексную архитектуру, позволяющую одновременно слушать и говорить.
[изображение | интерфейс голосового режима ChatGPT с GPT-Live-1]
Полнодуплексная архитектура и возможности
GPT-Live-1 отошла от пошаговой системы работы. Это полнодуплексная модель, которая одновременно слушает и говорит. «Это означает, что она может говорить и слушать одновременно... Она способна непрерывно обрабатывать поток входных данных и также непрерывно и одновременно с этим выдавать поток выходных данных», — пояснил руководитель отдела продуктов OpenAI Атти Элети (Atty Eleti).
Новая система позволяет модели вести более естественный диалог, лучше ориентироваться во времени и даже выполнять перевод в реальном времени. GPT-Live-1 может поддакивать ("мхм", "ага"), молчать, когда пользователь задумался, и делать паузы в разговоре. Модель реагирует в реальном времени, не перебивая пользователя.
Интеграция с передовыми моделями и сравнение с предыдущими поколениями
Для сложных задач GPT-Live-1 в фоновом режиме обращается к GPT-5.5 — в будущем вместо GPT-5.5 голосовая модель будет обращаться к другим актуальным версиям LLM. При этом диалог не прерывается. Такая настройка открывает новые возможности для перевода в реальном времени: теперь вместо того, чтобы ждать, пока пользователь перестанет говорить, ChatGPT будет переводить, пока слушает.

Предыдущие поколения систем голосового ИИ использовали каскадные модели: модель преобразования речи в текст для расшифровки, большая языковая модель для генерации ответа и модель преобразования текста в речь. Этот подход приводил к медленным и неестественным ответам, долгим паузам. Голосовые модели с поочерёдным обменом репликами также требовали ждать окончания фразы пользователя, что создавало негибкий обмен репликами.
Доступность и безопасность
GPT-Live-1 внедряется в ChatGPT Voice в приложениях на iOS и Android, а также в веб-версии для пользователей с подписками Go, Plus и Pro. Модель для бесплатных пользователей — GPT-Live-1 mini. В будущем ИИ-модели собираются сделать доступными через API.
Представители компании признали, что технология всё ещё требует доработки, хотя и оптимизирована для большинства распространённых языков. Например, демонстрация функции перевода в режиме реального времени на язык хинди выявила недостатки: американский акцент и неестественная, книжная интонация синтезированной речи.

Система оснащена встроенными механизмами безопасности, обеспечивающими предоставление ответов с учётом возраста пользователя и оказание помощи в критических ситуациях. Кроме того, она получила возможность отображать часть информации в визуальном формате. Как отметил Атти Элети, в перспективе голосовое управление может стать основным интерфейсом для выполнения сложных запросов, однако система не позиционируется в качестве ИИ-компаньона.