OpenAI представила голосовые модели GPT-Live: ChatGPT теперь может слушать, думать и говорить одновременно
Новые возможности естественного общения
OpenAI анонсировала семейство голосовых моделей GPT-Live-1 и GPT-Live-1 mini, которые позволяют ChatGPT вести беспрецедентно естественный голосовой диалог. В отличие от предыдущих версий, новые модели работают на полнодуплексной архитектуре (full duplex), способной одновременно принимать и передавать данные — слушать пользователя и генерировать ответ без ненужных пауз. 
Технология полнодуплексного общения
Ключевое отличие GPT-Live заключается в способности поддерживать непрерывный диалог: модель может вставлять короткие междометия вроде «мхм» или «ага», показывая, что активно слушает, а также выдерживать паузы, когда пользователь задумывается, не перебивая его из-за фонового шума. Система анализирует контекст диалога длительное время, оставаясь в режиме ожидания до момента обращения пользователя.
Для запросов, требующих поиска в интернете или глубоких рассуждений, GPT-Live-1 может обращаться к новейшим текстовым моделям OpenAI, включая GPT-5.5, выполняя агентские задачи в фоновом режиме, не прерывая при этом голосовой диалог. Модели также поддерживают синхронный перевод в режиме реального времени. 
Доступность и развертывание
Компания начала раскатывать две версии GPT-Live на платформах iOS, Android и в веб-версии ChatGPT. GPT-Live-1 mini станет стандартной голосовой моделью для бесплатных пользователей, в то время как подписчики Go, Plus и Pro получат доступ к более производительной GPT-Live-1. Доступ через API OpenAI планируется открыть позже.
По результатам внутренних тестов, GPT-Live-1 значительно опережает предыдущий Advanced Voice Mode на тестах GPQA (экспертные научные рассуждения) и BrowseComp (поиск труднодоступной информации), а также превосходит его в задачах голосовой поддержки клиентов.
Дополнительные функции и безопасность
Новая версия ChatGPT Voice получила возможность отображать визуальные карточки прямо во время разговора — прогноз погоды, котировки акций, спортивные результаты и другая информация. Система оснащена встроенными механизмами безопасности, учитывающими возраст пользователя и способными оказывать помощь в критических ситуацияциях.
Для подростков предусмотрены дополнительные ограничения и родительский контроль. Модель прошла расширенное тестирование на аудиоданных по темам самоповреждения, психоза и эмоциональной привязанности к ИИ. 
Ограничения и особенности реализации
На старте GPT-Live не поддерживает голосовой режим с видеодемонстрацией экрана — эти функции остаются доступны только в прежних версиях ChatGPT Voice. Кроме того, компания отметила, что модель оптимизирована для самых популярных языков в ChatGPT, но на некоторых языках может демонстрировать акцент или пробелы в беглости речи. Например, демонстрация перевода на хинди выявила недостатки в виде американского акцента и неестественной, книжной интонации синтезированной речи.
По словам руководителя продукта ChatGPT Voice Этти Элети (Atty Eleti), в перспективе голосовое управление может стать основным интерфейсом для выполнения сложных запросов, хотя система пока не позиционируется как ИИ-компаньон. 