Skip to content
OpenAI представила голосовые модели GPT-Live: ChatGPT теперь может слушать, думать и говорить одновременно
10 июля 05:28 7 Просмотров Новости

OpenAI представила голосовые модели GPT-Live: ChatGPT теперь может слушать, думать и говорить одновременно

Новые возможности естественного общения

OpenAI анонсировала семейство голосовых моделей GPT-Live-1 и GPT-Live-1 mini, которые позволяют ChatGPT вести беспрецедентно естественный голосовой диалог. В отличие от предыдущих версий, новые модели работают на полнодуплексной архитектуре (full duplex), способной одновременно принимать и передавать данные — слушать пользователя и генерировать ответ без ненужных пауз. интерфейс голосового режима ChatGPT

Технология полнодуплексного общения

Ключевое отличие GPT-Live заключается в способности поддерживать непрерывный диалог: модель может вставлять короткие междометия вроде «мхм» или «ага», показывая, что активно слушает, а также выдерживать паузы, когда пользователь задумывается, не перебивая его из-за фонового шума. Система анализирует контекст диалога длительное время, оставаясь в режиме ожидания до момента обращения пользователя.

Для запросов, требующих поиска в интернете или глубоких рассуждений, GPT-Live-1 может обращаться к новейшим текстовым моделям OpenAI, включая GPT-5.5, выполняя агентские задачи в фоновом режиме, не прерывая при этом голосовой диалог. Модели также поддерживают синхронный перевод в режиме реального времени. демонстрация функции синхронного перевода GPT-Live

Доступность и развертывание

Компания начала раскатывать две версии GPT-Live на платформах iOS, Android и в веб-версии ChatGPT. GPT-Live-1 mini станет стандартной голосовой моделью для бесплатных пользователей, в то время как подписчики Go, Plus и Pro получат доступ к более производительной GPT-Live-1. Доступ через API OpenAI планируется открыть позже.

По результатам внутренних тестов, GPT-Live-1 значительно опережает предыдущий Advanced Voice Mode на тестах GPQA (экспертные научные рассуждения) и BrowseComp (поиск труднодоступной информации), а также превосходит его в задачах голосовой поддержки клиентов.

Дополнительные функции и безопасность

Новая версия ChatGPT Voice получила возможность отображать визуальные карточки прямо во время разговора — прогноз погоды, котировки акций, спортивные результаты и другая информация. Система оснащена встроенными механизмами безопасности, учитывающими возраст пользователя и способными оказывать помощь в критических ситуацияциях.

Для подростков предусмотрены дополнительные ограничения и родительский контроль. Модель прошла расширенное тестирование на аудиоданных по темам самоповреждения, психоза и эмоциональной привязанности к ИИ. визуальные карточки в голосовом режиме ChatGPT

Ограничения и особенности реализации

На старте GPT-Live не поддерживает голосовой режим с видеодемонстрацией экрана — эти функции остаются доступны только в прежних версиях ChatGPT Voice. Кроме того, компания отметила, что модель оптимизирована для самых популярных языков в ChatGPT, но на некоторых языках может демонстрировать акцент или пробелы в беглости речи. Например, демонстрация перевода на хинди выявила недостатки в виде американского акцента и неестественной, книжной интонации синтезированной речи.

По словам руководителя продукта ChatGPT Voice Этти Элети (Atty Eleti), в перспективе голосовое управление может стать основным интерфейсом для выполнения сложных запросов, хотя система пока не позиционируется как ИИ-компаньон. логотип OpenAI

Поделиться

Похожие публикации