Skip to content
«Сбер» разрабатывает полнодуплексный голосовой ИИ: одновременная речь и слушание с задержкой 160–320 мс
22 августа 03:25 12 Просмотров Новости

«Сбер» разрабатывает полнодуплексный голосовой ИИ: одновременная речь и слушание с задержкой 160–320 мс

«Сбербанк» анонсировал разработку полнодуплексного (full-duplex) голосового искусственного интеллекта, способного одновременно говорить и слушать пользователя. Об этом 21 августа 2026 года сообщил директор по развитию технологий ИИ «Сбербанка» Сергей Марков. Новая система призвана устранить главное ограничение существующих голосовых ассистентов — необходимость ждать окончания реплики собеседника перед формированием ответа. Сергей Марков директор по развитию технологий ИИ Сбербанка

Как работает полнодуплексный режим

Текущие голосовые ассистенты функционируют в полудуплексном режиме: пользователь произносит запрос, система переводит речь в текст, генерирует ответ, синтезирует речь и только затем воспроизводит его. Новый подход «Сбера» отказывается от каскада раздельных нейросетей в пользу единой универсальной эндо-ту-энд аудиомодели, выполняющей все операции параллельно.

Ключевые преимущества архитектуры:

  • ИИ продолжает слушать пользователя прямо во время собственного ответа
  • Мгновенная реакция на перебивания, уточнения и корректировки реплик
  • Время отклика сокращено до 160–320 миллисекунд, что соответствует скорости реакции живого человека в естественном диалоге

Техническая основа и отличия от каскадных систем

Традиционный конвейер (ASR → LLM → TTS) накапливает задержки на каждом этапе и не позволяет обрабатывать входящий аудиопоток во время генерации исходящего. Полнодуплексная модель «Сбера» обрабатывает аудиопоток непрерывно, сохраняя контекст беседы и возможность вмешательства пользователя в любой момент. схема полнодуплексного голосового ИИ Сбер

По словам Сергея Маркова, такая архитектура требует решения нетривиальных задач: разделения собственной речи и речи собеседника в едином аудиопотоке, поддержания долгого контекста при параллельной генерации, а также синхронизации интонаций и пауз для естественного звучания.

Мировой контекст: от Moshi к Gemini Live и GPT-Live

Пионером полнодуплексного голосового взаимодействия стала французская лаборатория Kyutai, выпустившая в 2024 году модель Moshi с открытым кодом. Она продемонстрировала возможность реального диалога с задержкой около 200 мс. После этого технологию адаптировали глобальные игроки: Google представила Gemini Live, а OpenAI — GPT-Live (Advanced Voice Mode).

Разработка «Сбера» направлена на перенос этого стандарта на русскоязычный рынок и интеграцию в экосистему компании. Это первый крупный российский проект, публично заявляющий о создании собственной эндо-ту-энд полнодуплексной аудиомодели. сравнение полнодуплексных систем Moshi Gemini Live GPT-Live

Перспективы: видео, аватары и сценарии применения

В дорожной карте проекта заложена мультимодальность: интеграция с визуальными системами позволит ИИ не только слышать, но и параллельно видеть пользователя, синхронизировано управляя движениями собственного видеоаватара. Это открывает путь к интерфейсам нового типа — виртуальным ассистентам с полноценным невербальным общением.

Первичные сценарии внедрения в экосистеме «Сбера» могут включать:

  • Мобильное приложение и умные устройства с голосовым управлением
  • Колл-центры и службы поддержки с естественным диалогом
  • Умный дом и автомобильные системы
  • Образовательные и доступные интерфейсы для людей с ограниченными возможностями

Конкретные сроки выхода в пилотную эксплуатацию или открытый доступ пока не называются, однако анонс на стадии активной разработки подтверждает приоритетность направления для технологической стратегии банка. потенциальные сценарии использования голосового ИИ Сбер в экосистеме

Поделиться

Похожие публикации