Google представила Gemini 3.5 Transcribe — модель для интеллектуального распознавания живой речи
Новый этап голосовых технологий
Компания Google официально анонсировала Gemini 3.5 Transcribe — передовую языковую модель, созданную специально для интеллектуального распознавания и обработки живой речи. В отличие от классических движков перевода звука в текст, новинка представляет собой полноценную LLM, способную понимать контекст, структуру диалога и нюансы устной речи. 
Ключевые возможности: от очистки текста до работы с акцентами
Главное отличие Gemini 3.5 Transcribe — умение не просто фиксировать слова, а интеллектуально обрабатывать их. Модель автоматически удаляет слова-паразиты («эм», «а», «у»), корректно обрабатывает самоисправления на лету (например, фразы вроде «давай встретимся во вторник — нет, в среду») и производит автоформатирование текста.
По данным тестов Artificial Analysis, средний показатель частоты ошибок в словах (WER) составляет 2,6% для готовых записей и 4,0% для потокового вещания. Особое внимание уделено работе с цифробуквенными комбинациями — почтовыми индексами, email-адресами, ID заказов — с чем традиционно испытывают трудности старые решения.
Мультиязычность покрывает более 85 языков, включая русский. Модель умеет на лету определять язык речи и переключаться между ними в рамках одного разговора, а также уверенно распознавать региональные акценты. Для предварительно записанных аудиофайлов доступно разделение спикеров с точными временными метками. Дополнительно предусмотрена поддержка кастомного словаря: разработчики могут задавать собственный набор терминов, специфического жаргона или редких имен собственных для максимальной точности. 
Две версии под разные сценарии использования
Google выпустила две модификации модели, оптимизированные для разных задач:
- gemini-3.5-transcribe-live (Потоковая) — подключается через Live API, оптимизирована для работы в реальном времени с задержкой менее одной секунды. Идеально подходит для голосовых ассистентов и прямых трансляций.
- gemini-3.5-transcribe (Пакетная/файловая) — обрабатывает готовые записи через Interactions API, проставляя детальные таймкоды на уровне отдельных слов.
Такой подход позволяет разработчикам выбирать оптимальный вариант в зависимости от требований к задержке и глубине анализа. 
Интеграция в экосистему и доступ для разработчиков
Модель уже начинает внедряться в продукты Google. Пользователи десктопного приложения Gemini для macOS получили доступ к новой функции транскрипции. Постепенная интеграция запланирована для клавиатуры Gboard на Android и браузера Chrome, что сделает интеллектуальный голосовой ввод доступным миллионам пользователей.
Разработчики могут протестировать Gemini 3.5 Transcribe в режиме предварительной версии через Gemini API в Google AI Studio. Это открывает путь для создания собственных приложений с продвинутым распознаванием речи — от сервисов субтитров и протоколирования встреч до голосовых интерфейсов нового поколения. 