Google представила Gemini 3.5 Transcribe — ИИ превратит живую речь в готовый текст без слов-паразитов
Google официально анонсировала специализированную языковую модель Gemini 3.5 Transcribe, созданную для преобразования сырой живой речи и аудиозаписей в чистый, структурированный и готовый к публикации текст. Главное отличие новой модели от традиционных систем распознавания речи — отказ от классических алгоритмов в пользу глубокого понимания контекста на базе архитектуры Gemini. 
Интеллектуальная очистка и понимание контекста
Ключевая способность Gemini 3.5 Transcribe — работа с дисплюенциями речи в реальном времени. Модель на лету удаляет слова-паразиты, заминки, повторы и распознает моменты, когда говорящий исправляет себя прямо по ходу фразы. Это позволяет получать готовый к использованию текст без необходимости последующего ручного редактирования.
Система демонстрирует высокое качество работы со сложными данными: корректно обрабатывает диктовку email-адресов, номеров телефонов и специфического профессионального жаргона, опираясь на контекст всего высказывания. В демонстрациях разработчики показывали, как модель без ошибок фиксирует завитки вроде электронных адресов, которые традиционные движки часто искажают.
Разделение спикеров и временные метки
Для работы с записями встреч, звонков и подкастами модель умеет разделять речь до трёх говорящих — в тестах это число планируется увеличить. Одновременно расставляются точные временные метки (таймкоды), что критически важно для создания протоколов, субтитров и поиска по аудиоархивам. 
Мультиязычность и доступность
Заявлена поддержка более 85 языков, включая русский. Модель уже интегрирована в экосистему Google: функцию можно протестировать в приложении Gemini для macOS и в голосовом вводе клавиатуры Gboard на Android (в частности, в функции Rambler). В планах — нативная интеграция в браузер Chrome для диктовки в любые веб-поля без сторонних расширений.
Доступ для разработчиков
Gemini 3.5 Transcribe доступна в режиме публичного превью через Gemini API в Google AI Studio. Предоставляются два режима работы: Live API для потоковой обработки реалтайм-аудио с минимальной задержкой и Interactions API для обработки готовых аудиофайлов. Это открывает путь для создания голосовых интерфейсов, сервисов автоматического протоколирования встреч, систем субтитров и инструментов доступности. 