Skip to content
Google представила Gemini 3.5 Transcribe — ИИ превратит живую речь в готовый текст без слов-паразитов
27 августа 13:28 11 Просмотров Новости

Google представила Gemini 3.5 Transcribe — ИИ превратит живую речь в готовый текст без слов-паразитов

Google официально анонсировала специализированную языковую модель Gemini 3.5 Transcribe, созданную для преобразования сырой живой речи и аудиозаписей в чистый, структурированный и готовый к публикации текст. Главное отличие новой модели от традиционных систем распознавания речи — отказ от классических алгоритмов в пользу глубокого понимания контекста на базе архитектуры Gemini. логотип Gemini 3.5 Transcribe на фоне интерфейса Google AI Studio

Интеллектуальная очистка и понимание контекста

Ключевая способность Gemini 3.5 Transcribe — работа с дисплюенциями речи в реальном времени. Модель на лету удаляет слова-паразиты, заминки, повторы и распознает моменты, когда говорящий исправляет себя прямо по ходу фразы. Это позволяет получать готовый к использованию текст без необходимости последующего ручного редактирования.

Система демонстрирует высокое качество работы со сложными данными: корректно обрабатывает диктовку email-адресов, номеров телефонов и специфического профессионального жаргона, опираясь на контекст всего высказывания. В демонстрациях разработчики показывали, как модель без ошибок фиксирует завитки вроде электронных адресов, которые традиционные движки часто искажают.

Разделение спикеров и временные метки

Для работы с записями встреч, звонков и подкастами модель умеет разделять речь до трёх говорящих — в тестах это число планируется увеличить. Одновременно расставляются точные временные метки (таймкоды), что критически важно для создания протоколов, субтитров и поиска по аудиоархивам. интерфейс Gemini 3.5 Transcribe с разметкой спикеров и таймкодами

Мультиязычность и доступность

Заявлена поддержка более 85 языков, включая русский. Модель уже интегрирована в экосистему Google: функцию можно протестировать в приложении Gemini для macOS и в голосовом вводе клавиатуры Gboard на Android (в частности, в функции Rambler). В планах — нативная интеграция в браузер Chrome для диктовки в любые веб-поля без сторонних расширений.

Доступ для разработчиков

Gemini 3.5 Transcribe доступна в режиме публичного превью через Gemini API в Google AI Studio. Предоставляются два режима работы: Live API для потоковой обработки реалтайм-аудио с минимальной задержкой и Interactions API для обработки готовых аудиофайлов. Это открывает путь для создания голосовых интерфейсов, сервисов автоматического протоколирования встреч, систем субтитров и инструментов доступности. панель разработчика Google AI Studio с настройками Gemini 3.5 Transcribe API

Поделиться

Похожие публикации