Технологии

Google запустил Gemini 3.5 Transcribe — транскрибирование на 85 языках

Adrian Kessler

Gemini 3.5 Transcribe не просто фиксирует, что говорит человек. Она превращает сказанное в то, что он на самом деле хотел сказать. Когда говорящий поправляет себя на полуслове — «Давайте запланируем на вторник, нет, на среду» — модель выводит «среда» и отбрасывает поправку. Слова-паразиты исчезают. Фоновый шум не мешает. На выходе — чистый, отформатированный текст, а не сырая аудиозапись.

Для тех, кто записывает интервью, подкасты или многоконтентный контент, это различие составляет весь рабочий процесс. Каждый инструмент транскрипции на рынке обрабатывает «что было сказано». Человек-редактор, который потом чистил запись, занимался всем остальным. Google теперь встраивает этого редактора прямо в модель.

Модель поддерживает два отдельных API-пути. Live API обеспечивает непрерывную двунаправленную потоковую передачу с задержкой менее секунды — предназначен для голосовых агентов реального времени, ботов службы поддержки и всего, что требует мгновенной транскрипции. Interactions API обрабатывает записанное аудио: полные встречи, журналы звонков и интервью, возвращая атрибуцию говорящих (до трёх участников) с временными метками. Оба достигают 4,0% частоты ошибок в словах в потоковом режиме и 2,6% в непотоковом — по данным независимой бенчмаркинговой компании Artificial Analysis. Предыдущая модель распознавания речи Google, Chirp 3, требовала на 70% больше времени для получения финальной транскрипции.

Потребительская сторона запуска скромнее. На Android Gboard Rambler уже использует Gemini 3.5 Transcribe для голосового ввода текста. Приложение Gemini для macOS поддерживает его на английском через функцию Speak to Window. Chrome указан как «скоро» — это позволит пользователям диктовать в любое веб-поле: ответы, посты, формы — без переключения приложений. Конкретная дата этого развёртывания не подтверждена.

Ограничения модели имеют значение. Атрибуция нескольких говорящих ограничена тремя участниками; панели и круглые столы с большим составом требуют обходных путей. Потребительское приложение Rambler сейчас доступно в «отдельных странах и языках», а не во всех 85, которые поддерживает модель. Google не объявил цены на API, который находится в публичной предварительной версии через Google AI Studio. Корпоративный доступ осуществляется через Gemini Enterprise Agent Platform, где цены обсуждаются индивидуально. Для небольших создателей вопрос стоимости остаётся открытым.

Конкурентный контекст также важен. OpenAI Whisper, по-прежнему стандарт для независимых разработчиков, достигает частоты ошибок в словах в диапазоне 5–7% на английском аудио и требует постобработки для удаления слов-паразитов и форматирования. Сервисы вроде AssemblyAI и Deepgram предлагают диаризацию говорящих, но не встроенную коррекцию на естественном языке, которую Gemini 3.5 Transcribe применяет по умолчанию. Разница измерима, однако то, как она проявляется в более сложной части 85-языкового диапазона — региональные акценты, языки с ограниченными ресурсами, шумная среда — потребует независимого тестирования.

Функция, которая больше всего говорит о долгосрочном направлении Google, — это интеграция с Chrome. Как только голосовой ввод заработает в любом веб-поле, модель перестанет быть инструментом разработчика — она станет инфраструктурой для того, как люди печатают. Сроки развёртывания этого изменения не подтверждены.

Теги: , , , , ,

Обсуждение

Имеется 0 комментариев.