Технологии

Gemini 3.8 Live убирает пустое лицо из ИИ-обслуживания клиентов

Adrian Kessler
Добавьте нас в Google

Система называется Gemini 3.8 Live with Live Avatar. Она объединяет речевую модель Google, преобразующую речь в речь, с видеослоем, который в реальном времени генерирует движения губ и мимику, одновременно выполняя фоновые вызовы инструментов — и не прерывая разговор. Язык определяется автоматически: во время звонка аватар переключается с одного языка на другой без передачи вызова, перезагрузки системы и заметной паузы.

От методов наложения видеоряда эту систему отличает то, что генерация аудио и видео идёт в рамках одного контура инференса в реальном времени, а не в виде последовательных этапов. Благодаря этому задержка остаётся достаточно низкой, чтобы разговор звучал естественно. Google незаметно встраивает водяные знаки SynthID и в аудио, и в видео: каждую секунду потока сопровождает машиночитаемая метка, указывающая на то, что он создан ИИ, даже если запись сохранена и воспроизведена позднее. Метка сохраняется и после повторного кодирования, поэтому происхождение экспортированных роликов можно проверить.

Самое наглядное представление о возможностях системы в масштабах реальной эксплуатации даёт Equal AI, отвечающая за корпоративное внедрение в Индии: одновременно работают девять индийских языков, ежедневно обрабатывается более миллиона звонков, а всего поддерживается 97 языков. Обеспечить такой объём при сопоставимой доступности и охвате расписания с помощью операторов-людей было бы экономически нецелесообразно. В основе проекта лежит не проверка концепции, а расчёт на высокую пропускную способность.

При запуске Google не раскрыла стоимость системы и направила заинтересованных клиентов в отдел корпоративных продаж. Создание индивидуального аватара — то есть лица на основе предоставленных организацией референсных изображений — требует включения в список разрешённых корпоративных клиентов после отдельной проверки; самостоятельно выполнить эту процедуру нельзя. Функции Extended Thinking для модели Live пока доступны лишь в закрытом предварительном тестировании, поэтому глубина рассуждений уступает другим моделям Gemini от Google. Ограничения на число одновременных сессий также не раскрыты. Такой ограниченный запуск соответствует принятому в Google подходу к поэтапному выводу корпоративных продуктов, когда цены и доступные мощности обсуждаются с клиентом, а не публикуются.

Gemini 3.8 Live with Live Avatar уже доступна в консоли Gemini Enterprise и через Live API; конечные точки работают в США и Европейском союзе. Для более широкого доступа к Extended Thinking в модели Live сроков пока не объявлено: функция остаётся доступна только нынешней группе участников закрытого предварительного тестирования.

Компании, внедряющие эту технологию, помогут ответить на вопрос, на который сама она ответа не даёт: улучшает ли пользовательский опыт устранение визуального признака автоматизированного взаимодействия — или же оно убирает последний честный сигнал о том, что перед пользователем система, а не человек.

Теги: , , , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.