Технологии

Голосовой ИИ OpenAI больше не ждèт вашей очереди — $0,05 в минуту

Susan Hill

Любой голосовой ИИ на рынке сегодня требует сначала подождать, прежде чем говорить. Модель GPT-Live-1 от OpenAI — нет. Эта модель, доступная через API OpenAI, слушает и говорит одновременно — обрабатывая перебивания, паузы и перекрывающуюся речь так же, как это делает человек в разговоре.

Ценообразование составляет 0,05 доллара за минуту голосового слоя — 1,50 доллара за 30-минутный разговор или 50 долларов за 1000 минут разговора. Разработчики платят отдельно за бэкенд рассуждений: собственный GPT-6 Astra от OpenAI или любую совместимую модель, которая обрабатывает вызовы инструментов и бизнес-логику. Голосовой слой управляет механикой разговора; слой рассуждений решает, что ИИ на самом деле говорит и делает.

Что это разделение означает на практике: бот службы поддержки может услышать «подождите, я хочу другой вариант» в середине фразы и отреагировать на это, вместо того чтобы продолжать заготовленный ответ. Репетитор по языку может заметить, что студент запинается на слове, не дожидаясь, пока тот закончит. Система бронирования может справляться с реальными звонками, где люди повторяются, меняют своё мнение и перебивают друг друга.

На тесте Full Duplex Bench — эталоне, специально разработанном для проверки одновременной двунаправленной голосовой обработки — GPT-Live-1 набирает на 30 процентных пунктов больше, чем её предшественница GPT-Realtime-2.1. В паре с GPT-6 Astra в качестве бэкенда рассуждений она превосходит Tau3, эталон для службы поддержки, который проверяет сложные многошаговые запросы без перерывов в разговоре.

Двухуровневая архитектура отражает продуманное дизайнерское решение. Время речи и рассуждения тарифицируются отдельно, потому что они масштабируются по-разному: стартап, создающий лёгкое приложение для репетиторства, платит меньше по обоим уровням, чем предприятие, обрабатывающее тысячи одновременных звонков в службу поддержки на GPT-6 Astra. Нижняя планка составляет 0,05 доллара за минуту голоса, независимо от того, что работает за ним.

Что GPT-Live-1 не меняет, так это качество ответов. Голосовой слой решает, когда и как ИИ говорит, — а не то, что он знает. Вовремя данный плохой ответ остаётся плохим ответом. Разработчикам, создающим приложения для службы поддержки, придётся оценивать оба уровня по отдельности, и бэкенд рассуждений может добавить к счёту больше, чем сам голосовой слой. OpenAI также не опубликовала данные о том, как архитектура полного дуплекса работает в средах с низкой пропускной способностью или на шумных телефонных линиях, где непрерывный аудиовход поддерживать сложнее.

GPT-Live-1 теперь доступна в API OpenAI. Компания не объявила о выпуске ориентированного на потребителя продукта на основе этой модели, хотя указала, что будущие версии голосового режима ChatGPT могут использовать ту же базовую архитектуру. Ставка в 0,05 доллара за минуту действует на момент запуска; OpenAI не опубликовала график изменения цен или список сторонних моделей рассуждений, одобренных для использования с голосовым слоем.

Теги: , , , , ,

Обсуждение

Имеется 0 комментариев.