Технологии

ElevenLabs v4 клонирует голос по 10 секундам записи и заставляет его говорить на 90 языках

Susan Hill
Добавьте нас в Google

ElevenLabs выпустила Eleven v4 — модель синтеза речи, которая читает написанный текст вслух, добавляя смех, вздох или сердитую французскую интонацию, если автор попросит. Для мгновенного клонирования голоса достаточно записи короче голосового сообщения, а затем скопированный голос может говорить на десятках языков, сохраняя свой тембр. Модель доступна всем пользователям бесплатной учётной записи ElevenLabs.

Для тех, кто работает со звуком, это экономия целых дней. Подкастер может озвучить выпуск на японском собственным голосом, независимый разработчик игры — наделить каждого второстепенного персонажа особой манерой речи, не бронируя студию, а чтец аудиокниг — вставить паузу или смешок прямо в сценарий. Но есть и столь же очевидная обратная сторона: голосового сообщения, фрагмента видеозвонка или нескольких секунд публичной записи теперь достаточно, чтобы создать убедительную копию чьего-либо голоса.

Главное новшество — в управлении, а на создание клона уходит всего 10 секунд аудио. Предыдущие модели ElevenLabs хорошо и чётко читали текст, но настроение им приходилось угадывать. В версии 4 можно прямо в тексте указывать ремарки в квадратных скобках — например, [laughs] или [said angrily in French accent], — а также задавать фоновые звуки вроде [light rain] или [phone buzzing]. Компания утверждает, что модель считывает интонацию и темп и из окружающего контекста: поэтому реплика в напряжённой сцене прозвучит напряжённо и без специальных пометок. В сценах с несколькими говорящими голос каждого персонажа остаётся неизменным на протяжении длинных фрагментов — это было слабым местом синтетической озвучки, где по ходу главы голоса часто менялись.

Число поддерживаемых языков выросло с 70 в предыдущей версии до более чем 90. По данным TechCrunch, особенно заметно улучшилось качество японского, бразильского португальского, китайского (мандаринского) и кантонского языков. При смене языка клонированный голос сохраняет индивидуальность: например, копия голоса испаноговорящего человека, читающая по-немецки, всё равно звучит как он, но с немецким акцентом носителя языка. Вторая модель, v4 Turbo, предназначена для голосовых помощников и операторов колл-центров. Она начинает говорить примерно через 150 миллисекунд — это примерно пауза между репликами собеседников, — и может заговорить ещё до того, как чат-бот, работающий в её основе, закончит формулировать ответ.

ElevenLabs работает на этом рынке не в одиночку. Синтетические голоса тем же разработчикам предлагают Google, OpenAI, Cartesia, Deepgram и Fish Audio. Через несколько часов после запуска независимая компания Artificial Analysis поставила v4 на первое место в своём рейтинге голосовых моделей, где слушатели сравнивают анонимные образцы. ElevenLabs также заявляет, что примерно три четверти слушателей в слепом сравнении предпочли v4 голосам конкурентов; эта цифра основана на собственных испытаниях компании.

Оговорки начинаются с тех самых 10 секунд. ElevenLabs утверждает, что для клонирования требуется согласие человека, чей голос загружают; компания использует общедоступный классификатор, способный распознавать аудио, созданное её инструментами, и полностью блокирует клонирование голосов некоторых политиков. Эти проверки мешают случайным злоупотреблениям, но предполагают, что пользователь говорит правду, а мошеннику достаточно короткого образца голоса родственника, чтобы разыграть поддельный звонок о чрезвычайной ситуации. Бесплатный тариф тоже весьма скромный: около 10 минут сгенерированного аудио в месяц, согласно обзору тарифов Unite.AI; платные планы начинаются с $6 в месяц.

Eleven v4 и v4 Turbo стали доступны 28 сентября в приложении ElevenLabs для авторов, на платформе для ИИ-агентов и через API для разработчиков. Лондонская компания привлекла в феврале $500 миллионов от Sequoia при оценке в $11 миллиардов, а, по данным TechCrunch, её годовая выручка в пересчёте на текущий темп превысила $600 миллионов. Генеральный директор компании Мати Станишевский (Mati Staniszewski) рассказал TechCrunch, что ElevenLabs рассчитывает выйти на биржу в ближайшие годы, но не назвал сроков.

Для авторов голос, который по команде смеётся на 90 языках, — это студия звукозаписи в окне браузера. Для всех остальных — ещё один повод положить трубку и перезвонить, если знакомый голос по телефону просит денег.

Теги: , , , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.