Глава ElevenLabs — о марже, сроках IPO и раскрытии того, что клиент говорит с ботом
Компания ElevenLabs создаёт «голосовой слой» для ИИ — модели, превращающие текст в речь, неотличимую от человеческой. Большинство людей сталкиваются с ней при общении со службой поддержки, часто даже не подозревая об этом. Например, Klarna использует её для телефонной поддержки первой линии 35 миллионов клиентов в США. То же делают Deutsche Telekom, Cisco, Adobe и всё большее число государственных структур. ElevenLabs также продаёт свои услуги создателям контента — для аудиокниг, дубляжа и музыки.
При этом компания не одинока на рынке. Она всё чаще сталкивается с конкурентами из числа собственных клиентов, включая Decagon — платформу разговорного ИИ, которая обучила свой голосовой продукт на ElevenLabs, а теперь конкурирует с ней. Однако инвесторов это, похоже, не беспокоит. Компания, которая, по её словам, вышла на $600 млн годовой повторяющейся выручки, оценивается своими бэккерами в $22 млрд (~1,76 трлн руб.), несмотря на то что ей всего четыре года.
Соучредитель и генеральный директор ElevenLabs Мати Станишевски дал интервью на конференции Nrth в Торонто (ранее известной как Elevate). Он затронул ряд тем: нужно ли бизнесу сообщать клиентам, что они говорят с ИИ (по его мнению — да), и может ли он обсудить валовую маржу компании. Ожидаемо Станишевски отказался вдаваться в детали, но чётко дал понять, что не против дальнейшего сжатия маржи, если это поможет расширить долю рынка.
На TechCrunch Disrupt в прошлом году вы говорили, что аудиомодели станут товаром широкого потребления в течение пары лет. Как оцените этот прогноз сейчас?
Предстоит ещё много работы, и разница в качестве, которую можно достичь на уровне модели, всё ещё значительна. Если думать вдолгую — лет через три-пять — эти различия станут меньше. Мы бы очень хотели первыми пройти тест Тьюринга для разговорного ИИ. Нужно сочетать интеллект с эмоциональным интеллектом: понимать эмоции собеседника, уметь замедлиться или повысить голос. Это пока никому не удалось.
Какую долю бизнеса сейчас занимают корпоративные клиенты?
Наш ARR составляет $600 млн. Более 55% — это классический корпоративный сегмент, а значительная часть оставшихся 45% — малый и средний бизнес, разработчики, создатели контента.
Как и все в сфере ИИ, вы всё чаще конкурируете со своими клиентами. Decagon обучила голосовой продукт на вас, а теперь прогоняет запросы через собственные модели.
Границы размываются. Раньше было чёткое разделение между модельными компаниями, платформами и приложениями — где одна заканчивается и начинается другая. Сегодня эта грань гораздо более размыта. В случае Anthropic то, что было модельной компанией, определённо стало платформой и всё больше — широким набором приложений. Думаю, так будет продолжаться.
Ваши клиенты могут выбрать «слой рассуждений» из меню опций в ElevenLabs. Что вы наблюдаете в плане использования моделей передовых лабораторий против открытых моделей?
Это не столько бинарный выбор. В клиентском сервисе, если звонок чисто информационный и никаких действий не выполняется, можно использовать множество открытых моделей — база знаний сама определяет, что такое хороший опыт. Но если речь о финансовых услугах, где нужна аутентификация, информация о транзакции, возможно, возврат средств — здесь права на ошибку нет. И тут передовые модели по-прежнему будут лидировать.
Некоторые из этих открытых моделей — китайские. Правительство США — ваш клиент. Европейские правительства — тоже. Как проходят такие переговоры?
По-разному. В каждом внедрении модели и голоса зависят от конкретного случая. Если мы работаем с польским или бразильским правительством, у них свои требования. Это может быть открытая модель, закрытая модель или их собственная дообученная модель. В Польше это кейс в здравоохранении: пациенты записываются на приём через государственную систему, и 18% не приходят. Внедряются агенты, которые звонят и напоминают. У них был набор моделей, оптимизированных на их данных, и мы интегрируемся, сохраняя локальное хранение данных.
Должен ли бизнес раскрывать, что человек говорит с агентом, а не с живым сотрудником?
Я считаю, что сейчас раскрытие необходимо. Люди пока к этому не привыкли, и распространённое ощущение — не хочется чувствовать себя обманутым в таком звонке. Но через пять лет, когда у каждого будет свой агент, действующий от его имени, вы будете звонить и ожидать агента. Тогда, думаю, общество изменится. Есть хорошие способы: если ожидание живого оператора 30 минут, предложите клиенту выбор. В почти всех случаях они выбирают агента и потом удивляются, насколько хорош опыт.
Какова ваша валовая маржа с учётом затрат на модели и инференс?
Отвечу уклончиво. Благодаря исследовательскому компоненту мы умеем дообучать и ограничивать модели чрезвычайно эффективными способами. Но если можем передать экономию клиенту — делаем это. Главное — доказать ценность и быть рядом с клиентом. Так что если мы можем инвестировать и доказать эту ценность, мы не против снижения маржи, чтобы вместе выиграть по мере создания ценности в ближайшие пять лет.
У вас миллионы часов записей звонков в службу поддержки. Обучаетесь ли вы на них? Какая доля обучающих данных синтетическая?
С некоторыми компаниями мы создавали модели совместно — им нужна была специфическая модель под их задачу. В остальном главным был не столько объём данных, сколько их разметка. У нас тысячи людей на контрактной основе помогают размечать не только то, что было сказано, но и когда, как и с какими эмоциями. Нам пришлось привлекать тренеров по голосу, чтобы точно определять акценты.
Сообщалось, что вы рассматриваете 2028 год для IPO. Можете подтвердить?
Мы хотели бы создать компанию, которая выдержит испытание временем. Мы готовим фундамент, чтобы сделать это в ближайшие годы. Но получится ли — зависит от времени и места.
«Годы» — очень расплывчато.
[Смеётся.]
За кулисами: как вы относитесь к тому, должны ли передовые лаборатории замедлиться?
Все согласны работать вместе над поиском способа задать темп. Стоит ли говорить об этом публично и насколько это должно затрагивать медийное обсуждение или регулирование — другой вопрос. Но да, мы все должны принимать правильные меры предосторожности при внедрении технологии. Мы не обучаем текстовые модели и интеллектуальную часть моделей — а это и есть ядро дебатов.
Может ли ElevenLabs оказаться уязвима так же, как Hugging Face?
Мы на шаг дальше, потому что не развёртываем самовоспроизводящиеся или рекуррентные части интеллекта агентов. Наша технология не позволяет агентам создавать новых агентов. Каждый клиент проходит KYC. Риск кибербезопасности определённо существует для всего мира, но у нас есть хороший набор мер предосторожности.
Цены сконвертированы автоматически, реальные значения могут отличаться.

0 комментариев