Xiaomi выпустила CocktailASR-1 — модель распознавания речи для шумных помещений с несколькими говорящими

Xiaomi выпустила и открыла исходный код модели распознавания речи Xiaomi-CocktailASR-1, предназначенной для решения одной из самых сложных задач в области транскрипции аудио — выделения голоса одного человека, когда одновременно говорят несколько людей.

Сама Xiaomi называет это «проблемой коктейльной вечеринки». Большинство моделей распознавания речи хорошо работают, когда говорит только один человек, но ситуация сильно усложняется, когда голоса накладываются друг на друга. Это может приводить к искажённому тексту, объединению предложений или приписыванию частей разговора не тому говорящему.

Задача похожа на ту, которую Xiaomi решала в своей модели синтеза речи OmniVoice, однако CocktailASR-1 работает в противоположном направлении: она не генерирует речь, а выделяет и транскрибирует её.

Как работает Xiaomi-CocktailASR-1

Чтобы воспользоваться CocktailASR-1, сначала нужно предоставить короткий аудиофрагмент с голосом человека, речь которого вы хотите отслеживать. Модель использует этот фрагмент как голосовой образец, а затем ищет по записи с несколькими говорящими, чтобы идентифицировать и транскрибировать только речь этого человека.

Xiaomi построила CocktailASR-1 на сквозной архитектуре LLM. Компания утверждает, что достигла передовых результатов в нескольких тестах на распознавание речи с несколькими говорящими, превзойдя существующие подходы, созданные для той же задачи.

Модель не ограничивается шумными групповыми разговорами. По словам Xiaomi, при наличии только одного говорящего CocktailASR-1 работает примерно на том же уровне, что и стандартные модели автоматического распознавания речи (ASR). Это означает, что пользователям не придётся жертвовать качеством работы с одним говорящим ради лучших результатов в насыщенном аудио.

Она также умеет избегать ненужных догадок. Если выбранного говорящего нет в записи, модель возвращает пустой текст вместо попытки транскрибировать голос другого человека.

CocktailASR-1 также включает режим рассуждений с цепочкой мыслей, позволяющий пользователям изучить логику, связанную с транскрипцией, а не только увидеть итоговый текст.

Xiaomi-CocktailASR-1 — очередная в растущем списке AI-моделей, открытых Xiaomi. Она последовала за такими релизами, как MiMo-V2-Flash и Xiaomi Robotics-0. Модель уже доступна на GitHub и Hugging Face для разработчиков.

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии