На главную

Xiaomi выпустила ИИ-модель CocktailASR-1 для распознавания речи в шумных помещениях

1 мин
Xiaomi выпустила ИИ-модель CocktailASR-1 для распознавания речи в шумных помещениях

Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Xiaomi представила открытую ИИ-модель CocktailASR-1, предназначенную для выделения и расшифровки речи конкретного человека в условиях, когда несколько людей говорят одновременно. Модель использует короткий образец голоса в качестве эталона и, по данным Xiaomi, превосходит существующие аналоги в тестах с многоголосными записями. Она доступна на GitHub и Hugging Face.

Ключевые факты

  • CocktailASR-1 — открытая ИИ-модель Xiaomi для распознавания речи в условиях, когда несколько человек говорят одновременно.
  • Для работы модели требуется короткий образец голоса целевого человека, который используется как эталон.
  • По данным Xiaomi, модель показала ведущие результаты в тестах с многоголосными записями, превзойдя существующие аналоги.
  • Если голос-образец отсутствует в записи, модель выдаёт пустой текст и не пытается расшифровать речь других людей.
  • Модель доступна на GitHub и Hugging Face.

Возможности модели

CocktailASR-1 решает проблему «эффекта коктейльной вечеринки», когда наложение голосов усложняет распознавание речи. В отличие от модели OmniVoice, которая генерирует речь, CocktailASR-1 выделяет и расшифровывает речь конкретного человека. Модель использует короткий образец голоса как эталон для идентификации нужного говорящего в записи с несколькими участниками. В тестах с многоголосными образцами, по заявлению Xiaomi, модель продемонстрировала ведущие результаты и превзошла существующие аналоги. CocktailASR-1 также работает с записями одного говорящего и не делает необоснованных предположений, если эталонный голос отсутствует.

Логика и доступность

Модель включает режим цепочки рассуждений, позволяющий пользователям изучать логику расшифровки. CocktailASR-1 выпущена как открытая модель и доступна на GitHub и Hugging Face.

2 источника

Время · отставание