Xiaomi шулы бөлмелерде сөйлеуді тануға арналған CocktailASR-1 ИИ моделін шығарды

Материал бірнеше дереккөз негізінде жасанды интеллектпен дайындалды — түпнұсқаларға сілтемелер төменде.
Xiaomi бірнеше адам бір уақытта сөйлеген жағдайда нақты адамның сөзін бөліп алып, тануға арналған ашық CocktailASR-1 ИИ моделін таныстырды. Модель қысқа дауыс үлгісін эталон ретінде пайдаланады және Xiaomi мәліметінше, көп дауысты жазбалармен жүргізілген тесттерде қолданыстағы аналогтардан асып түседі. Ол GitHub және Hugging Face платформаларында қолжетімді.
Негізгі фактілер
- CocktailASR-1 — бірнеше адам бір уақытта сөйлеген жағдайда сөйлеуді тануға арналған Xiaomi-дің ашық ИИ моделі.
- Модель жұмыс істеуі үшін мақсатты адамның қысқа дауыс үлгісі қажет, ол эталон ретінде пайдаланылады.
- Xiaomi мәліметінше, модель көп дауысты жазбалармен жүргізілген тесттерде жетекші нәтиже көрсетіп, қолданыстағы аналогтардан асып түсті.
- Егер үлгі дауыс жазбада болмаса, модель бос мәтін шығарады және басқа адамдардың сөзін тануға әрекет жасамайды.
- Модель GitHub және Hugging Face платформаларында қолжетімді.
Модель мүмкіндіктері
CocktailASR-1 дауыстардың қабаттасуы сөйлеуді тануды қиындататын «коктейль кеші эффектісі» мәселесін шешеді. Сөйлеуді генерациялайтын OmniVoice моделінен айырмашылығы, CocktailASR-1 нақты адамның сөзін бөліп алып, таниды. Модель бірнеше қатысушысы бар жазбада қажетті сөйлеушіні анықтау үшін қысқа дауыс үлгісін эталон ретінде пайдаланады. Xiaomi мәлімдемесі бойынша, модель көп дауысты үлгілермен жүргізілген тесттерде жетекші нәтиже көрсетіп, қолданыстағы аналогтардан асып түсті. CocktailASR-1 бір сөйлеушінің жазбаларымен де жұмыс істейді және эталондық дауыс болмаған жағдайда негізсіз болжам жасамайды.
Логика және қолжетімділік
Модель пайдаланушыларға тану логикасын зерттеуге мүмкіндік беретін ой қорыту тізбегі режимін қамтиды. CocktailASR-1 ашық модель ретінде шығарылды және GitHub пен Hugging Face платформаларында қолжетімді.