Привет, Хабр! Меня зовут Саша, я пишу курс «Аудиоанализ, распознавание и генерация речи» в Яндекс Практикуме, работаю ML-инженером в аудиодомене и вообще послеживаю за индустрией. Пару месяцев назад вышла статья по генерации речи от Alibaba — Qwen-Audio-3.0-TTS. И вот что примечательно: в таблице…
Синтетическая речь разборчивее живой. Или нет? Разбираем Qwen-Audio-3.0-TTS и что происходит в метриках
Это краткое изложение. Полный текст материала доступен на сайте источника.