| |
|<
<< Page précédente
1
Page suivante >>
>|
|
documents par page
|
|
Tri :
Date
Titre
Auteur
|
|
|
Informatique
/ 21-12-2023
Zhang Olivier
Voir le résumé
Voir le résumé
Les récentes avancées de l'apprentissage profond ont mené à des résultats sans précédent dans une grande variété de tâches et de modalités. Un nombre grandissant de systèmes parvenant à des performances proches de l'humain en analyse (transcription, reconnaissance du locuteur) et en génération de la parole (conversion, synthèse vocale) sont proposés. De telles solutions émergent dans l'industrie, et commencent à atteindre le grand public. Cependant, la complexité et la taille grandissantes des réseaux de neurones induisent un manque important d'interprétabilité. De plus, les représentations profondes ne sont pas encouragées pour être structurées. C'est pourquoi l'apprentissage de représentations dites démêlées a fait son apparition, et a pour priorité la structuration des représentations apprises, en rapport avec les facteurs génératifs des données, et si possible alignées avec la perception humaine. Un tel paradigme a le potentiel pour reconnaître les attributs de la parole (identité du locuteur, émotion), pouvant alors être exploité dans la synthèse vocale. À noter que le démêlage est encore un domaine de recherche récent, nécessitant des données simples et synthétiques pour être développé. Ainsi, cette thèse vise à combler le fossé entre le traitement de la parole et le démêlage, en exploitant des modèles de démêlage à l'état de l'art pour identifier les attributs de la parole de manière automatique, et à terme améliorer le contrôle de la synthèse vocale.
|
|
|
|<
<< Page précédente
1
Page suivante >>
>|
|
documents par page
|