Version imprimable
Deep learning models for speech anti-spoofing : enhancing robustness and generalization
(Apprentissage profond pour l’anti-spoofing vocal : robustesse et généralisation améliorées)

Tran, Hoan My - (2026-03-04) / Université de Rennes - Deep learning models for speech anti-spoofing : enhancing robustness and generalization

Langue : Anglais
Directeur de thèse:  Goasdoué, François; Lolive, Damien
Laboratoire :  IRISA
Ecole Doctorale : MATISSE

Thématique : Informatique
Accès à la ressource : https://ged.univ-rennes1.fr/nuxeo/site/esupversion...

Mots-clés : Apprentissage profond, Détection de spoofing vocal, Apprentissage profond, Systèmes informatiques -- Mesures de sûreté, Cyberdéfense, Traitement automatique de la parole

Résumé : Nos travaux portent sur le développement de modèles d’apprentissage profond pour la détection de spoofing vocal, dans le but d’améliorer la vérification du locuteur et de prévenir les usurpations d’identité. Nous commençons par définir le domaine dans lequel s’inscrit cette thèse, avec un focus particulier sur la parole, puis présentons un état de l’art permettant d’identifier les limites actuelles que nous avons cherché à dépasser. Nos contributions se concentrent sur l’exploration de représentations issues de modèles de fondation en parole comme front-end pour l’extraction de caractéristiques, ainsi que sur leur interaction avec des modèles back-end à l’état de l’art afin d’apprendre à distinguer les signaux authentiques des spoofings. Enfin, nous simplifions la chaîne de traitement en réduisant la taille du back-end tout en obtenant de meilleures performances que des modèles de plus grande capacité. Nous concluons par une synthèse de nos travaux et de nos résultats, avant de proposer des perspectives permettant de repousser les limites rencontrées au cours de cette thèse.

Résumé (anglais) : Our work focuses on developing deep learning models for vocal spoofing detection, with the objective of enhancing speaker verification and preventing identity impersonation. We first introduce the research domain in which this thesis is situated, with a particular emphasis on speech, and then provide a literature review to identify current limitations that we aim to address. Our contributions revolve around exploring speech foundation models as front-end feature extractors and investigating their interaction with state-of-the-art back-end models to effectively learn discriminative representations for detecting spoofed audio. Finally, we streamline the processing pipeline by reducing the size of the back-end while surpassing the performance of larger models. We conclude with an overview of our findings and propose future research directions to push beyond the limitations encountered throughout this thesis.

Identifiant : rennes1-ori-wf-1-22323
Exporter au format XML