Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Thebaud, Thomas, Wang, Yuzhe, Moro-Velazquez, Laureano, Villalba-Lopez, Jesus, Dehak, Najim |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers
par: Cao, Tianyu, et autres
Publié: (2026)
par: Cao, Tianyu, et autres
Publié: (2026)
Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems
par: Joshi, Sonal, et autres
Publié: (2021)
par: Joshi, Sonal, et autres
Publié: (2021)
CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing
par: Lu, Yen-Ju, et autres
Publié: (2024)
par: Lu, Yen-Ju, et autres
Publié: (2024)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
Unraveling Adversarial Examples against Speaker Identification -- Techniques for Attack Detection and Victim Model Classification
par: Joshi, Sonal, et autres
Publié: (2024)
par: Joshi, Sonal, et autres
Publié: (2024)
Paired by the Teacher: Turning Unpaired Data into High-Fidelity Pairs for Low-Resource Text Generation
par: Lu, Yen-Ju, et autres
Publié: (2025)
par: Lu, Yen-Ju, et autres
Publié: (2025)
Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM
par: Thebaud, Thomas, et autres
Publié: (2025)
par: Thebaud, Thomas, et autres
Publié: (2025)
Multi-Target Backdoor Attacks Against Speaker Recognition
par: Fortier, Alexandrine, et autres
Publié: (2025)
par: Fortier, Alexandrine, et autres
Publié: (2025)
MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion With Increased Controllability via Multiple Guidances
par: Lee, Junhyeok, et autres
Publié: (2025)
par: Lee, Junhyeok, et autres
Publié: (2025)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models
par: Fortier, Alexandrine, et autres
Publié: (2025)
par: Fortier, Alexandrine, et autres
Publié: (2025)
Demographic Attributes Prediction from Speech Using WavLM Embeddings
par: Yang, Yuchen, et autres
Publié: (2025)
par: Yang, Yuchen, et autres
Publié: (2025)
Detecting Neurodegenerative Diseases using Frame-Level Handwriting Embeddings
par: Laouedj, Sarah, et autres
Publié: (2025)
par: Laouedj, Sarah, et autres
Publié: (2025)
Noise-robust Speech Separation with Fast Generative Correction
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
SSPS: Self-Supervised Positive Sampling for Robust Self-Supervised Speaker Verification
par: Lepage, Theo, et autres
Publié: (2025)
par: Lepage, Theo, et autres
Publié: (2025)
Reconstruct! Don't Encode: Self-Supervised Representation Reconstruction Loss for High-Intelligibility and Low-Latency Streaming Neural Audio Codec
par: Lee, Junhyeok, et autres
Publié: (2026)
par: Lee, Junhyeok, et autres
Publié: (2026)
ReFESS-QI: Reference-Free Evaluation For Speech Separation With Joint Quality And Intelligibility Scoring
par: Frummer, Ari, et autres
Publié: (2025)
par: Frummer, Ari, et autres
Publié: (2025)
Spoken DialogSum: An Emotion-Rich Conversational Dataset for Spoken Dialogue Summarization
par: Lu, Yen-Ju, et autres
Publié: (2025)
par: Lu, Yen-Ju, et autres
Publié: (2025)
Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech
par: Chaparala, Kaavya, et autres
Publié: (2026)
par: Chaparala, Kaavya, et autres
Publié: (2026)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Enhancing Speaker Verification with Whispered Speech via Post-Processing
par: Gołębiowska, Magdalena, et autres
Publié: (2026)
par: Gołębiowska, Magdalena, et autres
Publié: (2026)
Hyperbolic Additive Margin Softmax with Hierarchical Information for Speaker Verification
par: Fang, Zhihua, et autres
Publié: (2026)
par: Fang, Zhihua, et autres
Publié: (2026)
Robust Target Speaker Diarization and Separation via Augmented Speaker Embedding Sampling
par: Jalal, Md Asif, et autres
Publié: (2025)
par: Jalal, Md Asif, et autres
Publié: (2025)
Rethinking Leveraging Pre-Trained Multi-Layer Representations for Speaker Verification
par: Kim, Jin Sob, et autres
Publié: (2025)
par: Kim, Jin Sob, et autres
Publié: (2025)
SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection
par: Jung, Kyudan, et autres
Publié: (2026)
par: Jung, Kyudan, et autres
Publié: (2026)
Generalizing Speaker Verification for Spoof Awareness in the Embedding Space
par: Liu, Xuechen, et autres
Publié: (2024)
par: Liu, Xuechen, et autres
Publié: (2024)
A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech
par: Huang, Jia-Hong, et autres
Publié: (2026)
par: Huang, Jia-Hong, et autres
Publié: (2026)
Explainable Attribute-Based Speaker Verification
par: Wu, Xiaoliang, et autres
Publié: (2024)
par: Wu, Xiaoliang, et autres
Publié: (2024)
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
par: Liu, Bei, et autres
Publié: (2024)
par: Liu, Bei, et autres
Publié: (2024)
Cross-Corpus and Cross-domain Handwriting Assessment of NeuroDegenerative Diseases via Time-Series-to-Image Conversion
par: Chavez, Gabrielle, et autres
Publié: (2025)
par: Chavez, Gabrielle, et autres
Publié: (2025)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
par: He, Xiluo, et autres
Publié: (2025)
par: He, Xiluo, et autres
Publié: (2025)
Adversarial Attacks and Defenses for Speech Recognition Systems
par: Żelasko, Piotr, et autres
Publié: (2021)
par: Żelasko, Piotr, et autres
Publié: (2021)
An Investigation Into Various Approaches For Bengali Long-Form Speech Transcription and Bengali Speaker Diarization
par: Jahan, Epshita, et autres
Publié: (2026)
par: Jahan, Epshita, et autres
Publié: (2026)
Text-dependent Speaker Verification (TdSV) Challenge 2024: Challenge Evaluation Plan
par: Hossein, Zeinali, et autres
Publié: (2024)
par: Hossein, Zeinali, et autres
Publié: (2024)
Evaluating Identity Leakage in Speaker De-Identification Systems
par: Seo, Seungmin, et autres
Publié: (2025)
par: Seo, Seungmin, et autres
Publié: (2025)
Multimodal characterization of Alzheimer's Disease using speech, eye movement, and handwriting
par: Laureano Moro‐Velazquez, et autres
Publié: (2024)
par: Laureano Moro‐Velazquez, et autres
Publié: (2024)
Multimodal characterization of Alzheimer’s Disease using speech, eye movement, and handwriting
par: Laureano Moro‐Velazquez, et autres
Publié: (2024)
par: Laureano Moro‐Velazquez, et autres
Publié: (2024)
ExPO: Explainable Phonetic Trait-Oriented Network for Speaker Verification
par: Ma, Yi, et autres
Publié: (2025)
par: Ma, Yi, et autres
Publié: (2025)
Anonymizing Speech: Evaluating and Designing Speaker Anonymization Techniques
par: Champion, Pierre
Publié: (2023)
par: Champion, Pierre
Publié: (2023)
Documents similaires
-
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
par: Wang, Helin, et autres
Publié: (2025) -
DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers
par: Cao, Tianyu, et autres
Publié: (2026) -
Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems
par: Joshi, Sonal, et autres
Publié: (2021) -
CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing
par: Lu, Yen-Ju, et autres
Publié: (2024) -
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
par: Wang, Helin, et autres
Publié: (2025)