Evaluating Speaker Identity Coding in Self-supervised Models and Humans
Fuente:
arXiv
Salvato in:
| Autore principale: | Elbanna, Gasser |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Incorporating Talker Identity Aids With Improving Speech Recognition in Adversarial Environments
di: Alavilli, Sagarika, et al.
Pubblicazione: (2024)
di: Alavilli, Sagarika, et al.
Pubblicazione: (2024)
Predicting Heart Activity from Speech using Data-driven and Knowledge-based features
di: Elbanna, Gasser, et al.
Pubblicazione: (2024)
di: Elbanna, Gasser, et al.
Pubblicazione: (2024)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech Representations Using a Simple Linear Equation
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2025)
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2025)
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
Disentangling Age and Identity with a Mutual Information Minimization Approach for Cross-Age Speaker Verification
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
Self-supervised Learning for Acoustic Few-Shot Classification
di: Liang, Jingyong, et al.
Pubblicazione: (2024)
di: Liang, Jingyong, et al.
Pubblicazione: (2024)
Speaker Embeddings to Improve Tracking of Intermittent and Moving Speakers
di: Iatariene, Taous, et al.
Pubblicazione: (2025)
di: Iatariene, Taous, et al.
Pubblicazione: (2025)
Certification of Speaker Recognition Models to Additive Perturbations
di: Korzh, Dmitrii, et al.
Pubblicazione: (2024)
di: Korzh, Dmitrii, et al.
Pubblicazione: (2024)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
di: Liu, Bei, et al.
Pubblicazione: (2024)
di: Liu, Bei, et al.
Pubblicazione: (2024)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
di: Bai, Bingsong, et al.
Pubblicazione: (2024)
di: Bai, Bingsong, et al.
Pubblicazione: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
Text-dependent Speaker Verification (TdSV) Challenge 2024: Challenge Evaluation Plan
di: Hossein, Zeinali, et al.
Pubblicazione: (2024)
di: Hossein, Zeinali, et al.
Pubblicazione: (2024)
Deep Learning for Speaker Identification: Architectural Insights from AB-1 Corpus Analysis and Performance Evaluation
di: Bartolo, Matthias
Pubblicazione: (2024)
di: Bartolo, Matthias
Pubblicazione: (2024)
Explainable Attribute-Based Speaker Verification
di: Wu, Xiaoliang, et al.
Pubblicazione: (2024)
di: Wu, Xiaoliang, et al.
Pubblicazione: (2024)
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
di: Palzer, David, et al.
Pubblicazione: (2025)
di: Palzer, David, et al.
Pubblicazione: (2025)
DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
di: Cho, Deok-Hyeon, et al.
Pubblicazione: (2025)
di: Cho, Deok-Hyeon, et al.
Pubblicazione: (2025)
Egocentric Speaker Classification in Child-Adult Dyadic Interactions: From Sensing to Computational Modeling
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
From Modular to End-to-End Speaker Diarization
di: Landini, Federico
Pubblicazione: (2024)
di: Landini, Federico
Pubblicazione: (2024)
The VoxCeleb Speaker Recognition Challenge: A Retrospective
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
SDBench: A Comprehensive Benchmark Suite for Speaker Diarization
di: Pacheco, Eduardo, et al.
Pubblicazione: (2025)
di: Pacheco, Eduardo, et al.
Pubblicazione: (2025)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
di: Singh, Prachi, et al.
Pubblicazione: (2024)
di: Singh, Prachi, et al.
Pubblicazione: (2024)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
di: Wang, Rui, et al.
Pubblicazione: (2024)
di: Wang, Rui, et al.
Pubblicazione: (2024)
Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention
di: De Silva, Dashanka, et al.
Pubblicazione: (2024)
di: De Silva, Dashanka, et al.
Pubblicazione: (2024)
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
di: Mariotte, Theo, et al.
Pubblicazione: (2024)
di: Mariotte, Theo, et al.
Pubblicazione: (2024)
ExPO: Explainable Phonetic Trait-Oriented Network for Speaker Verification
di: Ma, Yi, et al.
Pubblicazione: (2025)
di: Ma, Yi, et al.
Pubblicazione: (2025)
Multi-Speaker Conversational Audio Deepfake: Taxonomy, Dataset and Pilot Study
di: Ahmed, Alabi, et al.
Pubblicazione: (2026)
di: Ahmed, Alabi, et al.
Pubblicazione: (2026)
SCDNet: Self-supervised Learning Feature-based Speaker Change Detection
di: Li, Yue, et al.
Pubblicazione: (2024)
di: Li, Yue, et al.
Pubblicazione: (2024)
Aligning Text-to-Music Evaluation with Human Preferences
di: Huang, Yichen, et al.
Pubblicazione: (2025)
di: Huang, Yichen, et al.
Pubblicazione: (2025)
Perceiver-Prompt: Flexible Speaker Adaptation in Whisper for Chinese Disordered Speech Recognition
di: Jiang, Yicong, et al.
Pubblicazione: (2024)
di: Jiang, Yicong, et al.
Pubblicazione: (2024)
Quranic Audio Dataset: Crowdsourced and Labeled Recitation from Non-Arabic Speakers
di: Salameh, Raghad, et al.
Pubblicazione: (2024)
di: Salameh, Raghad, et al.
Pubblicazione: (2024)
ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
di: Wang, Kexue, et al.
Pubblicazione: (2026)
di: Wang, Kexue, et al.
Pubblicazione: (2026)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
di: Xu, Shitong, et al.
Pubblicazione: (2025)
di: Xu, Shitong, et al.
Pubblicazione: (2025)
Who is Authentic Speaker
di: Huang, Qiang
Pubblicazione: (2024)
di: Huang, Qiang
Pubblicazione: (2024)
Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation
di: Lee, Jaejun, et al.
Pubblicazione: (2025)
di: Lee, Jaejun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Incorporating Talker Identity Aids With Improving Speech Recognition in Adversarial Environments
di: Alavilli, Sagarika, et al.
Pubblicazione: (2024) -
Predicting Heart Activity from Speech using Data-driven and Knowledge-based features
di: Elbanna, Gasser, et al.
Pubblicazione: (2024) -
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024) -
Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech Representations Using a Simple Linear Equation
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2025) -
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
di: Kim, Taesoo, et al.
Pubblicazione: (2025)