DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification
Fuente:
arXiv
Guardado en:
| Autores principales: | Jung, Youngmoon, Yang, Joon-Young, Kim, Ju-ho, Roh, Jaeyoung, Han, Chang Woo, Cho, Hoon-Young |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Triage knowledge distillation for speaker verification
por: Kim, Ju-ho, et al.
Publicado: (2026)
por: Kim, Ju-ho, et al.
Publicado: (2026)
MATE: Matryoshka Audio-Text Embeddings for Open-Vocabulary Keyword Spotting
por: Jung, Youngmoon, et al.
Publicado: (2026)
por: Jung, Youngmoon, et al.
Publicado: (2026)
Relational Proxy Loss for Audio-Text based Keyword Spotting
por: Jung, Youngmoon, et al.
Publicado: (2024)
por: Jung, Youngmoon, et al.
Publicado: (2024)
Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting
por: Jung, Youngmoon, et al.
Publicado: (2025)
por: Jung, Youngmoon, et al.
Publicado: (2025)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
por: Jin, Sichen, et al.
Publicado: (2024)
por: Jin, Sichen, et al.
Publicado: (2024)
Text-Aware Adapter for Few-Shot Keyword Spotting
por: Jung, Youngmoon, et al.
Publicado: (2024)
por: Jung, Youngmoon, et al.
Publicado: (2024)
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
Trainable Adaptive Score Normalization for Automatic Speaker Verification
por: Choi, Jeong-Hwan, et al.
Publicado: (2025)
por: Choi, Jeong-Hwan, et al.
Publicado: (2025)
M-Vec: Matryoshka Speaker Embeddings with Flexible Dimensions
por: Wang, Shuai, et al.
Publicado: (2024)
por: Wang, Shuai, et al.
Publicado: (2024)
ERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency
por: Chen, Yafeng, et al.
Publicado: (2024)
por: Chen, Yafeng, et al.
Publicado: (2024)
Phone Duration Modeling for Speaker Age Estimation in Children
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2021)
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2021)
Spoofing-Aware Speaker Verification Robust Against Domain and Channel Mismatches
por: Zeng, Chang, et al.
Publicado: (2024)
por: Zeng, Chang, et al.
Publicado: (2024)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
por: Meng, Qingliang, et al.
Publicado: (2025)
por: Meng, Qingliang, et al.
Publicado: (2025)
NeXt-TDNN: Modernizing Multi-Scale Temporal Convolution Backbone for Speaker Verification
por: Heo, Hyun-Jun, et al.
Publicado: (2023)
por: Heo, Hyun-Jun, et al.
Publicado: (2023)
Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages
por: Pandey, Isha, et al.
Publicado: (2025)
por: Pandey, Isha, et al.
Publicado: (2025)
An Age-Agnostic System for Robust Speaker Verification
por: Zheng, Jiusi, et al.
Publicado: (2025)
por: Zheng, Jiusi, et al.
Publicado: (2025)
Joint Optimization of Speaker and Spoof Detectors for Spoofing-Robust Automatic Speaker Verification
por: Kurnaz, Oğuzhan, et al.
Publicado: (2025)
por: Kurnaz, Oğuzhan, et al.
Publicado: (2025)
Naturalness-Aware Curriculum Learning with Dynamic Temperature for Speech Deepfake Detection
por: Kim, Taewoo, et al.
Publicado: (2025)
por: Kim, Taewoo, et al.
Publicado: (2025)
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
Optimizing a-DCF for Spoofing-Robust Speaker Verification
por: Kurnaz, Oğuzhan, et al.
Publicado: (2024)
por: Kurnaz, Oğuzhan, et al.
Publicado: (2024)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
por: Fujita, Kenichi, et al.
Publicado: (2024)
por: Fujita, Kenichi, et al.
Publicado: (2024)
SEED: Speaker Embedding Enhancement Diffusion Model
por: Nam, KiHyun, et al.
Publicado: (2025)
por: Nam, KiHyun, et al.
Publicado: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
por: Peng, Puyuan, et al.
Publicado: (2025)
por: Peng, Puyuan, et al.
Publicado: (2025)
Short-Segment Speaker Verification with Pre-trained Models and Multi-Resolution Encoder
por: Myoung, Jisoo, et al.
Publicado: (2025)
por: Myoung, Jisoo, et al.
Publicado: (2025)
Adversarial Reweighting for Speaker Verification Fairness
por: Jin, Minho, et al.
Publicado: (2022)
por: Jin, Minho, et al.
Publicado: (2022)
DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment
por: Oh, Hyung-Seok, et al.
Publicado: (2024)
por: Oh, Hyung-Seok, et al.
Publicado: (2024)
Enhancing In-the-Wild Speech Emotion Conversion with Resynthesis-based Duration Modeling
por: Prabhu, Navin Raj, et al.
Publicado: (2025)
por: Prabhu, Navin Raj, et al.
Publicado: (2025)
Spectral-Aware Low-Rank Adaptation for Speaker Verification
por: Li, Zhe, et al.
Publicado: (2025)
por: Li, Zhe, et al.
Publicado: (2025)
Investigating the Potential of Multi-Stage Score Fusion in Spoofing-Aware Speaker Verification
por: Kurnaz, Oguzhan, et al.
Publicado: (2025)
por: Kurnaz, Oguzhan, et al.
Publicado: (2025)
Robust Training for Speaker Verification against Noisy Labels
por: Fang, Zhihua, et al.
Publicado: (2022)
por: Fang, Zhihua, et al.
Publicado: (2022)
Enhancing Age-Related Robustness in Children Speaker Verification
por: Shetty, Vishwas M., et al.
Publicado: (2025)
por: Shetty, Vishwas M., et al.
Publicado: (2025)
PadAug: Robust Speaker Verification with Simple Waveform-Level Silence Padding
por: Huang, Zijun, et al.
Publicado: (2025)
por: Huang, Zijun, et al.
Publicado: (2025)
Asymmetric Clean Segments-Guided Self-Supervised Learning for Robust Speaker Verification
por: Gan, Chong-Xin, et al.
Publicado: (2023)
por: Gan, Chong-Xin, et al.
Publicado: (2023)
DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis
por: Li, Yinghao Aaron, et al.
Publicado: (2025)
por: Li, Yinghao Aaron, et al.
Publicado: (2025)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
por: Jung, Chaeyoung, et al.
Publicado: (2025)
por: Jung, Chaeyoung, et al.
Publicado: (2025)
The Overview of Segmental Durations Modification Algorithms on Speech Signal Characteristics
por: Jang, Kyeomeun, et al.
Publicado: (2025)
por: Jang, Kyeomeun, et al.
Publicado: (2025)
Period Singer: Integrating Periodic and Aperiodic Variational Autoencoders for Natural-Sounding End-to-End Singing Voice Synthesis
por: Kim, Taewoo, et al.
Publicado: (2024)
por: Kim, Taewoo, et al.
Publicado: (2024)
Xi+: Uncertainty Supervision for Robust Speaker Embedding
por: Li, Junjie, et al.
Publicado: (2025)
por: Li, Junjie, et al.
Publicado: (2025)
A Probabilistic Fusion Framework for Spoofing Aware Speaker Verification
por: Zhang, You, et al.
Publicado: (2022)
por: Zhang, You, et al.
Publicado: (2022)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
Ejemplares similares
-
Triage knowledge distillation for speaker verification
por: Kim, Ju-ho, et al.
Publicado: (2026) -
MATE: Matryoshka Audio-Text Embeddings for Open-Vocabulary Keyword Spotting
por: Jung, Youngmoon, et al.
Publicado: (2026) -
Relational Proxy Loss for Audio-Text based Keyword Spotting
por: Jung, Youngmoon, et al.
Publicado: (2024) -
Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting
por: Jung, Youngmoon, et al.
Publicado: (2025) -
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
por: Jin, Sichen, et al.
Publicado: (2024)