Layer-aware TDNN: Speaker Recognition Using Multi-Layer Features from Pre-Trained Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Jin Sob, Park, Hyun Joon, Shin, Wooseok, Yun, Juan, Han, Sung Won |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DEX-TTS: Diffusion-based EXpressive Text-to-Speech with Style Modeling on Time Variability
di: Park, Hyun Joon, et al.
Pubblicazione: (2024)
di: Park, Hyun Joon, et al.
Pubblicazione: (2024)
Rethinking Leveraging Pre-Trained Multi-Layer Representations for Speaker Verification
di: Kim, Jin Sob, et al.
Pubblicazione: (2025)
di: Kim, Jin Sob, et al.
Pubblicazione: (2025)
NeXt-TDNN: Modernizing Multi-Scale Temporal Convolution Backbone for Speaker Verification
di: Heo, Hyun-Jun, et al.
Pubblicazione: (2023)
di: Heo, Hyun-Jun, et al.
Pubblicazione: (2023)
MGFF-TDNN: A Multi-Granularity Feature Fusion TDNN Model with Depth-Wise Separable Module for Speaker Verification
di: Li, Ya, et al.
Pubblicazione: (2025)
di: Li, Ya, et al.
Pubblicazione: (2025)
RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)
Short-Segment Speaker Verification with Pre-trained Models and Multi-Resolution Encoder
di: Myoung, Jisoo, et al.
Pubblicazione: (2025)
di: Myoung, Jisoo, et al.
Pubblicazione: (2025)
Infant Cry Emotion Recognition Using Improved ECAPA-TDNN with Multiscale Feature Fusion and Attention Enhancement
di: Zhou, Junyu, et al.
Pubblicazione: (2025)
di: Zhou, Junyu, et al.
Pubblicazione: (2025)
Effective Modeling of Critical Contextual Information for TDNN-based Speaker Verification
di: Weng, Shilong, et al.
Pubblicazione: (2025)
di: Weng, Shilong, et al.
Pubblicazione: (2025)
An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
di: Nam, KiHyun, et al.
Pubblicazione: (2024)
di: Nam, KiHyun, et al.
Pubblicazione: (2024)
LG Uplus System with Multi-Speaker IDs and Discriminator-based Sub-Judges for the WildSpoof Challenge
di: Park, Jinyoung, et al.
Pubblicazione: (2025)
di: Park, Jinyoung, et al.
Pubblicazione: (2025)
FUN-SSL: Full-band Layer Followed by U-Net with Narrow-band Layers for Multiple Moving Sound Source Localization
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
di: Han, Wooseok, et al.
Pubblicazione: (2024)
di: Han, Wooseok, et al.
Pubblicazione: (2024)
Deep Filter Estimation from Inter-Frame Correlations for Monaural Speech Dereverberation
di: Shin, Ui-Hyeop, et al.
Pubblicazione: (2026)
di: Shin, Ui-Hyeop, et al.
Pubblicazione: (2026)
LightCAM: A Fast and Light Implementation of Context-Aware Masking based D-TDNN for Speaker Verification
di: Cao, Di, et al.
Pubblicazione: (2024)
di: Cao, Di, et al.
Pubblicazione: (2024)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
di: Park, Nohil, et al.
Pubblicazione: (2024)
di: Park, Nohil, et al.
Pubblicazione: (2024)
Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
di: Li, Haoyu, et al.
Pubblicazione: (2025)
di: Li, Haoyu, et al.
Pubblicazione: (2025)
SEED: Speaker Embedding Enhancement Diffusion Model
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment
di: Shao, Yiwen, et al.
Pubblicazione: (2024)
di: Shao, Yiwen, et al.
Pubblicazione: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
di: Li, Guinan, et al.
Pubblicazione: (2024)
di: Li, Guinan, et al.
Pubblicazione: (2024)
Study on Inter and Intra Speaker Variability in Speaker Recognition
di: Okhotnikov, Anton, et al.
Pubblicazione: (2024)
di: Okhotnikov, Anton, et al.
Pubblicazione: (2024)
MR-RawNet: Speaker verification system with multiple temporal resolutions for variable duration utterances using raw waveforms
di: Kim, Seung-bin, et al.
Pubblicazione: (2024)
di: Kim, Seung-bin, et al.
Pubblicazione: (2024)
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Multi-View Based Audio Visual Target Speaker Extraction
di: Yang, Peijun, et al.
Pubblicazione: (2026)
di: Yang, Peijun, et al.
Pubblicazione: (2026)
SV-Mixer: Replacing the Transformer Encoder with Lightweight MLPs for Self-Supervised Model Compression in Speaker Verification
di: Heo, Jungwoo, et al.
Pubblicazione: (2025)
di: Heo, Jungwoo, et al.
Pubblicazione: (2025)
Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS
di: Aronowitz, Hagai, et al.
Pubblicazione: (2026)
di: Aronowitz, Hagai, et al.
Pubblicazione: (2026)
Rhythm Features for Speaker Identification
di: Mehlman, Nick, et al.
Pubblicazione: (2025)
di: Mehlman, Nick, et al.
Pubblicazione: (2025)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
FADEL: Uncertainty-aware Fake Audio Detection with Evidential Deep Learning
di: Kang, Ju Yeon, et al.
Pubblicazione: (2025)
di: Kang, Ju Yeon, et al.
Pubblicazione: (2025)
Reshape Dimensions Network for Speaker Recognition
di: Yakovlev, Ivan, et al.
Pubblicazione: (2024)
di: Yakovlev, Ivan, et al.
Pubblicazione: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
On the Role of Spatial Features in Foundation-Model-Based Speaker Diarization
di: Deegen, Marc, et al.
Pubblicazione: (2026)
di: Deegen, Marc, et al.
Pubblicazione: (2026)
DNN based HRIRs Identification with a Continuously Rotating Speaker Array
di: Ko, Byeong-Yun, et al.
Pubblicazione: (2025)
di: Ko, Byeong-Yun, et al.
Pubblicazione: (2025)
An Effective Energy Mask-based Adversarial Evasion Attacks against Misclassification in Speaker Recognition Systems
di: Park, Chanwoo, et al.
Pubblicazione: (2026)
di: Park, Chanwoo, et al.
Pubblicazione: (2026)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
di: Sakuma, Asahi, et al.
Pubblicazione: (2025)
di: Sakuma, Asahi, et al.
Pubblicazione: (2025)
Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems
di: Joshi, Sonal, et al.
Pubblicazione: (2021)
di: Joshi, Sonal, et al.
Pubblicazione: (2021)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
di: Lin, Yuke, et al.
Pubblicazione: (2025)
di: Lin, Yuke, et al.
Pubblicazione: (2025)
Multi-Label Training for Text-Independent Speaker Identification
di: Xue, Yuqi
Pubblicazione: (2022)
di: Xue, Yuqi
Pubblicazione: (2022)
Documenti analoghi
-
DEX-TTS: Diffusion-based EXpressive Text-to-Speech with Style Modeling on Time Variability
di: Park, Hyun Joon, et al.
Pubblicazione: (2024) -
Rethinking Leveraging Pre-Trained Multi-Layer Representations for Speaker Verification
di: Kim, Jin Sob, et al.
Pubblicazione: (2025) -
NeXt-TDNN: Modernizing Multi-Scale Temporal Convolution Backbone for Speaker Verification
di: Heo, Hyun-Jun, et al.
Pubblicazione: (2023) -
MGFF-TDNN: A Multi-Granularity Feature Fusion TDNN Model with Depth-Wise Separable Module for Speaker Verification
di: Li, Ya, et al.
Pubblicazione: (2025) -
RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)