Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jung, Youngmoon, Lee, Yong-Hyeok, Jung, Myunghun, Roh, Jaeyoung, Han, Chang Woo, Cho, Hoon-Young |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MATE: Matryoshka Audio-Text Embeddings for Open-Vocabulary Keyword Spotting
par: Jung, Youngmoon, et autres
Publié: (2026)
par: Jung, Youngmoon, et autres
Publié: (2026)
Text-Aware Adapter for Few-Shot Keyword Spotting
par: Jung, Youngmoon, et autres
Publié: (2024)
par: Jung, Youngmoon, et autres
Publié: (2024)
Relational Proxy Loss for Audio-Text based Keyword Spotting
par: Jung, Youngmoon, et autres
Publié: (2024)
par: Jung, Youngmoon, et autres
Publié: (2024)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
par: Jin, Sichen, et autres
Publié: (2024)
par: Jin, Sichen, et autres
Publié: (2024)
Triage knowledge distillation for speaker verification
par: Kim, Ju-ho, et autres
Publié: (2026)
par: Kim, Ju-ho, et autres
Publié: (2026)
DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification
par: Jung, Youngmoon, et autres
Publié: (2026)
par: Jung, Youngmoon, et autres
Publié: (2026)
Bridging the Gap between Audio and Text using Parallel-attention for User-defined Keyword Spotting
par: Kim, Youkyum, et autres
Publié: (2024)
par: Kim, Youkyum, et autres
Publié: (2024)
Maximum-Entropy Adversarial Audio Augmentation for Keyword Spotting
par: Ye, Zuzhao, et autres
Publié: (2024)
par: Ye, Zuzhao, et autres
Publié: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
Text-aware Speech Separation for Multi-talker Keyword Spotting
par: Li, Haoyu, et autres
Publié: (2024)
par: Li, Haoyu, et autres
Publié: (2024)
Probing Cross-modal Information Hubs in Audio-Visual LLMs
par: Jung, Jihoo, et autres
Publié: (2026)
par: Jung, Jihoo, et autres
Publié: (2026)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Dark Experience for Incremental Keyword Spotting
par: Peng, Tianyi, et autres
Publié: (2024)
par: Peng, Tianyi, et autres
Publié: (2024)
Streaming Keyword Spotting Boosted by Cross-layer Discrimination Consistency
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
PCOV-KWS: Multi-task Learning for Personalized Customizable Open Vocabulary Keyword Spotting
par: Pan, Jianan, et autres
Publié: (2026)
par: Pan, Jianan, et autres
Publié: (2026)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
par: Ding, Hanyu, et autres
Publié: (2025)
par: Ding, Hanyu, et autres
Publié: (2025)
RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
par: Lee, Yongjoon, et autres
Publié: (2026)
par: Lee, Yongjoon, et autres
Publié: (2026)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
Effective Integration of KAN for Keyword Spotting
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
Multichannel Keyword Spotting for Noisy Conditions
par: Saladukha, Dzmitry, et autres
Publié: (2025)
par: Saladukha, Dzmitry, et autres
Publié: (2025)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
par: Lee, Dongheon, et autres
Publié: (2024)
par: Lee, Dongheon, et autres
Publié: (2024)
Adversarial training of Keyword Spotting to Minimize TTS Data Overfitting
par: Park, Hyun Jin, et autres
Publié: (2024)
par: Park, Hyun Jin, et autres
Publié: (2024)
Disentangled Training with Adversarial Examples For Robust Small-footprint Keyword Spotting
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
EveGuard: Defeating Vibration-based Side-Channel Eavesdropping with Audio Adversarial Perturbations
par: Chang, Jung-Woo, et autres
Publié: (2024)
par: Chang, Jung-Woo, et autres
Publié: (2024)
Self-Learning for Personalized Keyword Spotting on Ultra-Low-Power Audio Sensors
par: Rusci, Manuele, et autres
Publié: (2024)
par: Rusci, Manuele, et autres
Publié: (2024)
BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification
par: Kim, June-Woo, et autres
Publié: (2024)
par: Kim, June-Woo, et autres
Publié: (2024)
ImKWS: Test-Time Adaptation for Keyword Spotting with Class Imbalance
par: Ding, Hanyu, et autres
Publié: (2026)
par: Ding, Hanyu, et autres
Publié: (2026)
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
End-to-End Direction-Aware Keyword Spotting with Spatial Priors in Noisy Environments
par: Wang, Rui, et autres
Publié: (2026)
par: Wang, Rui, et autres
Publié: (2026)
NTC-KWS: Noise-aware CTC for Robust Keyword Spotting
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Robust Dual-Modal Speech Keyword Spotting for XR Headsets
par: Cai, Zhuojiang, et autres
Publié: (2024)
par: Cai, Zhuojiang, et autres
Publié: (2024)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
Sparse Binarization for Fast Keyword Spotting
par: Svirsky, Jonathan, et autres
Publié: (2024)
par: Svirsky, Jonathan, et autres
Publié: (2024)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
par: Ren, Yong, et autres
Publié: (2026)
par: Ren, Yong, et autres
Publié: (2026)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
Multiple-Instance, Cascaded Classification for Keyword Spotting in Narrow-Band Audio
par: AbdulKader, Ahmad, et autres
Publié: (2017)
par: AbdulKader, Ahmad, et autres
Publié: (2017)
SLiCK: Exploiting Subsequences for Length-Constrained Keyword Spotting
par: Nishu, Kumari, et autres
Publié: (2024)
par: Nishu, Kumari, et autres
Publié: (2024)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
par: Wang, Haoxu, et autres
Publié: (2024)
par: Wang, Haoxu, et autres
Publié: (2024)
AdaKWS: Towards Robust Keyword Spotting with Test-Time Adaptation
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Documents similaires
-
MATE: Matryoshka Audio-Text Embeddings for Open-Vocabulary Keyword Spotting
par: Jung, Youngmoon, et autres
Publié: (2026) -
Text-Aware Adapter for Few-Shot Keyword Spotting
par: Jung, Youngmoon, et autres
Publié: (2024) -
Relational Proxy Loss for Audio-Text based Keyword Spotting
par: Jung, Youngmoon, et autres
Publié: (2024) -
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
par: Jin, Sichen, et autres
Publié: (2024) -
Triage knowledge distillation for speaker verification
par: Kim, Ju-ho, et autres
Publié: (2026)