MATE: Matryoshka Audio-Text Embeddings for Open-Vocabulary Keyword Spotting
Fuente:
arXiv
Salvato in:
| Autori principali: | Jung, Youngmoon, Jung, Myunghun, Yang, Joon-Young, Lee, Yong-Hyeok, Roh, Jaeyoung, Cho, Hoon-Young |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2025)
di: Jung, Youngmoon, et al.
Pubblicazione: (2025)
Text-Aware Adapter for Few-Shot Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
Relational Proxy Loss for Audio-Text based Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
di: Jin, Sichen, et al.
Pubblicazione: (2024)
di: Jin, Sichen, et al.
Pubblicazione: (2024)
DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
Triage knowledge distillation for speaker verification
di: Kim, Ju-ho, et al.
Pubblicazione: (2026)
di: Kim, Ju-ho, et al.
Pubblicazione: (2026)
Bridging the Gap between Audio and Text using Parallel-attention for User-defined Keyword Spotting
di: Kim, Youkyum, et al.
Pubblicazione: (2024)
di: Kim, Youkyum, et al.
Pubblicazione: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
Maximum-Entropy Adversarial Audio Augmentation for Keyword Spotting
di: Ye, Zuzhao, et al.
Pubblicazione: (2024)
di: Ye, Zuzhao, et al.
Pubblicazione: (2024)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
Text-aware Speech Separation for Multi-talker Keyword Spotting
di: Li, Haoyu, et al.
Pubblicazione: (2024)
di: Li, Haoyu, et al.
Pubblicazione: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
Probing Cross-modal Information Hubs in Audio-Visual LLMs
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
Dark Experience for Incremental Keyword Spotting
di: Peng, Tianyi, et al.
Pubblicazione: (2024)
di: Peng, Tianyi, et al.
Pubblicazione: (2024)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Effective Integration of KAN for Keyword Spotting
di: Xu, Anfeng, et al.
Pubblicazione: (2024)
di: Xu, Anfeng, et al.
Pubblicazione: (2024)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
di: Ding, Hanyu, et al.
Pubblicazione: (2025)
di: Ding, Hanyu, et al.
Pubblicazione: (2025)
ImKWS: Test-Time Adaptation for Keyword Spotting with Class Imbalance
di: Ding, Hanyu, et al.
Pubblicazione: (2026)
di: Ding, Hanyu, et al.
Pubblicazione: (2026)
Multichannel Keyword Spotting for Noisy Conditions
di: Saladukha, Dzmitry, et al.
Pubblicazione: (2025)
di: Saladukha, Dzmitry, et al.
Pubblicazione: (2025)
High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model
di: Lee, Joun Yeop, et al.
Pubblicazione: (2024)
di: Lee, Joun Yeop, et al.
Pubblicazione: (2024)
PCOV-KWS: Multi-task Learning for Personalized Customizable Open Vocabulary Keyword Spotting
di: Pan, Jianan, et al.
Pubblicazione: (2026)
di: Pan, Jianan, et al.
Pubblicazione: (2026)
MathReader : Text-to-Speech for Mathematical Documents
di: Hyeon, Sieun, et al.
Pubblicazione: (2025)
di: Hyeon, Sieun, et al.
Pubblicazione: (2025)
M-Vec: Matryoshka Speaker Embeddings with Flexible Dimensions
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
AdaKWS: Towards Robust Keyword Spotting with Test-Time Adaptation
di: Xiao, Yang, et al.
Pubblicazione: (2025)
di: Xiao, Yang, et al.
Pubblicazione: (2025)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
di: Wu, Shih-Lun, et al.
Pubblicazione: (2023)
di: Wu, Shih-Lun, et al.
Pubblicazione: (2023)
SLiCK: Exploiting Subsequences for Length-Constrained Keyword Spotting
di: Nishu, Kumari, et al.
Pubblicazione: (2024)
di: Nishu, Kumari, et al.
Pubblicazione: (2024)
End-to-End Direction-Aware Keyword Spotting with Spatial Priors in Noisy Environments
di: Wang, Rui, et al.
Pubblicazione: (2026)
di: Wang, Rui, et al.
Pubblicazione: (2026)
Self-Learning for Personalized Keyword Spotting on Ultra-Low-Power Audio Sensors
di: Rusci, Manuele, et al.
Pubblicazione: (2024)
di: Rusci, Manuele, et al.
Pubblicazione: (2024)
Streaming Keyword Spotting Boosted by Cross-layer Discrimination Consistency
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
NTC-KWS: Noise-aware CTC for Robust Keyword Spotting
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
TDT-KWS: Fast And Accurate Keyword Spotting Using Token-and-duration Transducer
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
SAM: A Mamba-2 State-Space Audio-Language Model
di: Lee, Taehan, et al.
Pubblicazione: (2025)
di: Lee, Taehan, et al.
Pubblicazione: (2025)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
di: Ren, Yong, et al.
Pubblicazione: (2026)
di: Ren, Yong, et al.
Pubblicazione: (2026)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
di: Lee, Dongheon, et al.
Pubblicazione: (2024)
di: Lee, Dongheon, et al.
Pubblicazione: (2024)
Sparse Binarization for Fast Keyword Spotting
di: Svirsky, Jonathan, et al.
Pubblicazione: (2024)
di: Svirsky, Jonathan, et al.
Pubblicazione: (2024)
MALEFA: Multi-grAnularity Learning and Effective False Alarm Suppression for Zero-shot Keyword Spotting
di: Li, Lo-Ya, et al.
Pubblicazione: (2026)
di: Li, Lo-Ya, et al.
Pubblicazione: (2026)
On-Device Domain Learning for Keyword Spotting on Low-Power Extreme Edge Embedded Systems
di: Cioflan, Cristian, et al.
Pubblicazione: (2024)
di: Cioflan, Cristian, et al.
Pubblicazione: (2024)
UNMIXX: Untangling Highly Correlated Singing Voices Mixtures
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding
di: Xi, Yu, et al.
Pubblicazione: (2025)
di: Xi, Yu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2025) -
Text-Aware Adapter for Few-Shot Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024) -
Relational Proxy Loss for Audio-Text based Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024) -
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
di: Jin, Sichen, et al.
Pubblicazione: (2024) -
DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)