Relational Proxy Loss for Audio-Text based Keyword Spotting
Fuente:
arXiv
Salvato in:
| Autori principali: | Jung, Youngmoon, Lee, Seungjin, Yang, Joon-Young, Roh, Jaeyoung, Han, Chang Woo, Cho, Hoon-Young |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Text-Aware Adapter for Few-Shot Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
MATE: Matryoshka Audio-Text Embeddings for Open-Vocabulary Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2025)
di: Jung, Youngmoon, et al.
Pubblicazione: (2025)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
di: Jin, Sichen, et al.
Pubblicazione: (2024)
di: Jin, Sichen, et al.
Pubblicazione: (2024)
Triage knowledge distillation for speaker verification
di: Kim, Ju-ho, et al.
Pubblicazione: (2026)
di: Kim, Ju-ho, et al.
Pubblicazione: (2026)
DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
SLiCK: Exploiting Subsequences for Length-Constrained Keyword Spotting
di: Nishu, Kumari, et al.
Pubblicazione: (2024)
di: Nishu, Kumari, et al.
Pubblicazione: (2024)
Bridging the Gap between Audio and Text using Parallel-attention for User-defined Keyword Spotting
di: Kim, Youkyum, et al.
Pubblicazione: (2024)
di: Kim, Youkyum, et al.
Pubblicazione: (2024)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
di: Lee, Dongheon, et al.
Pubblicazione: (2023)
di: Lee, Dongheon, et al.
Pubblicazione: (2023)
Maximum-Entropy Adversarial Audio Augmentation for Keyword Spotting
di: Ye, Zuzhao, et al.
Pubblicazione: (2024)
di: Ye, Zuzhao, et al.
Pubblicazione: (2024)
EchoScan: Scanning Complex Room Geometries via Acoustic Echoes
di: Yeon, Inmo, et al.
Pubblicazione: (2023)
di: Yeon, Inmo, et al.
Pubblicazione: (2023)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
di: Kwon, Younghoo, et al.
Pubblicazione: (2024)
di: Kwon, Younghoo, et al.
Pubblicazione: (2024)
SoundSpring: Loss-Resilient Audio Transceiver with Dual-Functional Masked Language Modeling
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
Speech Boosting: Low-Latency Live Speech Enhancement for TWS Earbuds
di: Bae, Hanbin, et al.
Pubblicazione: (2024)
di: Bae, Hanbin, et al.
Pubblicazione: (2024)
FlowSE: Flow Matching-based Speech Enhancement
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
Speech Enhancement based on cascaded two flows
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion
di: Lim, DongHoon, et al.
Pubblicazione: (2025)
di: Lim, DongHoon, et al.
Pubblicazione: (2025)
SUNAC: Source-aware Unified Neural Audio Codec
di: Aihara, Ryo, et al.
Pubblicazione: (2025)
di: Aihara, Ryo, et al.
Pubblicazione: (2025)
Detection of manatee vocalisations using the Audio Spectrogram Transformer
di: Schiappacasse, Stefano, et al.
Pubblicazione: (2024)
di: Schiappacasse, Stefano, et al.
Pubblicazione: (2024)
Exploring Audio-Visual Information Fusion for Sound Event Localization and Detection In Low-Resource Realistic Scenarios
di: Jiang, Ya, et al.
Pubblicazione: (2024)
di: Jiang, Ya, et al.
Pubblicazione: (2024)
Text-aware Speech Separation for Multi-talker Keyword Spotting
di: Li, Haoyu, et al.
Pubblicazione: (2024)
di: Li, Haoyu, et al.
Pubblicazione: (2024)
String Sound Synthesizer on GPU-accelerated Finite Difference Scheme
di: Lee, Jin Woo, et al.
Pubblicazione: (2023)
di: Lee, Jin Woo, et al.
Pubblicazione: (2023)
Benchmarking Audio Deepfake Detection Robustness in Real-world Communication Scenarios
di: Shi, Haohan, et al.
Pubblicazione: (2025)
di: Shi, Haohan, et al.
Pubblicazione: (2025)
Perceptually-motivated Spatial Audio Codec for Higher-Order Ambisonics Compression
di: Hold, Christoph, et al.
Pubblicazione: (2024)
di: Hold, Christoph, et al.
Pubblicazione: (2024)
Robust Fixed-Filter Sound Zone Control with Audio-Based Position Tracking
di: Bhattacharjee, Sankha Subhra, et al.
Pubblicazione: (2024)
di: Bhattacharjee, Sankha Subhra, et al.
Pubblicazione: (2024)
Generative AI in Signal Processing Education: An Audio Foundation Model Based Approach
di: Khan, Muhammad Salman, et al.
Pubblicazione: (2026)
di: Khan, Muhammad Salman, et al.
Pubblicazione: (2026)
Zero-Bit Transmission of Adaptive Pre- and De-emphasis Filters for Speech and Audio Coding
di: Piralideh, Niloofar Omidi, et al.
Pubblicazione: (2024)
di: Piralideh, Niloofar Omidi, et al.
Pubblicazione: (2024)
Target Speaker Selection for Neural Network Beamforming in Multi-Speaker Scenarios
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2025)
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2025)
An Explainable Proxy Model for Multiabel Audio Segmentation
di: Mariotte, Théo, et al.
Pubblicazione: (2024)
di: Mariotte, Théo, et al.
Pubblicazione: (2024)
JenGAN: Stacked Shifted Filters in GAN-Based Speech Synthesis
di: Cho, Hyunjae, et al.
Pubblicazione: (2024)
di: Cho, Hyunjae, et al.
Pubblicazione: (2024)
FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
An Adaptive X-vector Model for Text-independent Speaker Verification
di: Gu, Bin, et al.
Pubblicazione: (2020)
di: Gu, Bin, et al.
Pubblicazione: (2020)
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
Aliasing-Free Neural Audio Synthesis
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
Dark Experience for Incremental Keyword Spotting
di: Peng, Tianyi, et al.
Pubblicazione: (2024)
di: Peng, Tianyi, et al.
Pubblicazione: (2024)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
di: Liao, Yuan, et al.
Pubblicazione: (2025)
di: Liao, Yuan, et al.
Pubblicazione: (2025)
HOMULA-RIR: A Room Impulse Response Dataset for Teleconferencing and Spatial Audio Applications Acquired Through Higher-Order Microphones and Uniform Linear Microphone Arrays
di: Miotello, Federico, et al.
Pubblicazione: (2024)
di: Miotello, Federico, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Text-Aware Adapter for Few-Shot Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024) -
MATE: Matryoshka Audio-Text Embeddings for Open-Vocabulary Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2026) -
Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2025) -
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
di: Jin, Sichen, et al.
Pubblicazione: (2024) -
Triage knowledge distillation for speaker verification
di: Kim, Ju-ho, et al.
Pubblicazione: (2026)