Multi-Sample Dynamic Time Warping for Few-Shot Keyword Spotting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wilkinghoff, Kevin, Cornaggia-Urrigshardt, Alessia |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quantization-Based Score Calibration for Few-Shot Keyword Spotting with Dynamic Time Warping in Noisy Environments
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
AdaProj: Adaptively Scaled Angular Margin Subspace Projections for Anomalous Sound Detection with Auxiliary Classification Tasks
par: Wilkinghoff, Kevin
Publié: (2024)
par: Wilkinghoff, Kevin
Publié: (2024)
Automatic Estimation of Singing Voice Musical Dynamics
par: Narang, Jyoti, et autres
Publié: (2024)
par: Narang, Jyoti, et autres
Publié: (2024)
Personalized Dynamic Music Emotion Recognition with Dual-Scale Attention-Based Meta-Learning
par: Zhang, Dengming, et autres
Publié: (2024)
par: Zhang, Dengming, et autres
Publié: (2024)
EdgeSpot: Efficient and High-Performance Few-Shot Model for Keyword Spotting
par: Buyuksolak, Oguzhan, et autres
Publié: (2026)
par: Buyuksolak, Oguzhan, et autres
Publié: (2026)
Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning
par: Pan, Xiaofeng, et autres
Publié: (2025)
par: Pan, Xiaofeng, et autres
Publié: (2025)
Exploring Diverse Sounds: Identifying Outliers in a Music Corpus
par: Cai, Le, et autres
Publié: (2024)
par: Cai, Le, et autres
Publié: (2024)
Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models
par: Doh, SeungHeon, et autres
Publié: (2024)
par: Doh, SeungHeon, et autres
Publié: (2024)
Track Role Prediction of Single-Instrumental Sequences
par: Han, Changheon, et autres
Publié: (2024)
par: Han, Changheon, et autres
Publié: (2024)
LARP: Language Audio Relational Pre-training for Cold-Start Playlist Continuation
par: Salganik, Rebecca, et autres
Publié: (2024)
par: Salganik, Rebecca, et autres
Publié: (2024)
Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings
par: Chowdhury, Shreyan, et autres
Publié: (2024)
par: Chowdhury, Shreyan, et autres
Publié: (2024)
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
par: Xin, Yifei, et autres
Publié: (2024)
par: Xin, Yifei, et autres
Publié: (2024)
Language-based Audio Retrieval with Co-Attention Networks
par: Sun, Haoran, et autres
Publié: (2024)
par: Sun, Haoran, et autres
Publié: (2024)
Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
par: Wang, Qian, et autres
Publié: (2024)
par: Wang, Qian, et autres
Publié: (2024)
Do Captioning Metrics Reflect Music Semantic Alignment?
par: Lee, Jinwoo, et autres
Publié: (2024)
par: Lee, Jinwoo, et autres
Publié: (2024)
A SOUND APPROACH: Using Large Language Models to generate audio descriptions for egocentric text-audio retrieval
par: Oncescu, Andreea-Maria, et autres
Publié: (2024)
par: Oncescu, Andreea-Maria, et autres
Publié: (2024)
Engraving Oriented Joint Estimation of Pitch Spelling and Local and Global Keys
par: Bouquillard, Augustin, et autres
Publié: (2024)
par: Bouquillard, Augustin, et autres
Publié: (2024)
Towards Computational Analysis of Pansori Singing
par: Park, Sangheon, et autres
Publié: (2024)
par: Park, Sangheon, et autres
Publié: (2024)
VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering
par: Rackauckas, Zackary, et autres
Publié: (2025)
par: Rackauckas, Zackary, et autres
Publié: (2025)
Exploring GPT's Ability as a Judge in Music Understanding
par: Fang, Kun, et autres
Publié: (2025)
par: Fang, Kun, et autres
Publié: (2025)
FusID: Modality-Fused Semantic IDs for Generative Music Recommendation
par: Kim, Haven, et autres
Publié: (2026)
par: Kim, Haven, et autres
Publié: (2026)
Evaluating Interval-based Tokenization for Pitch Representation in Symbolic Music Analysis
par: Le, Dinh-Viet-Toan, et autres
Publié: (2025)
par: Le, Dinh-Viet-Toan, et autres
Publié: (2025)
TALKPLAY: Multimodal Music Recommendation with Large Language Models
par: Doh, Seungheon, et autres
Publié: (2025)
par: Doh, Seungheon, et autres
Publié: (2025)
Evaluating High-Resolution Piano Sustain Pedal Depth Estimation with Musically Informed Metrics
par: Zhang, Hanwen, et autres
Publié: (2025)
par: Zhang, Hanwen, et autres
Publié: (2025)
How Much Does Machine Identity Matter in Anomalous Sound Detection at Test Time?
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
par: Ding, Hanyu, et autres
Publié: (2025)
par: Ding, Hanyu, et autres
Publié: (2025)
Effective Integration of KAN for Keyword Spotting
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
Multichannel Keyword Spotting for Noisy Conditions
par: Saladukha, Dzmitry, et autres
Publié: (2025)
par: Saladukha, Dzmitry, et autres
Publié: (2025)
Distance Sampling-based Paraphraser Leveraging ChatGPT for Text Data Manipulation
par: Oh, Yoori, et autres
Publié: (2024)
par: Oh, Yoori, et autres
Publié: (2024)
AdaKWS: Towards Robust Keyword Spotting with Test-Time Adaptation
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Diff4Steer: Steerable Diffusion Prior for Generative Music Retrieval with Semantic Guidance
par: Bao, Xuchan, et autres
Publié: (2024)
par: Bao, Xuchan, et autres
Publié: (2024)
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
par: Doh, SeungHeon, et autres
Publié: (2024)
par: Doh, SeungHeon, et autres
Publié: (2024)
TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
par: Doh, Seungheon, et autres
Publié: (2025)
par: Doh, Seungheon, et autres
Publié: (2025)
JEPOO: Highly Accurate Joint Estimation of Pitch, Onset and Offset for Music Information Retrieval
par: Wei, Haojie, et autres
Publié: (2023)
par: Wei, Haojie, et autres
Publié: (2023)
Streaming Piano Transcription Based on Consistent Onset and Offset Decoding with Sustain Pedal Detection
par: Wei, Weixing, et autres
Publié: (2025)
par: Wei, Weixing, et autres
Publié: (2025)
Application of Audio Fingerprinting Techniques for Real-Time Scalable Speech Retrieval and Speech Clusterization
par: Altwlkany, Kemal, et autres
Publié: (2024)
par: Altwlkany, Kemal, et autres
Publié: (2024)
MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding
par: Xi, Yu, et autres
Publié: (2025)
par: Xi, Yu, et autres
Publié: (2025)
Temporal Pooling Strategies for Training-Free Anomalous Sound Detection with Self-Supervised Audio Embeddings
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
Multi-label Cross-lingual automatic music genre classification from lyrics with Sentence BERT
par: Tavares, Tiago Fernandes, et autres
Publié: (2025)
par: Tavares, Tiago Fernandes, et autres
Publié: (2025)
Vocal Tract Length Warped Features for Spoken Keyword Spotting
par: Sarkar, Achintya kr., et autres
Publié: (2025)
par: Sarkar, Achintya kr., et autres
Publié: (2025)
Documents similaires
-
Quantization-Based Score Calibration for Few-Shot Keyword Spotting with Dynamic Time Warping in Noisy Environments
par: Wilkinghoff, Kevin, et autres
Publié: (2025) -
AdaProj: Adaptively Scaled Angular Margin Subspace Projections for Anomalous Sound Detection with Auxiliary Classification Tasks
par: Wilkinghoff, Kevin
Publié: (2024) -
Automatic Estimation of Singing Voice Musical Dynamics
par: Narang, Jyoti, et autres
Publié: (2024) -
Personalized Dynamic Music Emotion Recognition with Dual-Scale Attention-Based Meta-Learning
par: Zhang, Dengming, et autres
Publié: (2024) -
EdgeSpot: Efficient and High-Performance Few-Shot Model for Keyword Spotting
par: Buyuksolak, Oguzhan, et autres
Publié: (2026)