Domain-Incremental Continual Learning for Robust and Efficient Keyword Spotting in Resource Constrained Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dhungana, Prakash, Salehi, Sayed Ahmad |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WhisperAlign: Word-Boundary-Aware ASR and WhisperX-Anchored Pyannote Diarization for Long-Form Bengali Speech
par: Chowdhury, Aurchi, et autres
Publié: (2026)
par: Chowdhury, Aurchi, et autres
Publié: (2026)
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
par: Chien, Sheng-You, et autres
Publié: (2026)
par: Chien, Sheng-You, et autres
Publié: (2026)
Robust Long-Form Bangla Speech Processing: Automatic Speech Recognition and Speaker Diarization
par: Chowdhury, MD. Sagor, et autres
Publié: (2026)
par: Chowdhury, MD. Sagor, et autres
Publié: (2026)
ASR Error Correction in Low-Resource Burmese with Alignment-Enhanced Transformers using Phonetic Features
par: Lin, Ye Bhone, et autres
Publié: (2025)
par: Lin, Ye Bhone, et autres
Publié: (2025)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
par: Feng, Ruitao, et autres
Publié: (2025)
par: Feng, Ruitao, et autres
Publié: (2025)
Adaptive Edge-Cloud Inference for Speech-to-Action Systems Using ASR and Large Language Models
par: Torkamani, Mohammad Jalili, et autres
Publié: (2025)
par: Torkamani, Mohammad Jalili, et autres
Publié: (2025)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
par: Halpern, Bence Mark, et autres
Publié: (2026)
par: Halpern, Bence Mark, et autres
Publié: (2026)
Continually Evolved Multimodal Foundation Models for Cancer Prognosis
par: Peng, Jie, et autres
Publié: (2025)
par: Peng, Jie, et autres
Publié: (2025)
Diffuse or Confuse: A Diffusion Deepfake Speech Dataset
par: Firc, Anton, et autres
Publié: (2024)
par: Firc, Anton, et autres
Publié: (2024)
SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset
par: Gautam, Sushant, et autres
Publié: (2024)
par: Gautam, Sushant, et autres
Publié: (2024)
Spectral Clustering in Convex and Constrained Settings
par: Behera, Swarup Ranjan, et autres
Publié: (2024)
par: Behera, Swarup Ranjan, et autres
Publié: (2024)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
par: Kozak, Nazar
Publié: (2026)
par: Kozak, Nazar
Publié: (2026)
Point of Order: Action-Aware LLM Persona Modeling for Realistic Civic Simulation
par: Merrill, Scott, et autres
Publié: (2025)
par: Merrill, Scott, et autres
Publié: (2025)
Robustness of Spatio-temporal Graph Neural Networks for Fault Location in Partially Observable Distribution Grids
par: Karabulut, Burak, et autres
Publié: (2026)
par: Karabulut, Burak, et autres
Publié: (2026)
Domain Adaptation of the Pyannote Diarization Pipeline for Conversational Indonesian Audio
par: Prasetyo, Muhammad Daffa'i Rafi, et autres
Publié: (2026)
par: Prasetyo, Muhammad Daffa'i Rafi, et autres
Publié: (2026)
Cross-Domain Robustness of Transformer-based Keyphrase Generation
par: Glazkova, Anna, et autres
Publié: (2023)
par: Glazkova, Anna, et autres
Publié: (2023)
An End-to-End Approach for Korean Wakeword Systems with Speaker Authentication
par: Seo, Geonwoo
Publié: (2025)
par: Seo, Geonwoo
Publié: (2025)
VocSim: A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio
par: Basha, Maris, et autres
Publié: (2025)
par: Basha, Maris, et autres
Publié: (2025)
The formation of perceptual space in early phonetic acquisition: a cross-linguistic modeling approach
par: Tan, Frank Lihui, et autres
Publié: (2024)
par: Tan, Frank Lihui, et autres
Publié: (2024)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Advancing Voice Cloning for Nepali: Leveraging Transfer Learning in a Low-Resource Language
par: Karki, Manjil, et autres
Publié: (2024)
par: Karki, Manjil, et autres
Publié: (2024)
Why LoRA Resists Label Noise: A Theoretical Framework for Noise-Robust Parameter-Efficient Fine-Tuning
par: Steele, Brady
Publié: (2026)
par: Steele, Brady
Publié: (2026)
CardioEmbed: Domain-Specialized Text Embeddings for Clinical Cardiology
par: Young, Richard J., et autres
Publié: (2025)
par: Young, Richard J., et autres
Publié: (2025)
RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization
par: Guo, Dongxin, et autres
Publié: (2026)
par: Guo, Dongxin, et autres
Publié: (2026)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
par: Soni, Aniket Abhishek
Publié: (2025)
par: Soni, Aniket Abhishek
Publié: (2025)
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
par: Zhao, Rosie, et autres
Publié: (2026)
par: Zhao, Rosie, et autres
Publié: (2026)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
par: Cheripally, Sowmya
Publié: (2024)
par: Cheripally, Sowmya
Publié: (2024)
Dual-Phase Federated Deep Unlearning via Weight-Aware Rollback and Reconstruction
par: Zhou, Changjun, et autres
Publié: (2025)
par: Zhou, Changjun, et autres
Publié: (2025)
Distilling Robustness into Natural Language Inference Models with Domain-Targeted Augmentation
par: Stacey, Joe, et autres
Publié: (2023)
par: Stacey, Joe, et autres
Publié: (2023)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
par: Geuter, Jonathan, et autres
Publié: (2025)
par: Geuter, Jonathan, et autres
Publié: (2025)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
par: Schesch, Benedikt, et autres
Publié: (2026)
par: Schesch, Benedikt, et autres
Publié: (2026)
Towards Leveraging Large Language Models for Automated Medical Q&A Evaluation
par: Krolik, Jack, et autres
Publié: (2024)
par: Krolik, Jack, et autres
Publié: (2024)
Continuous Predictive Modeling of Clinical Notes and ICD Codes in Patient Health Records
par: Caralt, Mireia Hernandez, et autres
Publié: (2024)
par: Caralt, Mireia Hernandez, et autres
Publié: (2024)
A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models
par: Christop, Iwona, et autres
Publié: (2026)
par: Christop, Iwona, et autres
Publié: (2026)
BlasBench: An Open Benchmark for Irish Speech Recognition
par: Raj, Jyoutir, et autres
Publié: (2026)
par: Raj, Jyoutir, et autres
Publié: (2026)
Improving ML Training Data with Gold-Standard Quality Metrics
par: Barrett, Leslie, et autres
Publié: (2025)
par: Barrett, Leslie, et autres
Publié: (2025)
Post Hoc Extraction of Pareto Fronts for Continuous Control
par: Thakar, Raghav, et autres
Publié: (2026)
par: Thakar, Raghav, et autres
Publié: (2026)
TsetlinKWS: A 65nm 16.58uW, 0.63mm2 State-Driven Convolutional Tsetlin Machine-Based Accelerator For Keyword Spotting
par: Lin, Baizhou, et autres
Publié: (2025)
par: Lin, Baizhou, et autres
Publié: (2025)
Speaker-Independent Dysarthria Severity Classification using Self-Supervised Transformers and Multi-Task Learning
par: Stumpf, Lauren, et autres
Publié: (2024)
par: Stumpf, Lauren, et autres
Publié: (2024)
Synergy over Discrepancy: A Partition-Based Approach to Multi-Domain LLM Fine-Tuning
par: Ye, Hua, et autres
Publié: (2025)
par: Ye, Hua, et autres
Publié: (2025)
Documents similaires
-
WhisperAlign: Word-Boundary-Aware ASR and WhisperX-Anchored Pyannote Diarization for Long-Form Bengali Speech
par: Chowdhury, Aurchi, et autres
Publié: (2026) -
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
par: Chien, Sheng-You, et autres
Publié: (2026) -
Robust Long-Form Bangla Speech Processing: Automatic Speech Recognition and Speaker Diarization
par: Chowdhury, MD. Sagor, et autres
Publié: (2026) -
ASR Error Correction in Low-Resource Burmese with Alignment-Enhanced Transformers using Phonetic Features
par: Lin, Ye Bhone, et autres
Publié: (2025) -
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
par: Feng, Ruitao, et autres
Publié: (2025)