Domain-Incremental Continual Learning for Robust and Efficient Keyword Spotting in Resource Constrained Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Dhungana, Prakash, Salehi, Sayed Ahmad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WhisperAlign: Word-Boundary-Aware ASR and WhisperX-Anchored Pyannote Diarization for Long-Form Bengali Speech
por: Chowdhury, Aurchi, et al.
Publicado: (2026)
por: Chowdhury, Aurchi, et al.
Publicado: (2026)
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
por: Chien, Sheng-You, et al.
Publicado: (2026)
por: Chien, Sheng-You, et al.
Publicado: (2026)
Robust Long-Form Bangla Speech Processing: Automatic Speech Recognition and Speaker Diarization
por: Chowdhury, MD. Sagor, et al.
Publicado: (2026)
por: Chowdhury, MD. Sagor, et al.
Publicado: (2026)
ASR Error Correction in Low-Resource Burmese with Alignment-Enhanced Transformers using Phonetic Features
por: Lin, Ye Bhone, et al.
Publicado: (2025)
por: Lin, Ye Bhone, et al.
Publicado: (2025)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
por: Feng, Ruitao, et al.
Publicado: (2025)
por: Feng, Ruitao, et al.
Publicado: (2025)
Adaptive Edge-Cloud Inference for Speech-to-Action Systems Using ASR and Large Language Models
por: Torkamani, Mohammad Jalili, et al.
Publicado: (2025)
por: Torkamani, Mohammad Jalili, et al.
Publicado: (2025)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
por: Halpern, Bence Mark, et al.
Publicado: (2026)
por: Halpern, Bence Mark, et al.
Publicado: (2026)
Continually Evolved Multimodal Foundation Models for Cancer Prognosis
por: Peng, Jie, et al.
Publicado: (2025)
por: Peng, Jie, et al.
Publicado: (2025)
Diffuse or Confuse: A Diffusion Deepfake Speech Dataset
por: Firc, Anton, et al.
Publicado: (2024)
por: Firc, Anton, et al.
Publicado: (2024)
SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset
por: Gautam, Sushant, et al.
Publicado: (2024)
por: Gautam, Sushant, et al.
Publicado: (2024)
Spectral Clustering in Convex and Constrained Settings
por: Behera, Swarup Ranjan, et al.
Publicado: (2024)
por: Behera, Swarup Ranjan, et al.
Publicado: (2024)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
por: Kozak, Nazar
Publicado: (2026)
por: Kozak, Nazar
Publicado: (2026)
Point of Order: Action-Aware LLM Persona Modeling for Realistic Civic Simulation
por: Merrill, Scott, et al.
Publicado: (2025)
por: Merrill, Scott, et al.
Publicado: (2025)
Robustness of Spatio-temporal Graph Neural Networks for Fault Location in Partially Observable Distribution Grids
por: Karabulut, Burak, et al.
Publicado: (2026)
por: Karabulut, Burak, et al.
Publicado: (2026)
Domain Adaptation of the Pyannote Diarization Pipeline for Conversational Indonesian Audio
por: Prasetyo, Muhammad Daffa'i Rafi, et al.
Publicado: (2026)
por: Prasetyo, Muhammad Daffa'i Rafi, et al.
Publicado: (2026)
Cross-Domain Robustness of Transformer-based Keyphrase Generation
por: Glazkova, Anna, et al.
Publicado: (2023)
por: Glazkova, Anna, et al.
Publicado: (2023)
An End-to-End Approach for Korean Wakeword Systems with Speaker Authentication
por: Seo, Geonwoo
Publicado: (2025)
por: Seo, Geonwoo
Publicado: (2025)
VocSim: A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio
por: Basha, Maris, et al.
Publicado: (2025)
por: Basha, Maris, et al.
Publicado: (2025)
The formation of perceptual space in early phonetic acquisition: a cross-linguistic modeling approach
por: Tan, Frank Lihui, et al.
Publicado: (2024)
por: Tan, Frank Lihui, et al.
Publicado: (2024)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Advancing Voice Cloning for Nepali: Leveraging Transfer Learning in a Low-Resource Language
por: Karki, Manjil, et al.
Publicado: (2024)
por: Karki, Manjil, et al.
Publicado: (2024)
Why LoRA Resists Label Noise: A Theoretical Framework for Noise-Robust Parameter-Efficient Fine-Tuning
por: Steele, Brady
Publicado: (2026)
por: Steele, Brady
Publicado: (2026)
CardioEmbed: Domain-Specialized Text Embeddings for Clinical Cardiology
por: Young, Richard J., et al.
Publicado: (2025)
por: Young, Richard J., et al.
Publicado: (2025)
RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization
por: Guo, Dongxin, et al.
Publicado: (2026)
por: Guo, Dongxin, et al.
Publicado: (2026)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
por: Soni, Aniket Abhishek
Publicado: (2025)
por: Soni, Aniket Abhishek
Publicado: (2025)
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
por: Zhao, Rosie, et al.
Publicado: (2026)
por: Zhao, Rosie, et al.
Publicado: (2026)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
por: Cheripally, Sowmya
Publicado: (2024)
por: Cheripally, Sowmya
Publicado: (2024)
Dual-Phase Federated Deep Unlearning via Weight-Aware Rollback and Reconstruction
por: Zhou, Changjun, et al.
Publicado: (2025)
por: Zhou, Changjun, et al.
Publicado: (2025)
Distilling Robustness into Natural Language Inference Models with Domain-Targeted Augmentation
por: Stacey, Joe, et al.
Publicado: (2023)
por: Stacey, Joe, et al.
Publicado: (2023)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
por: Geuter, Jonathan, et al.
Publicado: (2025)
por: Geuter, Jonathan, et al.
Publicado: (2025)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
por: Schesch, Benedikt, et al.
Publicado: (2026)
por: Schesch, Benedikt, et al.
Publicado: (2026)
Towards Leveraging Large Language Models for Automated Medical Q&A Evaluation
por: Krolik, Jack, et al.
Publicado: (2024)
por: Krolik, Jack, et al.
Publicado: (2024)
Continuous Predictive Modeling of Clinical Notes and ICD Codes in Patient Health Records
por: Caralt, Mireia Hernandez, et al.
Publicado: (2024)
por: Caralt, Mireia Hernandez, et al.
Publicado: (2024)
A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models
por: Christop, Iwona, et al.
Publicado: (2026)
por: Christop, Iwona, et al.
Publicado: (2026)
BlasBench: An Open Benchmark for Irish Speech Recognition
por: Raj, Jyoutir, et al.
Publicado: (2026)
por: Raj, Jyoutir, et al.
Publicado: (2026)
Improving ML Training Data with Gold-Standard Quality Metrics
por: Barrett, Leslie, et al.
Publicado: (2025)
por: Barrett, Leslie, et al.
Publicado: (2025)
Post Hoc Extraction of Pareto Fronts for Continuous Control
por: Thakar, Raghav, et al.
Publicado: (2026)
por: Thakar, Raghav, et al.
Publicado: (2026)
TsetlinKWS: A 65nm 16.58uW, 0.63mm2 State-Driven Convolutional Tsetlin Machine-Based Accelerator For Keyword Spotting
por: Lin, Baizhou, et al.
Publicado: (2025)
por: Lin, Baizhou, et al.
Publicado: (2025)
Speaker-Independent Dysarthria Severity Classification using Self-Supervised Transformers and Multi-Task Learning
por: Stumpf, Lauren, et al.
Publicado: (2024)
por: Stumpf, Lauren, et al.
Publicado: (2024)
Synergy over Discrepancy: A Partition-Based Approach to Multi-Domain LLM Fine-Tuning
por: Ye, Hua, et al.
Publicado: (2025)
por: Ye, Hua, et al.
Publicado: (2025)
Ejemplares similares
-
WhisperAlign: Word-Boundary-Aware ASR and WhisperX-Anchored Pyannote Diarization for Long-Form Bengali Speech
por: Chowdhury, Aurchi, et al.
Publicado: (2026) -
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
por: Chien, Sheng-You, et al.
Publicado: (2026) -
Robust Long-Form Bangla Speech Processing: Automatic Speech Recognition and Speaker Diarization
por: Chowdhury, MD. Sagor, et al.
Publicado: (2026) -
ASR Error Correction in Low-Resource Burmese with Alignment-Enhanced Transformers using Phonetic Features
por: Lin, Ye Bhone, et al.
Publicado: (2025) -
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
por: Feng, Ruitao, et al.
Publicado: (2025)