Salvato in:
| Autore principale: | Yang, Yiru |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2507.10313 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR
di: Biswas, Swadhin, et al.
Pubblicazione: (2025)
di: Biswas, Swadhin, et al.
Pubblicazione: (2025)
SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR
di: Pražák, Aleš, et al.
Pubblicazione: (2025)
di: Pražák, Aleš, et al.
Pubblicazione: (2025)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
di: Li, Jiahong, et al.
Pubblicazione: (2025)
di: Li, Jiahong, et al.
Pubblicazione: (2025)
Synthetic Data Domain Adaptation for ASR via LLM-based Text and Phonetic Respelling Augmentation
di: Yamashita, Natsuo, et al.
Pubblicazione: (2026)
di: Yamashita, Natsuo, et al.
Pubblicazione: (2026)
Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR
di: Li, Longhao, et al.
Pubblicazione: (2025)
di: Li, Longhao, et al.
Pubblicazione: (2025)
SE/BN Adapter: Parametric Efficient Domain Adaptation for Speaker Recognition
di: Wang, Tianhao, et al.
Pubblicazione: (2024)
di: Wang, Tianhao, et al.
Pubblicazione: (2024)
HDMoLE: Mixture of LoRA Experts with Hierarchical Routing and Dynamic Thresholds for Fine-Tuning LLM-based ASR Models
di: Mu, Bingshen, et al.
Pubblicazione: (2024)
di: Mu, Bingshen, et al.
Pubblicazione: (2024)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
di: Huang, Shangkun, et al.
Pubblicazione: (2025)
di: Huang, Shangkun, et al.
Pubblicazione: (2025)
Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models
di: Simic, Christopher, et al.
Pubblicazione: (2025)
di: Simic, Christopher, et al.
Pubblicazione: (2025)
Index-ASR Technical Report
di: Song, Zheshu, et al.
Pubblicazione: (2025)
di: Song, Zheshu, et al.
Pubblicazione: (2025)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR
di: Fan, Zhiyun, et al.
Pubblicazione: (2024)
di: Fan, Zhiyun, et al.
Pubblicazione: (2024)
Speech Recognition on TV Series with Video-guided Post-ASR Correction
di: Yang, Haoyuan, et al.
Pubblicazione: (2025)
di: Yang, Haoyuan, et al.
Pubblicazione: (2025)
SpecTokenizer: A Lightweight Streaming Codec in the Compressed Spectrum Domain
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
Distilling Spectrograms into Tokens: Fast and Lightweight Bioacoustic Classification for BirdCLEF+ 2025
di: Miyaguchi, Anthony, et al.
Pubblicazione: (2025)
di: Miyaguchi, Anthony, et al.
Pubblicazione: (2025)
Lightweight Resolution-Aware Audio Deepfake Detection via Cross-Scale Attention and Consistency Learning
di: Shahriar, K. A.
Pubblicazione: (2026)
di: Shahriar, K. A.
Pubblicazione: (2026)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
di: Xu, Tianyi, et al.
Pubblicazione: (2024)
di: Xu, Tianyi, et al.
Pubblicazione: (2024)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2024)
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2024)
Monaural speech enhancement on drone via Adapter based transfer learning
di: Chen, Xingyu, et al.
Pubblicazione: (2024)
di: Chen, Xingyu, et al.
Pubblicazione: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
Efficient Rehearsal for Continual Learning in ASR via Singular Value Tuning
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
di: Zheng, Yuang, et al.
Pubblicazione: (2026)
di: Zheng, Yuang, et al.
Pubblicazione: (2026)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
di: Zhou, Jiaming, et al.
Pubblicazione: (2023)
di: Zhou, Jiaming, et al.
Pubblicazione: (2023)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
Efficient Scaling for LLM-based ASR
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
Speech Emotion Recognition with ASR Integration
di: Li, Yuanchao
Pubblicazione: (2026)
di: Li, Yuanchao
Pubblicazione: (2026)
Speech Denoising with Auditory Models
di: Saddler, Mark R., et al.
Pubblicazione: (2020)
di: Saddler, Mark R., et al.
Pubblicazione: (2020)
Multi-Channel Differential ASR for Robust Wearer Speech Recognition on Smart Glasses
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
PromptASR for contextualized ASR with controllable style
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
Libriheavy: a 50,000 hours ASR corpus with punctuation casing and context
di: Kang, Wei, et al.
Pubblicazione: (2023)
di: Kang, Wei, et al.
Pubblicazione: (2023)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
di: Wei, Linye, et al.
Pubblicazione: (2025)
di: Wei, Linye, et al.
Pubblicazione: (2025)
Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR
di: Bai, Junwen, et al.
Pubblicazione: (2024)
di: Bai, Junwen, et al.
Pubblicazione: (2024)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
di: Zhang, Yiru, et al.
Pubblicazione: (2025)
di: Zhang, Yiru, et al.
Pubblicazione: (2025)
Technical Report: A Practical Guide to Kaldi ASR Optimization
di: Hong, Mengze, et al.
Pubblicazione: (2025)
di: Hong, Mengze, et al.
Pubblicazione: (2025)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR
di: Biswas, Swadhin, et al.
Pubblicazione: (2025) -
SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR
di: Zhao, Qiuming, et al.
Pubblicazione: (2024) -
Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR
di: Pražák, Aleš, et al.
Pubblicazione: (2025) -
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
di: Kim, Heeseung, et al.
Pubblicazione: (2024) -
Efficient Multilingual ASR Finetuning via LoRA Language Experts
di: Li, Jiahong, et al.
Pubblicazione: (2025)