Salvato in:
| Autori principali: | Gu, Yue, Du, Zhihao, Shi, Ying, Han, Jiqing, He, Yongjun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.10401 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing the Robustness of Contextual ASR to Varying Biasing Information Volumes Through Purified Semantic Correlation Joint Modeling
di: Gu, Yue, et al.
Pubblicazione: (2025)
di: Gu, Yue, et al.
Pubblicazione: (2025)
persoDA: Personalized Data Augmentation for Personalized ASR
di: Parada, Pablo Peso, et al.
Pubblicazione: (2025)
di: Parada, Pablo Peso, et al.
Pubblicazione: (2025)
Contrastive Loss Based Frame-wise Feature disentanglement for Polyphonic Sound Event Detection
di: Guan, Yadong, et al.
Pubblicazione: (2024)
di: Guan, Yadong, et al.
Pubblicazione: (2024)
ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization
di: Mehmood, Haaris, et al.
Pubblicazione: (2025)
di: Mehmood, Haaris, et al.
Pubblicazione: (2025)
Serialized Output Training by Learned Dominance
di: Shi, Ying, et al.
Pubblicazione: (2024)
di: Shi, Ying, et al.
Pubblicazione: (2024)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
di: Mujtaba, Dena, et al.
Pubblicazione: (2025)
di: Mujtaba, Dena, et al.
Pubblicazione: (2025)
Explore the Reinforcement Learning for the LLM based ASR and TTS system
di: Gao, Changfeng, et al.
Pubblicazione: (2025)
di: Gao, Changfeng, et al.
Pubblicazione: (2025)
CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR
di: Shakeel, Muhammad, et al.
Pubblicazione: (2026)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2026)
Data-Efficient ASR Personalization for Non-Normative Speech Using an Uncertainty-Based Phoneme Difficulty Score for Guided Sampling
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
Facilitating Personalized TTS for Dysarthric Speakers Using Knowledge Anchoring and Curriculum Learning
di: Jeon, Yejin, et al.
Pubblicazione: (2025)
di: Jeon, Yejin, et al.
Pubblicazione: (2025)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
Synthetic Data Domain Adaptation for ASR via LLM-based Text and Phonetic Respelling Augmentation
di: Yamashita, Natsuo, et al.
Pubblicazione: (2026)
di: Yamashita, Natsuo, et al.
Pubblicazione: (2026)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
Marco-ASR: A Principled and Metric-Driven Framework for Fine-Tuning Large-Scale ASR Models for Domain Adaptation
di: Ni, Xuanfan, et al.
Pubblicazione: (2025)
di: Ni, Xuanfan, et al.
Pubblicazione: (2025)
Communication-Efficient Personalized Federated Learning for Speech-to-Text Tasks
di: Du, Yichao, et al.
Pubblicazione: (2024)
di: Du, Yichao, et al.
Pubblicazione: (2024)
Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR
di: Lee, Minsik, et al.
Pubblicazione: (2026)
di: Lee, Minsik, et al.
Pubblicazione: (2026)
Creating Personalized Synthetic Voices from Articulation Impaired Speech Using Augmented Reconstruction Loss
di: Tian, Yusheng, et al.
Pubblicazione: (2024)
di: Tian, Yusheng, et al.
Pubblicazione: (2024)
MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention
di: Zhang, Yimeng, et al.
Pubblicazione: (2026)
di: Zhang, Yimeng, et al.
Pubblicazione: (2026)
Data-independent Beamforming for End-to-end Multichannel Multi-speaker ASR
di: Cui, Can, et al.
Pubblicazione: (2025)
di: Cui, Can, et al.
Pubblicazione: (2025)
Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement
di: Serre, Thomas, et al.
Pubblicazione: (2026)
di: Serre, Thomas, et al.
Pubblicazione: (2026)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
Mamba for Streaming ASR Combined with Unimodal Aggregation
di: Fang, Ying, et al.
Pubblicazione: (2024)
di: Fang, Ying, et al.
Pubblicazione: (2024)
HearFit+: Personalized Fitness Monitoring via Audio Signals on Smart Speakers
di: Xie, Yadong, et al.
Pubblicazione: (2025)
di: Xie, Yadong, et al.
Pubblicazione: (2025)
Revisiting ASR Error Correction with Specialized Models
di: Gu, Zijin, et al.
Pubblicazione: (2024)
di: Gu, Zijin, et al.
Pubblicazione: (2024)
Leave No Knowledge Behind During Knowledge Distillation: Towards Practical and Effective Knowledge Distillation for Code-Switching ASR Using Realistic Data
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2024)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2024)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
DARS: Dysarthria-Aware Rhythm-Style Synthesis for ASR Enhancement
di: Wu, Minghui, et al.
Pubblicazione: (2026)
di: Wu, Minghui, et al.
Pubblicazione: (2026)
Fun-ASR Technical Report
di: An, Keyu, et al.
Pubblicazione: (2025)
di: An, Keyu, et al.
Pubblicazione: (2025)
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
Mitigating Hallucinations in LM-Based TTS Models via Distribution Alignment Using GFlowNets
di: Liu, Chenlin, et al.
Pubblicazione: (2025)
di: Liu, Chenlin, et al.
Pubblicazione: (2025)
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024)
di: Jang, Inseon, et al.
Pubblicazione: (2024)
Graph Neural Field with Spatial-Correlation Augmentation for HRTF Personalization
di: Hu, De, et al.
Pubblicazione: (2025)
di: Hu, De, et al.
Pubblicazione: (2025)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
di: Wu, Minghui, et al.
Pubblicazione: (2024)
di: Wu, Minghui, et al.
Pubblicazione: (2024)
Continuous Target Speech Extraction: Enhancing Personalized Diarization and Extraction on Complex Recordings
di: Zhao, He, et al.
Pubblicazione: (2024)
di: Zhao, He, et al.
Pubblicazione: (2024)
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
di: Gao, Yuan, et al.
Pubblicazione: (2025)
di: Gao, Yuan, et al.
Pubblicazione: (2025)
Speech-driven Personalized Gesture Synthetics: Harnessing Automatic Fuzzy Feature Inference
di: Zhang, Fan, et al.
Pubblicazione: (2024)
di: Zhang, Fan, et al.
Pubblicazione: (2024)
Revolutionizing Personalized Voice Synthesis: The Journey towards Emotional and Individual Authenticity with DIVSE (Dynamic Individual Voice Synthesis Engine)
di: Shi, Fan
Pubblicazione: (2023)
di: Shi, Fan
Pubblicazione: (2023)
Documenti analoghi
-
Enhancing the Robustness of Contextual ASR to Varying Biasing Information Volumes Through Purified Semantic Correlation Joint Modeling
di: Gu, Yue, et al.
Pubblicazione: (2025) -
persoDA: Personalized Data Augmentation for Personalized ASR
di: Parada, Pablo Peso, et al.
Pubblicazione: (2025) -
Contrastive Loss Based Frame-wise Feature disentanglement for Polyphonic Sound Event Detection
di: Guan, Yadong, et al.
Pubblicazione: (2024) -
ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization
di: Mehmood, Haaris, et al.
Pubblicazione: (2025) -
Serialized Output Training by Learned Dominance
di: Shi, Ying, et al.
Pubblicazione: (2024)