CantoASR: Prosody-Aware ASR-LALM Collaboration for Low-Resource Cantonese
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Dazhong, Lin, Yi-Cheng, Huang, Yuchen, Gong, Ziwei, Jiang, Di, Xie, Zeying, R., Yi, Fung |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
von: Wei, Victor Junqiu, et al.
Veröffentlicht: (2024)
von: Wei, Victor Junqiu, et al.
Veröffentlicht: (2024)
Configurable Multilingual ASR with Speech Summary Representations
von: Zhu, Harrison, et al.
Veröffentlicht: (2024)
von: Zhu, Harrison, et al.
Veröffentlicht: (2024)
PromptASR for contextualized ASR with controllable style
von: Yang, Xiaoyu, et al.
Veröffentlicht: (2023)
von: Yang, Xiaoyu, et al.
Veröffentlicht: (2023)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
von: Xie, Yuan, et al.
Veröffentlicht: (2026)
von: Xie, Yuan, et al.
Veröffentlicht: (2026)
DARS: Dysarthria-Aware Rhythm-Style Synthesis for ASR Enhancement
von: Wu, Minghui, et al.
Veröffentlicht: (2026)
von: Wu, Minghui, et al.
Veröffentlicht: (2026)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
von: Sung, Hung-Yang, et al.
Veröffentlicht: (2025)
von: Sung, Hung-Yang, et al.
Veröffentlicht: (2025)
Empowering Low-Resource Language ASR via Large-Scale Pseudo Labeling
von: Bhogale, Kaushal Santosh, et al.
Veröffentlicht: (2024)
von: Bhogale, Kaushal Santosh, et al.
Veröffentlicht: (2024)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
von: Mdhaffar, Salima, et al.
Veröffentlicht: (2024)
von: Mdhaffar, Salima, et al.
Veröffentlicht: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
von: Song, Zheshu, et al.
Veröffentlicht: (2024)
von: Song, Zheshu, et al.
Veröffentlicht: (2024)
Language Family Matters: Evaluating LLM-Based ASR Across Linguistic Boundaries
von: Zhang, Yuchen, et al.
Veröffentlicht: (2026)
von: Zhang, Yuchen, et al.
Veröffentlicht: (2026)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
von: Cheng, Yao-Fei, et al.
Veröffentlicht: (2024)
von: Cheng, Yao-Fei, et al.
Veröffentlicht: (2024)
RO-N3WS: Enhancing Generalization in Low-Resource ASR with Diverse Romanian Speech Benchmarks
von: Diaconu, Alexandra, et al.
Veröffentlicht: (2026)
von: Diaconu, Alexandra, et al.
Veröffentlicht: (2026)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2024)
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2024)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
von: Liang, Siyu, et al.
Veröffentlicht: (2025)
von: Liang, Siyu, et al.
Veröffentlicht: (2025)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
von: Li, Chin-Jou, et al.
Veröffentlicht: (2025)
von: Li, Chin-Jou, et al.
Veröffentlicht: (2025)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
von: Gündüz, Ahmet, et al.
Veröffentlicht: (2024)
von: Gündüz, Ahmet, et al.
Veröffentlicht: (2024)
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2025)
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2025)
MLMA: Towards Multilingual ASR With Mamba-based Architectures
von: Ali, Mohamed Nabih, et al.
Veröffentlicht: (2025)
von: Ali, Mohamed Nabih, et al.
Veröffentlicht: (2025)
Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR
von: Irigoyen, Julian, et al.
Veröffentlicht: (2025)
von: Irigoyen, Julian, et al.
Veröffentlicht: (2025)
Exploring SSL Discrete Tokens for Multilingual ASR
von: Cui, Mingyu, et al.
Veröffentlicht: (2024)
von: Cui, Mingyu, et al.
Veröffentlicht: (2024)
Qwen3-ASR Technical Report
von: Shi, Xian, et al.
Veröffentlicht: (2026)
von: Shi, Xian, et al.
Veröffentlicht: (2026)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
von: Lin, Zhennan, et al.
Veröffentlicht: (2026)
von: Lin, Zhennan, et al.
Veröffentlicht: (2026)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
von: Sharma, Manali, et al.
Veröffentlicht: (2026)
von: Sharma, Manali, et al.
Veröffentlicht: (2026)
Romanization Encoding For Multilingual ASR
von: Ding, Wen, et al.
Veröffentlicht: (2024)
von: Ding, Wen, et al.
Veröffentlicht: (2024)
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
von: Anidjar, Or Haim, et al.
Veröffentlicht: (2024)
von: Anidjar, Or Haim, et al.
Veröffentlicht: (2024)
Revealing the Role of Audio Channels in ASR Performance Degradation
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2025)
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2025)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
von: Yang, Cheng-Yeh, et al.
Veröffentlicht: (2026)
von: Yang, Cheng-Yeh, et al.
Veröffentlicht: (2026)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
von: Wang, He, et al.
Veröffentlicht: (2025)
von: Wang, He, et al.
Veröffentlicht: (2025)
Mind the Gap: Entity-Preserved Context-Aware ASR Structured Transcriptions
von: Altinok, Duygu
Veröffentlicht: (2025)
von: Altinok, Duygu
Veröffentlicht: (2025)
Fun-ASR Technical Report
von: An, Keyu, et al.
Veröffentlicht: (2025)
von: An, Keyu, et al.
Veröffentlicht: (2025)
HypR: A comprehensive study for ASR hypothesis revising with a reference corpus
von: Wang, Yi-Wei, et al.
Veröffentlicht: (2023)
von: Wang, Yi-Wei, et al.
Veröffentlicht: (2023)
A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data
von: Chou, Cheng-Kang, et al.
Veröffentlicht: (2025)
von: Chou, Cheng-Kang, et al.
Veröffentlicht: (2025)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
von: Shakeel, Muhammad, et al.
Veröffentlicht: (2025)
von: Shakeel, Muhammad, et al.
Veröffentlicht: (2025)
Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR
von: Lee, Minsik, et al.
Veröffentlicht: (2026)
von: Lee, Minsik, et al.
Veröffentlicht: (2026)
ASR Error Correction in Low-Resource Burmese with Alignment-Enhanced Transformers using Phonetic Features
von: Lin, Ye Bhone, et al.
Veröffentlicht: (2025)
von: Lin, Ye Bhone, et al.
Veröffentlicht: (2025)
Promptformer: Prompted Conformer Transducer for ASR
von: Duarte-Torres, Sergio, et al.
Veröffentlicht: (2024)
von: Duarte-Torres, Sergio, et al.
Veröffentlicht: (2024)
Revisiting Acoustic Features for Robust ASR
von: Shah, Muhammad A., et al.
Veröffentlicht: (2024)
von: Shah, Muhammad A., et al.
Veröffentlicht: (2024)
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
von: Zhuo, Jianheng, et al.
Veröffentlicht: (2025)
von: Zhuo, Jianheng, et al.
Veröffentlicht: (2025)
XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese
von: Arisaputra, Panji, et al.
Veröffentlicht: (2024)
von: Arisaputra, Panji, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
von: Wei, Victor Junqiu, et al.
Veröffentlicht: (2024) -
Configurable Multilingual ASR with Speech Summary Representations
von: Zhu, Harrison, et al.
Veröffentlicht: (2024) -
PromptASR for contextualized ASR with controllable style
von: Yang, Xiaoyu, et al.
Veröffentlicht: (2023) -
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
von: Xie, Yuan, et al.
Veröffentlicht: (2026) -
DARS: Dysarthria-Aware Rhythm-Style Synthesis for ASR Enhancement
von: Wu, Minghui, et al.
Veröffentlicht: (2026)