Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages
Fuente:
arXiv
Guardado en:
| Autores principales: | Fong, Seraphina, Matassoni, Marco, Brutti, Alessio |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MOSEL: 950,000 Hours of Speech Data for Open-Source Speech Foundation Model Training on EU Languages
por: Gaido, Marco, et al.
Publicado: (2024)
por: Gaido, Marco, et al.
Publicado: (2024)
The Eloquence team submission for task 1 of MLC-SLM challenge
por: Concina, Lorenzo, et al.
Publicado: (2025)
por: Concina, Lorenzo, et al.
Publicado: (2025)
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
por: Sharma, Swati, et al.
Publicado: (2026)
por: Sharma, Swati, et al.
Publicado: (2026)
Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap
por: Yang, Guanrou, et al.
Publicado: (2024)
por: Yang, Guanrou, et al.
Publicado: (2024)
Pretraining Large Brain Language Model for Active BCI: Silent Speech
por: Zhou, Jinzhao, et al.
Publicado: (2025)
por: Zhou, Jinzhao, et al.
Publicado: (2025)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
por: Song, Zheshu, et al.
Publicado: (2024)
por: Song, Zheshu, et al.
Publicado: (2024)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
por: Peng, An-Ci, et al.
Publicado: (2026)
por: Peng, An-Ci, et al.
Publicado: (2026)
A2TTS: TTS for Low Resource Indian Languages
por: Bhadoriya, Ayush Singh, et al.
Publicado: (2025)
por: Bhadoriya, Ayush Singh, et al.
Publicado: (2025)
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
por: Manakul, Potsawee, et al.
Publicado: (2024)
por: Manakul, Potsawee, et al.
Publicado: (2024)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
por: Yang, Cheng-Yeh, et al.
Publicado: (2026)
por: Yang, Cheng-Yeh, et al.
Publicado: (2026)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
por: Diwan, Anuj, et al.
Publicado: (2026)
por: Diwan, Anuj, et al.
Publicado: (2026)
End-to-End Speech Translation for Low-Resource Languages Using Weakly Labeled Data
por: Pothula, Aishwarya, et al.
Publicado: (2025)
por: Pothula, Aishwarya, et al.
Publicado: (2025)
TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs
por: Peng, Jing, et al.
Publicado: (2026)
por: Peng, Jing, et al.
Publicado: (2026)
Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
Can Speech LLMs Think while Listening?
por: Shih, Yi-Jen, et al.
Publicado: (2025)
por: Shih, Yi-Jen, et al.
Publicado: (2025)
Methods to Increase the Amount of Data for Speech Recognition for Low Resource Languages
por: Ayrapetyan, Alexan, et al.
Publicado: (2025)
por: Ayrapetyan, Alexan, et al.
Publicado: (2025)
Closing the Gap Between Text and Speech Understanding in LLMs
por: Cuervo, Santiago, et al.
Publicado: (2025)
por: Cuervo, Santiago, et al.
Publicado: (2025)
Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning
por: Fang, Yangui, et al.
Publicado: (2025)
por: Fang, Yangui, et al.
Publicado: (2025)
Phonology-Guided Speech-to-Speech Translation for African Languages
por: Ochieng, Peter, et al.
Publicado: (2024)
por: Ochieng, Peter, et al.
Publicado: (2024)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
por: Ridoy, Md Sazzadul Islam, et al.
Publicado: (2025)
por: Ridoy, Md Sazzadul Islam, et al.
Publicado: (2025)
Improving Low-Resource Dialect Classification Using Retrieval-based Voice Conversion
por: Fischbach, Lea, et al.
Publicado: (2025)
por: Fischbach, Lea, et al.
Publicado: (2025)
Efficient Fine-tuning of Audio Spectrogram Transformers via Soft Mixture of Adapters
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning
por: Ling, Shaoshi, et al.
Publicado: (2025)
por: Ling, Shaoshi, et al.
Publicado: (2025)
Continued Pretraining for Domain Adaptation of Wav2vec2.0 in Automatic Speech Recognition for Elementary Math Classroom Settings
por: Attia, Ahmed Adel, et al.
Publicado: (2024)
por: Attia, Ahmed Adel, et al.
Publicado: (2024)
Speechless: Speech Instruction Training Without Speech for Low Resource Languages
por: Dao, Alan, et al.
Publicado: (2025)
por: Dao, Alan, et al.
Publicado: (2025)
Textless NLP -- Zero Resource Challenge with Low Resource Compute
por: Ramadass, Krithiga, et al.
Publicado: (2024)
por: Ramadass, Krithiga, et al.
Publicado: (2024)
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
por: Hsu, Ming-Hao, et al.
Publicado: (2023)
por: Hsu, Ming-Hao, et al.
Publicado: (2023)
X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs
por: Cao, Di, et al.
Publicado: (2026)
por: Cao, Di, et al.
Publicado: (2026)
Multistage Fine-tuning Strategies for Automatic Speech Recognition in Low-resource Languages
por: Pillai, Leena G, et al.
Publicado: (2024)
por: Pillai, Leena G, et al.
Publicado: (2024)
PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects
por: Yang, Sicheng, et al.
Publicado: (2026)
por: Yang, Sicheng, et al.
Publicado: (2026)
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
por: Gállego, Gerard I., et al.
Publicado: (2025)
por: Gállego, Gerard I., et al.
Publicado: (2025)
COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning
por: Pan, Jing, et al.
Publicado: (2023)
por: Pan, Jing, et al.
Publicado: (2023)
MixRep: Hidden Representation Mixup for Low-Resource Speech Recognition
por: Xie, Jiamin, et al.
Publicado: (2023)
por: Xie, Jiamin, et al.
Publicado: (2023)
The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?
por: Billa, Jayadev
Publicado: (2026)
por: Billa, Jayadev
Publicado: (2026)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
por: Hsu, Ming-Hao, et al.
Publicado: (2024)
por: Hsu, Ming-Hao, et al.
Publicado: (2024)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
por: Wang, Qiongqiong, et al.
Publicado: (2025)
por: Wang, Qiongqiong, et al.
Publicado: (2025)
Bemba Speech Translation: Exploring a Low-Resource African Language
por: Farouq, Muhammad Hazim Al, et al.
Publicado: (2025)
por: Farouq, Muhammad Hazim Al, et al.
Publicado: (2025)
Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition
por: Piñeiro-Martín, Andrés, et al.
Publicado: (2024)
por: Piñeiro-Martín, Andrés, et al.
Publicado: (2024)
Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation
por: Wang, Qiongqiong, et al.
Publicado: (2025)
por: Wang, Qiongqiong, et al.
Publicado: (2025)
WAXAL: A Large-Scale Multilingual African Language Speech Corpus
por: Diack, Abdoulaye, et al.
Publicado: (2026)
por: Diack, Abdoulaye, et al.
Publicado: (2026)
Ejemplares similares
-
MOSEL: 950,000 Hours of Speech Data for Open-Source Speech Foundation Model Training on EU Languages
por: Gaido, Marco, et al.
Publicado: (2024) -
The Eloquence team submission for task 1 of MLC-SLM challenge
por: Concina, Lorenzo, et al.
Publicado: (2025) -
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
por: Sharma, Swati, et al.
Publicado: (2026) -
Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap
por: Yang, Guanrou, et al.
Publicado: (2024) -
Pretraining Large Brain Language Model for Active BCI: Silent Speech
por: Zhou, Jinzhao, et al.
Publicado: (2025)