Parameter-efficient Adaptation of Multilingual Multimodal Models for Low-resource ASR
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gupta, Abhishek, Parulekar, Amruta, Chattopadhyay, Sameep, Jyothi, Preethi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AMPS: ASR with Multimodal Paraphrase Supervision
von: Gupta, Abhishek, et al.
Veröffentlicht: (2024)
von: Gupta, Abhishek, et al.
Veröffentlicht: (2024)
LASER: An LLM-based ASR Scoring and Evaluation Rubric
von: Parulekar, Amruta, et al.
Veröffentlicht: (2025)
von: Parulekar, Amruta, et al.
Veröffentlicht: (2025)
Improving Self-supervised Pre-training using Accent-Specific Codebooks
von: Prabhu, Darshan, et al.
Veröffentlicht: (2024)
von: Prabhu, Darshan, et al.
Veröffentlicht: (2024)
SALSA: Speedy ASR-LLM Synchronous Aggregation
von: Mittal, Ashish, et al.
Veröffentlicht: (2024)
von: Mittal, Ashish, et al.
Veröffentlicht: (2024)
Multi-Convformer: Extending Conformer with Multiple Convolution Kernels
von: Prabhu, Darshan, et al.
Veröffentlicht: (2024)
von: Prabhu, Darshan, et al.
Veröffentlicht: (2024)
Dynamic ASR Pathways: An Adaptive Masking Approach Towards Efficient Pruning of A Multilingual ASR Model
von: Xie, Jiamin, et al.
Veröffentlicht: (2023)
von: Xie, Jiamin, et al.
Veröffentlicht: (2023)
Efficient Adaptation of Multilingual Models for Japanese ASR
von: Bajo, Mark, et al.
Veröffentlicht: (2024)
von: Bajo, Mark, et al.
Veröffentlicht: (2024)
LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR
von: Song, Zheshu, et al.
Veröffentlicht: (2024)
von: Song, Zheshu, et al.
Veröffentlicht: (2024)
Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages
von: Pandey, Isha, et al.
Veröffentlicht: (2025)
von: Pandey, Isha, et al.
Veröffentlicht: (2025)
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
von: Shankar, Bhavani, et al.
Veröffentlicht: (2024)
von: Shankar, Bhavani, et al.
Veröffentlicht: (2024)
Evaluating Standard and Dialectal Frisian ASR: Multilingual Fine-tuning and Language Identification for Improved Low-resource Performance
von: Amooie, Reihaneh, et al.
Veröffentlicht: (2025)
von: Amooie, Reihaneh, et al.
Veröffentlicht: (2025)
OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models
von: Chen, William, et al.
Veröffentlicht: (2025)
von: Chen, William, et al.
Veröffentlicht: (2025)
Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
von: Kumar, Shashi, et al.
Veröffentlicht: (2026)
von: Kumar, Shashi, et al.
Veröffentlicht: (2026)
Analyzing and Fine-Tuning Whisper Models for Multilingual Pilot Speech Transcription in the Cockpit
von: Nareddy, Kartheek Kumar Reddy, et al.
Veröffentlicht: (2025)
von: Nareddy, Kartheek Kumar Reddy, et al.
Veröffentlicht: (2025)
Language-Aware Prompt Tuning for Parameter-Efficient Seamless Language Expansion in Multilingual ASR
von: Yang, Hongli, et al.
Veröffentlicht: (2025)
von: Yang, Hongli, et al.
Veröffentlicht: (2025)
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
von: Noroozi, Vahid, et al.
Veröffentlicht: (2024)
von: Noroozi, Vahid, et al.
Veröffentlicht: (2024)
A Parameter-efficient Language Extension Framework for Multilingual ASR
von: Liu, Wei, et al.
Veröffentlicht: (2024)
von: Liu, Wei, et al.
Veröffentlicht: (2024)
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding
von: Bataev, Vladimir, et al.
Veröffentlicht: (2025)
von: Bataev, Vladimir, et al.
Veröffentlicht: (2025)
Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization
von: Hussain, Shehzeen, et al.
Veröffentlicht: (2025)
von: Hussain, Shehzeen, et al.
Veröffentlicht: (2025)
ASR-Synchronized Speaker-Role Diarization
von: Ghosh, Arindam, et al.
Veröffentlicht: (2025)
von: Ghosh, Arindam, et al.
Veröffentlicht: (2025)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
von: Grigoryan, Lilit, et al.
Veröffentlicht: (2025)
von: Grigoryan, Lilit, et al.
Veröffentlicht: (2025)
Anatomy of Industrial Scale Multilingual ASR
von: Ramirez, Francis McCann, et al.
Veröffentlicht: (2024)
von: Ramirez, Francis McCann, et al.
Veröffentlicht: (2024)
LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation
von: Kamahori, Keisuke, et al.
Veröffentlicht: (2025)
von: Kamahori, Keisuke, et al.
Veröffentlicht: (2025)
XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese
von: Arisaputra, Panji, et al.
Veröffentlicht: (2024)
von: Arisaputra, Panji, et al.
Veröffentlicht: (2024)
Low-rank Adaptation of Large Language Model Rescoring for Parameter-Efficient Speech Recognition
von: Yu, Yu, et al.
Veröffentlicht: (2023)
von: Yu, Yu, et al.
Veröffentlicht: (2023)
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation
von: Kothawade, Suraj, et al.
Veröffentlicht: (2021)
von: Kothawade, Suraj, et al.
Veröffentlicht: (2021)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
von: Andrusenko, Andrei, et al.
Veröffentlicht: (2024)
von: Andrusenko, Andrei, et al.
Veröffentlicht: (2024)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
von: Hu, Yuchen, et al.
Veröffentlicht: (2024)
von: Hu, Yuchen, et al.
Veröffentlicht: (2024)
Enhancing Synthetic Training Data for Speech Commands: From ASR-Based Filtering to Domain Adaptation in SSL Latent Space
von: Quintas, Sebastião, et al.
Veröffentlicht: (2024)
von: Quintas, Sebastião, et al.
Veröffentlicht: (2024)
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
von: Hu, Yuchen, et al.
Veröffentlicht: (2024)
von: Hu, Yuchen, et al.
Veröffentlicht: (2024)
XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
von: Ciobanu, Ioan-Paul, et al.
Veröffentlicht: (2025)
von: Ciobanu, Ioan-Paul, et al.
Veröffentlicht: (2025)
Dual-Pipeline with Low-Rank Adaptation for New Language Integration in Multilingual ASR
von: Khassanov, Yerbolat, et al.
Veröffentlicht: (2024)
von: Khassanov, Yerbolat, et al.
Veröffentlicht: (2024)
Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR
von: Bai, Junwen, et al.
Veröffentlicht: (2024)
von: Bai, Junwen, et al.
Veröffentlicht: (2024)
The Evolution of Multimodal Model Architectures
von: Wadekar, Shakti N., et al.
Veröffentlicht: (2024)
von: Wadekar, Shakti N., et al.
Veröffentlicht: (2024)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
von: Huang, Wei-Ping, et al.
Veröffentlicht: (2025)
von: Huang, Wei-Ping, et al.
Veröffentlicht: (2025)
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation
von: Le-Duc, Khai, et al.
Veröffentlicht: (2025)
von: Le-Duc, Khai, et al.
Veröffentlicht: (2025)
Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap
von: Yang, Guanrou, et al.
Veröffentlicht: (2024)
von: Yang, Guanrou, et al.
Veröffentlicht: (2024)
Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models
von: Huang, Wei-Ping, et al.
Veröffentlicht: (2026)
von: Huang, Wei-Ping, et al.
Veröffentlicht: (2026)
Initial Decoding with Minimally Augmented Language Model for Improved Lattice Rescoring in Low Resource ASR
von: Murthy, Savitha, et al.
Veröffentlicht: (2024)
von: Murthy, Savitha, et al.
Veröffentlicht: (2024)
C3LLM: Conditional Multimodal Content Generation Using Large Language Models
von: Wang, Zixuan, et al.
Veröffentlicht: (2024)
von: Wang, Zixuan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
AMPS: ASR with Multimodal Paraphrase Supervision
von: Gupta, Abhishek, et al.
Veröffentlicht: (2024) -
LASER: An LLM-based ASR Scoring and Evaluation Rubric
von: Parulekar, Amruta, et al.
Veröffentlicht: (2025) -
Improving Self-supervised Pre-training using Accent-Specific Codebooks
von: Prabhu, Darshan, et al.
Veröffentlicht: (2024) -
SALSA: Speedy ASR-LLM Synchronous Aggregation
von: Mittal, Ashish, et al.
Veröffentlicht: (2024) -
Multi-Convformer: Extending Conformer with Multiple Convolution Kernels
von: Prabhu, Darshan, et al.
Veröffentlicht: (2024)