Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Weiqing, Dhawan, Kunal, Park, Taejin, Puvvada, Krishna C., Medennikov, Ivan, Majumdar, Somshubra, Huang, He, Balam, Jagadeesh, Ginsburg, Boris |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
por: Wang, Weiqing, et al.
Publicado: (2025)
por: Wang, Weiqing, et al.
Publicado: (2025)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
por: Medennikov, Ivan, et al.
Publicado: (2025)
por: Medennikov, Ivan, et al.
Publicado: (2025)
META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR
por: Wang, Jinhan, et al.
Publicado: (2024)
por: Wang, Jinhan, et al.
Publicado: (2024)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
por: Huang, He, et al.
Publicado: (2024)
por: Huang, He, et al.
Publicado: (2024)
Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
por: Park, Taejin, et al.
Publicado: (2024)
por: Park, Taejin, et al.
Publicado: (2024)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
por: Grossman, Raymond, et al.
Publicado: (2025)
por: Grossman, Raymond, et al.
Publicado: (2025)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
por: Puvvada, Krishna C., et al.
Publicado: (2024)
por: Puvvada, Krishna C., et al.
Publicado: (2024)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
por: Burchi, Maxime, et al.
Publicado: (2024)
por: Burchi, Maxime, et al.
Publicado: (2024)
Multi-blank Transducers for Speech Recognition
por: Xu, Hainan, et al.
Publicado: (2022)
por: Xu, Hainan, et al.
Publicado: (2022)
Stateful Conformer with Cache-based Inference for Streaming Automatic Speech Recognition
por: Noroozi, Vahid, et al.
Publicado: (2023)
por: Noroozi, Vahid, et al.
Publicado: (2023)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
por: Dhawan, Kunal, et al.
Publicado: (2024)
por: Dhawan, Kunal, et al.
Publicado: (2024)
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
por: Noroozi, Vahid, et al.
Publicado: (2024)
por: Noroozi, Vahid, et al.
Publicado: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5
por: Chen, Zhehuai, et al.
Publicado: (2024)
por: Chen, Zhehuai, et al.
Publicado: (2024)
VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend
por: Jukić, Ante, et al.
Publicado: (2024)
por: Jukić, Ante, et al.
Publicado: (2024)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
por: Li, Shaojun, et al.
Publicado: (2024)
por: Li, Shaojun, et al.
Publicado: (2024)
Training and Inference Efficiency of Encoder-Decoder Speech Models
por: Żelasko, Piotr, et al.
Publicado: (2025)
por: Żelasko, Piotr, et al.
Publicado: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
por: Zhao, Qiuming, et al.
Publicado: (2024)
por: Zhao, Qiuming, et al.
Publicado: (2024)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
por: Hu, Shujie, et al.
Publicado: (2024)
por: Hu, Shujie, et al.
Publicado: (2024)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
por: Park, Nohil, et al.
Publicado: (2024)
por: Park, Nohil, et al.
Publicado: (2024)
Schrödinger Bridge for Generative Speech Enhancement
por: Jukić, Ante, et al.
Publicado: (2024)
por: Jukić, Ante, et al.
Publicado: (2024)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
por: HU, Shujie, et al.
Publicado: (2025)
por: HU, Shujie, et al.
Publicado: (2025)
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data
por: Lu, Ke-Han, et al.
Publicado: (2024)
por: Lu, Ke-Han, et al.
Publicado: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
por: Shankar, Natarajan Balaji, et al.
Publicado: (2024)
por: Shankar, Natarajan Balaji, et al.
Publicado: (2024)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
por: Yang, Yufeng, et al.
Publicado: (2025)
por: Yang, Yufeng, et al.
Publicado: (2025)
Target Speaker ASR with Whisper
por: Polok, Alexander, et al.
Publicado: (2024)
por: Polok, Alexander, et al.
Publicado: (2024)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
por: Yang, Chao-Han Huck, et al.
Publicado: (2024)
por: Yang, Chao-Han Huck, et al.
Publicado: (2024)
EMMeTT: Efficient Multimodal Machine Translation Training
por: Żelasko, Piotr, et al.
Publicado: (2024)
por: Żelasko, Piotr, et al.
Publicado: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
por: Ma, Hao, et al.
Publicado: (2025)
por: Ma, Hao, et al.
Publicado: (2025)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
por: Horiguchi, Shota, et al.
Publicado: (2025)
por: Horiguchi, Shota, et al.
Publicado: (2025)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
por: Guo, Pengcheng, et al.
Publicado: (2024)
por: Guo, Pengcheng, et al.
Publicado: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
por: Nguyen, Thai-Binh, et al.
Publicado: (2024)
por: Nguyen, Thai-Binh, et al.
Publicado: (2024)
Romanization Encoding For Multilingual ASR
por: Ding, Wen, et al.
Publicado: (2024)
por: Ding, Wen, et al.
Publicado: (2024)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
por: Feng, Tiantian, et al.
Publicado: (2025)
por: Feng, Tiantian, et al.
Publicado: (2025)
Joint ASR and Speaker Role Tagging with Serialized Output Training
por: Xu, Anfeng, et al.
Publicado: (2025)
por: Xu, Anfeng, et al.
Publicado: (2025)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
por: He, Xiluo, et al.
Publicado: (2025)
por: He, Xiluo, et al.
Publicado: (2025)
Enhancing Speaker-Independent Dysarthric Speech Severity Classification with DSSCNet and Cross-Corpus Adaptation
por: Roy, Arnab Kumar, et al.
Publicado: (2025)
por: Roy, Arnab Kumar, et al.
Publicado: (2025)
Ejemplares similares
-
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
por: Wang, Weiqing, et al.
Publicado: (2025) -
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
por: Medennikov, Ivan, et al.
Publicado: (2025) -
META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR
por: Wang, Jinhan, et al.
Publicado: (2024) -
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
por: Huang, He, et al.
Publicado: (2024) -
Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
por: Park, Taejin, et al.
Publicado: (2024)