Configurable Multilingual ASR with Speech Summary Representations
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Harrison, Fung, Ivan, Zhu, Yingke, Samarakoon, Lahiru |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Romanization Encoding For Multilingual ASR
por: Ding, Wen, et al.
Publicado: (2024)
por: Ding, Wen, et al.
Publicado: (2024)
EEND-M2F: Masked-attention mask transformers for speaker diarization
por: Härkönen, Marc, et al.
Publicado: (2024)
por: Härkönen, Marc, et al.
Publicado: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
por: Nguyen, Thai-Binh, et al.
Publicado: (2024)
por: Nguyen, Thai-Binh, et al.
Publicado: (2024)
Exploring SSL Discrete Tokens for Multilingual ASR
por: Cui, Mingyu, et al.
Publicado: (2024)
por: Cui, Mingyu, et al.
Publicado: (2024)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
por: Shi, Xiaohan, et al.
Publicado: (2023)
por: Shi, Xiaohan, et al.
Publicado: (2023)
Advocating Character Error Rate for Multilingual ASR Evaluation
por: K, Thennal D, et al.
Publicado: (2024)
por: K, Thennal D, et al.
Publicado: (2024)
Speech Editing -- a Summary
por: Kässmann, Tobias, et al.
Publicado: (2024)
por: Kässmann, Tobias, et al.
Publicado: (2024)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
por: Zheng, Zhisheng, et al.
Publicado: (2025)
por: Zheng, Zhisheng, et al.
Publicado: (2025)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
por: Xue, Hongfei, et al.
Publicado: (2023)
por: Xue, Hongfei, et al.
Publicado: (2023)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
por: Kwok, Chin Yuen, et al.
Publicado: (2024)
por: Kwok, Chin Yuen, et al.
Publicado: (2024)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
por: Li, Jiahong, et al.
Publicado: (2025)
por: Li, Jiahong, et al.
Publicado: (2025)
Performant ASR Models for Medical Entities in Accented Speech
por: Afonja, Tejumade, et al.
Publicado: (2024)
por: Afonja, Tejumade, et al.
Publicado: (2024)
Crossmodal ASR Error Correction with Discrete Speech Units
por: Li, Yuanchao, et al.
Publicado: (2024)
por: Li, Yuanchao, et al.
Publicado: (2024)
SpeechTaxi: On Multilingual Semantic Speech Classification
por: Keller, Lennart, et al.
Publicado: (2024)
por: Keller, Lennart, et al.
Publicado: (2024)
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
por: Yan, Brian, et al.
Publicado: (2024)
por: Yan, Brian, et al.
Publicado: (2024)
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
por: Lee, Beomseok, et al.
Publicado: (2024)
por: Lee, Beomseok, et al.
Publicado: (2024)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
por: Cui, Mingyu, et al.
Publicado: (2024)
por: Cui, Mingyu, et al.
Publicado: (2024)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
por: Jung, Yeonjoon, et al.
Publicado: (2024)
por: Jung, Yeonjoon, et al.
Publicado: (2024)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
por: Fan, Ruchao, et al.
Publicado: (2024)
por: Fan, Ruchao, et al.
Publicado: (2024)
ASR-FAIRBENCH: Measuring and Benchmarking Equity Across Speech Recognition Systems
por: Rai, Anand, et al.
Publicado: (2025)
por: Rai, Anand, et al.
Publicado: (2025)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
por: Nguyen, Tuan, et al.
Publicado: (2025)
por: Nguyen, Tuan, et al.
Publicado: (2025)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
por: Wang, He, et al.
Publicado: (2025)
por: Wang, He, et al.
Publicado: (2025)
LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration
por: Lee, Sangmin, et al.
Publicado: (2024)
por: Lee, Sangmin, et al.
Publicado: (2024)
Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
por: Huang, W. Ronny, et al.
Publicado: (2024)
por: Huang, W. Ronny, et al.
Publicado: (2024)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
por: Xu, Tianyi, et al.
Publicado: (2024)
por: Xu, Tianyi, et al.
Publicado: (2024)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
por: Mdhaffar, Salima, et al.
Publicado: (2024)
por: Mdhaffar, Salima, et al.
Publicado: (2024)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
por: Yuhang, Yang, et al.
Publicado: (2024)
por: Yuhang, Yang, et al.
Publicado: (2024)
Classification of Spontaneous and Scripted Speech for Multilingual Audio
por: Elisha, Shahar, et al.
Publicado: (2024)
por: Elisha, Shahar, et al.
Publicado: (2024)
CAMEO: Collection of Multilingual Emotional Speech Corpora
por: Christop, Iwona, et al.
Publicado: (2025)
por: Christop, Iwona, et al.
Publicado: (2025)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
por: Zheng, Yuang, et al.
Publicado: (2026)
por: Zheng, Yuang, et al.
Publicado: (2026)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
por: Fan, Ruchao, et al.
Publicado: (2024)
por: Fan, Ruchao, et al.
Publicado: (2024)
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
por: Kumar, Shashi, et al.
Publicado: (2024)
por: Kumar, Shashi, et al.
Publicado: (2024)
Advancing Hearing Assessment: An ASR-Based Frequency-Specific Speech Test for Diagnosing Presbycusis
por: Bleeck, Stefan
Publicado: (2025)
por: Bleeck, Stefan
Publicado: (2025)
ASR Under the Stethoscope: Evaluating Biases in Clinical Speech Recognition across Indian Languages
por: Kumar, Subham, et al.
Publicado: (2025)
por: Kumar, Subham, et al.
Publicado: (2025)
Echotune: A Modular Extractor Leveraging the Variable-Length Nature of Speech in ASR Tasks
por: Chen, Sizhou, et al.
Publicado: (2023)
por: Chen, Sizhou, et al.
Publicado: (2023)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
por: Shi, Jiatong, et al.
Publicado: (2023)
por: Shi, Jiatong, et al.
Publicado: (2023)
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
por: Srivastav, Vaibhav, et al.
Publicado: (2025)
por: Srivastav, Vaibhav, et al.
Publicado: (2025)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
por: Adila, Aulia, et al.
Publicado: (2024)
por: Adila, Aulia, et al.
Publicado: (2024)
PromptASR for contextualized ASR with controllable style
por: Yang, Xiaoyu, et al.
Publicado: (2023)
por: Yang, Xiaoyu, et al.
Publicado: (2023)
Anatomy of Industrial Scale Multilingual ASR
por: Ramirez, Francis McCann, et al.
Publicado: (2024)
por: Ramirez, Francis McCann, et al.
Publicado: (2024)
Ejemplares similares
-
Romanization Encoding For Multilingual ASR
por: Ding, Wen, et al.
Publicado: (2024) -
EEND-M2F: Masked-attention mask transformers for speaker diarization
por: Härkönen, Marc, et al.
Publicado: (2024) -
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
por: Nguyen, Thai-Binh, et al.
Publicado: (2024) -
Exploring SSL Discrete Tokens for Multilingual ASR
por: Cui, Mingyu, et al.
Publicado: (2024) -
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
por: Shi, Xiaohan, et al.
Publicado: (2023)