Dolphin: A Large-Scale Automatic Speech Recognition Model for Eastern Languages
Fuente:
arXiv
Guardado en:
| Autores principales: | Meng, Yangyang, Li, Jinpeng, Lin, Guodong, Pu, Yu, Wang, Guanbo, Du, Hu, Shao, Zhiming, Huang, Yukai, Li, Ke, Zhang, Wei-Qiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dolphin-CN-Dialect: Where Chinese Dialects Matter
por: Meng, Yangyang, et al.
Publicado: (2026)
por: Meng, Yangyang, et al.
Publicado: (2026)
SpeechColab Leaderboard: An Open-Source Platform for Automatic Speech Recognition Evaluation
por: Du, Jiayu, et al.
Publicado: (2024)
por: Du, Jiayu, et al.
Publicado: (2024)
Improving Whisper's Recognition Performance for Under-Represented Language Kazakh Leveraging Unpaired Speech and Text
por: Li, Jinpeng, et al.
Publicado: (2024)
por: Li, Jinpeng, et al.
Publicado: (2024)
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
por: Lin, Yuke, et al.
Publicado: (2025)
por: Lin, Yuke, et al.
Publicado: (2025)
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
por: Wang, Pu, et al.
Publicado: (2024)
por: Wang, Pu, et al.
Publicado: (2024)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
por: Alsayegh, Ali, et al.
Publicado: (2025)
por: Alsayegh, Ali, et al.
Publicado: (2025)
The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
por: Lin, Yuke, et al.
Publicado: (2025)
por: Lin, Yuke, et al.
Publicado: (2025)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
por: Tian, Jingguang, et al.
Publicado: (2024)
por: Tian, Jingguang, et al.
Publicado: (2024)
UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition
por: Fu, Li, et al.
Publicado: (2024)
por: Fu, Li, et al.
Publicado: (2024)
Multi-stage Large Language Model Correction for Speech Recognition
por: Pu, Jie, et al.
Publicado: (2023)
por: Pu, Jie, et al.
Publicado: (2023)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
por: Fu, Li, et al.
Publicado: (2025)
por: Fu, Li, et al.
Publicado: (2025)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
por: Xue, Hongfei, et al.
Publicado: (2024)
por: Xue, Hongfei, et al.
Publicado: (2024)
Tiny-Align: Bridging Automatic Speech Recognition and Large Language Model on the Edge
por: Qin, Ruiyang, et al.
Publicado: (2024)
por: Qin, Ruiyang, et al.
Publicado: (2024)
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech
por: Bhattacharjee, Susmita, et al.
Publicado: (2025)
por: Bhattacharjee, Susmita, et al.
Publicado: (2025)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
por: Hu, Jiliang, et al.
Publicado: (2025)
por: Hu, Jiliang, et al.
Publicado: (2025)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025)
por: Wei, Linye, et al.
Publicado: (2025)
Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS
por: Aronowitz, Hagai, et al.
Publicado: (2026)
por: Aronowitz, Hagai, et al.
Publicado: (2026)
Emo-bias: A Large Scale Evaluation of Social Bias on Speech Emotion Recognition
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Unsupervised Online Continual Learning for Automatic Speech Recognition
por: Eeckt, Steven Vander, et al.
Publicado: (2024)
por: Eeckt, Steven Vander, et al.
Publicado: (2024)
Using Songs to Improve Kazakh Automatic Speech Recognition
por: Yeshpanov, Rustem
Publicado: (2026)
por: Yeshpanov, Rustem
Publicado: (2026)
Multi-Scale Temporal Transformer For Speech Emotion Recognition
por: Li, Zhipeng, et al.
Publicado: (2024)
por: Li, Zhipeng, et al.
Publicado: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
A Survey on Speech Large Language Models for Understanding
por: Peng, Jing, et al.
Publicado: (2024)
por: Peng, Jing, et al.
Publicado: (2024)
Integrating Pause Information with Word Embeddings in Language Models for Alzheimer's Disease Detection from Spontaneous Speech
por: Pu, Yu, et al.
Publicado: (2025)
por: Pu, Yu, et al.
Publicado: (2025)
Non-Intrusive Automatic Speech Recognition Refinement: A Survey
por: Peyghan, Mohammad Reza, et al.
Publicado: (2025)
por: Peyghan, Mohammad Reza, et al.
Publicado: (2025)
Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement
por: de Oliveira, Danilo, et al.
Publicado: (2026)
por: de Oliveira, Danilo, et al.
Publicado: (2026)
Gradient Norm-based Fine-Tuning for Backdoor Defense in Automatic Speech Recognition
por: Zhou, Nanjun, et al.
Publicado: (2025)
por: Zhou, Nanjun, et al.
Publicado: (2025)
Semantically Corrected Amharic Automatic Speech Recognition
por: Adnew, Samuael, et al.
Publicado: (2024)
por: Adnew, Samuael, et al.
Publicado: (2024)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
por: Kim, Jongsuk, et al.
Publicado: (2025)
por: Kim, Jongsuk, et al.
Publicado: (2025)
Group-Aware Partial Model Merging for Children's Automatic Speech Recognition
por: Rolland, Thomas, et al.
Publicado: (2025)
por: Rolland, Thomas, et al.
Publicado: (2025)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
Automatic Screening for Children with Speech Disorder using Automatic Speech Recognition: Opportunities and Challenges
por: Liu, Dancheng, et al.
Publicado: (2024)
por: Liu, Dancheng, et al.
Publicado: (2024)
An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the context of Large Language Model (LLM) powered applications
por: Pulikodan, Sujith, et al.
Publicado: (2025)
por: Pulikodan, Sujith, et al.
Publicado: (2025)
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
por: Cohen, Eyal, et al.
Publicado: (2025)
por: Cohen, Eyal, et al.
Publicado: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
por: Wang, Yujin, et al.
Publicado: (2022)
por: Wang, Yujin, et al.
Publicado: (2022)
Benchmarking Automatic Speech Recognition Models for African Languages
por: Nahabwe, Alvin, et al.
Publicado: (2025)
por: Nahabwe, Alvin, et al.
Publicado: (2025)
Automatic Speech Recognition for Biomedical Data in Bengali Language
por: Kabir, Shariar, et al.
Publicado: (2024)
por: Kabir, Shariar, et al.
Publicado: (2024)
Improving Automatic Speech Recognition with Decoder-Centric Regularisation in Encoder-Decoder Models
por: Polok, Alexander, et al.
Publicado: (2024)
por: Polok, Alexander, et al.
Publicado: (2024)
Ejemplares similares
-
Dolphin-CN-Dialect: Where Chinese Dialects Matter
por: Meng, Yangyang, et al.
Publicado: (2026) -
SpeechColab Leaderboard: An Open-Source Platform for Automatic Speech Recognition Evaluation
por: Du, Jiayu, et al.
Publicado: (2024) -
Improving Whisper's Recognition Performance for Under-Represented Language Kazakh Leveraging Unpaired Speech and Text
por: Li, Jinpeng, et al.
Publicado: (2024) -
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
por: Lin, Yuke, et al.
Publicado: (2025) -
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
por: Wang, Pu, et al.
Publicado: (2024)