Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Srivastav, Vaibhav, Zheng, Steven, Bezzam, Eric, Bihan, Eustache Le, Koluguri, Nithin Rao, Żelasko, Piotr, Majumdar, Somshubra, Moumen, Adel, Gandhi, Sanchit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024)
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024)
Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST
di: Sekoyan, Monica, et al.
Pubblicazione: (2025)
di: Sekoyan, Monica, et al.
Pubblicazione: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
di: Dhawan, Kunal, et al.
Pubblicazione: (2024)
di: Dhawan, Kunal, et al.
Pubblicazione: (2024)
BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5
di: Chen, Zhehuai, et al.
Pubblicazione: (2024)
di: Chen, Zhehuai, et al.
Pubblicazione: (2024)
ViSpeR: Multilingual Audio-Visual Speech Recognition
di: Narayan, Sanath, et al.
Pubblicazione: (2024)
di: Narayan, Sanath, et al.
Pubblicazione: (2024)
Training and Inference Efficiency of Encoder-Decoder Speech Models
di: Żelasko, Piotr, et al.
Pubblicazione: (2025)
di: Żelasko, Piotr, et al.
Pubblicazione: (2025)
ProGRes: Prompted Generative Rescoring on ASR n-Best
di: Tur, Ada Defne, et al.
Pubblicazione: (2024)
di: Tur, Ada Defne, et al.
Pubblicazione: (2024)
Open Universal Arabic ASR Leaderboard
di: Wang, Yingzhi, et al.
Pubblicazione: (2024)
di: Wang, Yingzhi, et al.
Pubblicazione: (2024)
Multi-blank Transducers for Speech Recognition
di: Xu, Hainan, et al.
Pubblicazione: (2022)
di: Xu, Hainan, et al.
Pubblicazione: (2022)
Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2024)
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2024)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
di: Langman, Ryan, et al.
Pubblicazione: (2024)
di: Langman, Ryan, et al.
Pubblicazione: (2024)
Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages
di: Omnilingual ASR team, et al.
Pubblicazione: (2025)
di: Omnilingual ASR team, et al.
Pubblicazione: (2025)
Stateful Conformer with Cache-based Inference for Streaming Automatic Speech Recognition
di: Noroozi, Vahid, et al.
Pubblicazione: (2023)
di: Noroozi, Vahid, et al.
Pubblicazione: (2023)
SpeechColab Leaderboard: An Open-Source Platform for Automatic Speech Recognition Evaluation
di: Du, Jiayu, et al.
Pubblicazione: (2024)
di: Du, Jiayu, et al.
Pubblicazione: (2024)
Cross-Lingual Interleaving for Speech Language Models
di: Moumen, Adel, et al.
Pubblicazione: (2025)
di: Moumen, Adel, et al.
Pubblicazione: (2025)
Measuring the Redundancy of Decoder Layers in SpeechLLMs
di: Moumen, Adel, et al.
Pubblicazione: (2026)
di: Moumen, Adel, et al.
Pubblicazione: (2026)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR
di: Wang, Jinhan, et al.
Pubblicazione: (2024)
di: Wang, Jinhan, et al.
Pubblicazione: (2024)
Adversarial Attacks and Defenses for Speech Recognition Systems
di: Żelasko, Piotr, et al.
Pubblicazione: (2021)
di: Żelasko, Piotr, et al.
Pubblicazione: (2021)
Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages
di: Abdullah, Badr M., et al.
Pubblicazione: (2026)
di: Abdullah, Badr M., et al.
Pubblicazione: (2026)
Reliable, Reproducible, and Really Fast Leaderboards with Evalica
di: Ustalov, Dmitry
Pubblicazione: (2024)
di: Ustalov, Dmitry
Pubblicazione: (2024)
Granary: Speech Recognition and Translation Dataset in 25 European Languages
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2025)
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2025)
GetBatch: Distributed Multi-Object Retrieval for ML Data Loading
di: Aizman, Alex, et al.
Pubblicazione: (2026)
di: Aizman, Alex, et al.
Pubblicazione: (2026)
Configurable Multilingual ASR with Speech Summary Representations
di: Zhu, Harrison, et al.
Pubblicazione: (2024)
di: Zhu, Harrison, et al.
Pubblicazione: (2024)
Probing Instanton Dynamics in the Pion Vector Form Factor with Wilson Flow
di: Chahar, Vaibhav, et al.
Pubblicazione: (2026)
di: Chahar, Vaibhav, et al.
Pubblicazione: (2026)
Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
di: Park, Taejin, et al.
Pubblicazione: (2024)
di: Park, Taejin, et al.
Pubblicazione: (2024)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
di: Huang, He, et al.
Pubblicazione: (2024)
di: Huang, He, et al.
Pubblicazione: (2024)
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
di: Noroozi, Vahid, et al.
Pubblicazione: (2024)
di: Noroozi, Vahid, et al.
Pubblicazione: (2024)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)
di: Ahmad, Wasi Uddin, et al.
Pubblicazione: (2025)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
di: Ngo, Huong, et al.
Pubblicazione: (2025)
di: Ngo, Huong, et al.
Pubblicazione: (2025)
Speech Emotion Recognition with ASR Integration
di: Li, Yuanchao
Pubblicazione: (2026)
di: Li, Yuanchao
Pubblicazione: (2026)
Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems
di: Joshi, Sonal, et al.
Pubblicazione: (2021)
di: Joshi, Sonal, et al.
Pubblicazione: (2021)
A UNIMARC Bibliographic Format Database for ABCD
di: Megnigbeto, Eustache
Pubblicazione: (2012)
di: Megnigbeto, Eustache
Pubblicazione: (2012)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
Beyond the Numbers: Transparency in Relation Extraction Benchmark Creation and Leaderboards
di: Arzt, Varvara, et al.
Pubblicazione: (2024)
di: Arzt, Varvara, et al.
Pubblicazione: (2024)
Zero-Shot End-To-End Spoken Question Answering In Medical Domain
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
A Vision for Geo-Temporal Deep Research Systems: Towards Comprehensive, Transparent, and Reproducible Geo-Temporal Information Synthesis
di: Martins, Bruno, et al.
Pubblicazione: (2025)
di: Martins, Bruno, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024) -
Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST
di: Sekoyan, Monica, et al.
Pubblicazione: (2025) -
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
di: Dhawan, Kunal, et al.
Pubblicazione: (2024) -
BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5
di: Chen, Zhehuai, et al.
Pubblicazione: (2024) -
ViSpeR: Multilingual Audio-Visual Speech Recognition
di: Narayan, Sanath, et al.
Pubblicazione: (2024)