Enregistré dans:
| Auteurs principaux: | Nethil, Kumarmanas, Mishra, Vaibhav, Anandan, Kriti, Manohar, Kavya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2507.01021 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multistage Fine-tuning Strategies for Automatic Speech Recognition in Low-resource Languages
par: Pillai, Leena G, et autres
Publié: (2024)
par: Pillai, Leena G, et autres
Publié: (2024)
PromptASR for contextualized ASR with controllable style
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
par: Gündüz, Ahmet, et autres
Publié: (2024)
par: Gündüz, Ahmet, et autres
Publié: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
Promptformer: Prompted Conformer Transducer for ASR
par: Duarte-Torres, Sergio, et autres
Publié: (2024)
par: Duarte-Torres, Sergio, et autres
Publié: (2024)
Qwen3-ASR Technical Report
par: Shi, Xian, et autres
Publié: (2026)
par: Shi, Xian, et autres
Publié: (2026)
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
Advancing Airport Tower Command Recognition: Integrating Squeeze-and-Excitation and Broadcasted Residual Learning
par: Lin, Yuanxi, et autres
Publié: (2024)
par: Lin, Yuanxi, et autres
Publié: (2024)
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
Exploring SSL Discrete Tokens for Multilingual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024)
par: Zhu, Harrison, et autres
Publié: (2024)
ManWav: The First Manchu ASR Model
par: Seo, Jean, et autres
Publié: (2024)
par: Seo, Jean, et autres
Publié: (2024)
Mamba for Streaming ASR Combined with Unimodal Aggregation
par: Fang, Ying, et autres
Publié: (2024)
par: Fang, Ying, et autres
Publié: (2024)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
par: Shakeel, Muhammad, et autres
Publié: (2025)
par: Shakeel, Muhammad, et autres
Publié: (2025)
Causal Structure Discovery for Error Diagnostics of Children's ASR
par: Singh, Vishwanath Pratap, et autres
Publié: (2025)
par: Singh, Vishwanath Pratap, et autres
Publié: (2025)
Performant ASR Models for Medical Entities in Accented Speech
par: Afonja, Tejumade, et autres
Publié: (2024)
par: Afonja, Tejumade, et autres
Publié: (2024)
Reverb: Open-Source ASR and Diarization from Rev
par: Bhandari, Nishchal, et autres
Publié: (2024)
par: Bhandari, Nishchal, et autres
Publié: (2024)
ASR Error Correction using Large Language Models
par: Ma, Rao, et autres
Publié: (2024)
par: Ma, Rao, et autres
Publié: (2024)
WER We Stand: Benchmarking Urdu ASR Models
par: Arif, Samee, et autres
Publié: (2024)
par: Arif, Samee, et autres
Publié: (2024)
Extending Whisper with prompt tuning to target-speaker ASR
par: Ma, Hao, et autres
Publié: (2023)
par: Ma, Hao, et autres
Publié: (2023)
Crossmodal ASR Error Correction with Discrete Speech Units
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Advocating Character Error Rate for Multilingual ASR Evaluation
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
par: Zhang, Yu, et autres
Publié: (2023)
par: Zhang, Yu, et autres
Publié: (2023)
Vedavani: A Benchmark Corpus for ASR on Vedic Sanskrit Poetry
par: Kumar, Sujeet, et autres
Publié: (2025)
par: Kumar, Sujeet, et autres
Publié: (2025)
Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR
par: Irigoyen, Julian, et autres
Publié: (2025)
par: Irigoyen, Julian, et autres
Publié: (2025)
ASR Benchmarking: Need for a More Representative Conversational Dataset
par: Maheshwari, Gaurav, et autres
Publié: (2024)
par: Maheshwari, Gaurav, et autres
Publié: (2024)
Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices
par: Velikovich, Leonid, et autres
Publié: (2024)
par: Velikovich, Leonid, et autres
Publié: (2024)
OCR-Enhanced Multimodal ASR Can Read While Listening
par: Chen, Junli, et autres
Publié: (2026)
par: Chen, Junli, et autres
Publié: (2026)
ProGRes: Prompted Generative Rescoring on ASR n-Best
par: Tur, Ada Defne, et autres
Publié: (2024)
par: Tur, Ada Defne, et autres
Publié: (2024)
Alignment-Free Training for Transducer-based Multi-Talker ASR
par: Moriya, Takafumi, et autres
Publié: (2024)
par: Moriya, Takafumi, et autres
Publié: (2024)
Locality enhanced dynamic biasing and sampling strategies for contextual ASR
par: Jalal, Md Asif, et autres
Publié: (2024)
par: Jalal, Md Asif, et autres
Publié: (2024)
The THUEE System Description for the IARPA OpenASR21 Challenge
par: Zhao, Jing, et autres
Publié: (2022)
par: Zhao, Jing, et autres
Publié: (2022)
Quantizing Whisper-small: How design choices affect ASR performance
par: Söhler, Arthur, et autres
Publié: (2025)
par: Söhler, Arthur, et autres
Publié: (2025)
ASR-FAIRBENCH: Measuring and Benchmarking Equity Across Speech Recognition Systems
par: Rai, Anand, et autres
Publié: (2025)
par: Rai, Anand, et autres
Publié: (2025)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
par: Orhon, Atila, et autres
Publié: (2025)
par: Orhon, Atila, et autres
Publié: (2025)
Documents similaires
-
Multistage Fine-tuning Strategies for Automatic Speech Recognition in Low-resource Languages
par: Pillai, Leena G, et autres
Publié: (2024) -
PromptASR for contextualized ASR with controllable style
par: Yang, Xiaoyu, et autres
Publié: (2023) -
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024) -
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
par: Gündüz, Ahmet, et autres
Publié: (2024) -
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)