LASER: An LLM-based ASR Scoring and Evaluation Rubric
Fuente:
arXiv
Salvato in:
| Autori principali: | Parulekar, Amruta, Jyothi, Preethi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AMPS: ASR with Multimodal Paraphrase Supervision
di: Gupta, Abhishek, et al.
Pubblicazione: (2024)
di: Gupta, Abhishek, et al.
Pubblicazione: (2024)
Parameter-efficient Adaptation of Multilingual Multimodal Models for Low-resource ASR
di: Gupta, Abhishek, et al.
Pubblicazione: (2024)
di: Gupta, Abhishek, et al.
Pubblicazione: (2024)
SALSA: Speedy ASR-LLM Synchronous Aggregation
di: Mittal, Ashish, et al.
Pubblicazione: (2024)
di: Mittal, Ashish, et al.
Pubblicazione: (2024)
Multi-Convformer: Extending Conformer with Multiple Convolution Kernels
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
Improving Self-supervised Pre-training using Accent-Specific Codebooks
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
di: Kumar, Shashi, et al.
Pubblicazione: (2026)
di: Kumar, Shashi, et al.
Pubblicazione: (2026)
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
di: Shankar, Bhavani, et al.
Pubblicazione: (2024)
di: Shankar, Bhavani, et al.
Pubblicazione: (2024)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
Dynamic ASR Pathways: An Adaptive Masking Approach Towards Efficient Pruning of A Multilingual ASR Model
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
di: Andrusenko, Andrei, et al.
Pubblicazione: (2024)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2024)
Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages
di: Pandey, Isha, et al.
Pubblicazione: (2025)
di: Pandey, Isha, et al.
Pubblicazione: (2025)
CTC-Assisted LLM-Based Contextual ASR
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
Better Pseudo-labeling with Multi-ASR Fusion and Error Correction by SpeechLLM
di: Prakash, Jeena, et al.
Pubblicazione: (2025)
di: Prakash, Jeena, et al.
Pubblicazione: (2025)
Contextualization of ASR with LLM using phonetic retrieval-based augmentation
di: Lei, Zhihong, et al.
Pubblicazione: (2024)
di: Lei, Zhihong, et al.
Pubblicazione: (2024)
Beyond Oversmoothing: Evaluating DDPM and MSE for Scalable Speech Synthesis in ASR
di: Minixhofer, Christoph, et al.
Pubblicazione: (2024)
di: Minixhofer, Christoph, et al.
Pubblicazione: (2024)
The Speech-LLM Takes It All: A Truly Fully End-to-End Spoken Dialogue State Tracking Approach
di: Ghazal, Nizar El, et al.
Pubblicazione: (2025)
di: Ghazal, Nizar El, et al.
Pubblicazione: (2025)
Text-only adaptation in LLM-based ASR through text denoising
di: Carofilis, Andrés, et al.
Pubblicazione: (2026)
di: Carofilis, Andrés, et al.
Pubblicazione: (2026)
Datasheets Aren't Enough: DataRubrics for Automated Quality Metrics and Accountability
di: Winata, Genta Indra, et al.
Pubblicazione: (2025)
di: Winata, Genta Indra, et al.
Pubblicazione: (2025)
The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
TIPAA-SSL: Text Independent Phone-to-Audio Alignment based on Self-Supervised Learning and Knowledge Transfer
di: Tits, Noé, et al.
Pubblicazione: (2024)
di: Tits, Noé, et al.
Pubblicazione: (2024)
Pronunciation-Lexicon Free Training for Phoneme-based Crosslingual ASR via Joint Stochastic Approximation
di: Yusuyin, Saierdaer, et al.
Pubblicazione: (2025)
di: Yusuyin, Saierdaer, et al.
Pubblicazione: (2025)
ASR-Synchronized Speaker-Role Diarization
di: Ghosh, Arindam, et al.
Pubblicazione: (2025)
di: Ghosh, Arindam, et al.
Pubblicazione: (2025)
PSRB: A Comprehensive Benchmark for Evaluating Persian ASR Systems
di: Sedghiyeh, Nima, et al.
Pubblicazione: (2025)
di: Sedghiyeh, Nima, et al.
Pubblicazione: (2025)
Enhancing ASR Performance in the Medical Domain for Dravidian Languages
di: Devarakonda, Sri Charan, et al.
Pubblicazione: (2026)
di: Devarakonda, Sri Charan, et al.
Pubblicazione: (2026)
CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models
di: He, Jiajun, et al.
Pubblicazione: (2025)
di: He, Jiajun, et al.
Pubblicazione: (2025)
Framework for Curating Speech Datasets and Evaluating ASR Systems: A Case Study for Polish
di: Junczyk, Michał
Pubblicazione: (2024)
di: Junczyk, Michał
Pubblicazione: (2024)
Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR
di: Wu, Zelin, et al.
Pubblicazione: (2024)
di: Wu, Zelin, et al.
Pubblicazione: (2024)
TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
C3LLM: Conditional Multimodal Content Generation Using Large Language Models
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
PhonologyBench: Evaluating Phonological Skills of Large Language Models
di: Suvarna, Ashima, et al.
Pubblicazione: (2024)
di: Suvarna, Ashima, et al.
Pubblicazione: (2024)
Utterance-Level Methods for Identifying Reliable ASR-Output for Child Speech
di: Lathouwers, Gus, et al.
Pubblicazione: (2026)
di: Lathouwers, Gus, et al.
Pubblicazione: (2026)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
Fun-ASR Technical Report
di: An, Keyu, et al.
Pubblicazione: (2025)
di: An, Keyu, et al.
Pubblicazione: (2025)
Leveraging Allophony in Self-Supervised Speech Models for Atypical Pronunciation Assessment
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AMPS: ASR with Multimodal Paraphrase Supervision
di: Gupta, Abhishek, et al.
Pubblicazione: (2024) -
Parameter-efficient Adaptation of Multilingual Multimodal Models for Low-resource ASR
di: Gupta, Abhishek, et al.
Pubblicazione: (2024) -
SALSA: Speedy ASR-LLM Synchronous Aggregation
di: Mittal, Ashish, et al.
Pubblicazione: (2024) -
Multi-Convformer: Extending Conformer with Multiple Convolution Kernels
di: Prabhu, Darshan, et al.
Pubblicazione: (2024) -
Improving Self-supervised Pre-training using Accent-Specific Codebooks
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)