Mind the Gap: Entity-Preserved Context-Aware ASR Structured Transcriptions
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Altinok, Duygu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Boosting CTC-Based ASR Using LLM-Based Intermediate Loss Regularization
par: Altinok, Duygu
Publié: (2025)
par: Altinok, Duygu
Publié: (2025)
Smooth Operators: LLMs Translating Imperfect Hints into Disfluency-Rich Transcripts
par: Altinok, Duygu
Publié: (2025)
par: Altinok, Duygu
Publié: (2025)
Performant ASR Models for Medical Entities in Accented Speech
par: Afonja, Tejumade, et autres
Publié: (2024)
par: Afonja, Tejumade, et autres
Publié: (2024)
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
par: Adedeji, Ayo, et autres
Publié: (2024)
par: Adedeji, Ayo, et autres
Publié: (2024)
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
par: Wang, Zilai, et autres
Publié: (2026)
par: Wang, Zilai, et autres
Publié: (2026)
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
par: Liang, Siyu, et autres
Publié: (2025)
par: Liang, Siyu, et autres
Publié: (2025)
Beyond Transcription: Mechanistic Interpretability in ASR
par: Glazer, Neta, et autres
Publié: (2025)
par: Glazer, Neta, et autres
Publié: (2025)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR
par: Irigoyen, Julian, et autres
Publié: (2025)
par: Irigoyen, Julian, et autres
Publié: (2025)
Mind the Gap! Static and Interactive Evaluations of Large Audio Models
par: Li, Minzhi, et autres
Publié: (2025)
par: Li, Minzhi, et autres
Publié: (2025)
Causal Structure Discovery for Error Diagnostics of Children's ASR
par: Singh, Vishwanath Pratap, et autres
Publié: (2025)
par: Singh, Vishwanath Pratap, et autres
Publié: (2025)
Context-Enhanced Granular Edit Representation for Efficient and Accurate ASR Post-editing
par: Vejsiu, Luan, et autres
Publié: (2025)
par: Vejsiu, Luan, et autres
Publié: (2025)
How Much Context Does My Attention-Based ASR System Need?
par: Flynn, Robert, et autres
Publié: (2023)
par: Flynn, Robert, et autres
Publié: (2023)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
PromptASR for contextualized ASR with controllable style
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
Alzheimer Disease Classification through ASR-based Transcriptions: Exploring the Impact of Punctuation and Pauses
par: Gómez-Zaragozá, Lucía, et autres
Publié: (2023)
par: Gómez-Zaragozá, Lucía, et autres
Publié: (2023)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
par: Gündüz, Ahmet, et autres
Publié: (2024)
par: Gündüz, Ahmet, et autres
Publié: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
Promptformer: Prompted Conformer Transducer for ASR
par: Duarte-Torres, Sergio, et autres
Publié: (2024)
par: Duarte-Torres, Sergio, et autres
Publié: (2024)
Qwen3-ASR Technical Report
par: Shi, Xian, et autres
Publié: (2026)
par: Shi, Xian, et autres
Publié: (2026)
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
par: Sharma, Manali, et autres
Publié: (2026)
par: Sharma, Manali, et autres
Publié: (2026)
Exploring SSL Discrete Tokens for Multilingual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024)
par: Zhu, Harrison, et autres
Publié: (2024)
ManWav: The First Manchu ASR Model
par: Seo, Jean, et autres
Publié: (2024)
par: Seo, Jean, et autres
Publié: (2024)
Mamba for Streaming ASR Combined with Unimodal Aggregation
par: Fang, Ying, et autres
Publié: (2024)
par: Fang, Ying, et autres
Publié: (2024)
Scalable Offline ASR for Command-Style Dictation in Courtrooms
par: Nethil, Kumarmanas, et autres
Publié: (2025)
par: Nethil, Kumarmanas, et autres
Publié: (2025)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
par: Shakeel, Muhammad, et autres
Publié: (2025)
par: Shakeel, Muhammad, et autres
Publié: (2025)
Reverb: Open-Source ASR and Diarization from Rev
par: Bhandari, Nishchal, et autres
Publié: (2024)
par: Bhandari, Nishchal, et autres
Publié: (2024)
ASR Error Correction using Large Language Models
par: Ma, Rao, et autres
Publié: (2024)
par: Ma, Rao, et autres
Publié: (2024)
WER We Stand: Benchmarking Urdu ASR Models
par: Arif, Samee, et autres
Publié: (2024)
par: Arif, Samee, et autres
Publié: (2024)
Extending Whisper with prompt tuning to target-speaker ASR
par: Ma, Hao, et autres
Publié: (2023)
par: Ma, Hao, et autres
Publié: (2023)
Crossmodal ASR Error Correction with Discrete Speech Units
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Advocating Character Error Rate for Multilingual ASR Evaluation
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
Vedavani: A Benchmark Corpus for ASR on Vedic Sanskrit Poetry
par: Kumar, Sujeet, et autres
Publié: (2025)
par: Kumar, Sujeet, et autres
Publié: (2025)
Documents similaires
-
Boosting CTC-Based ASR Using LLM-Based Intermediate Loss Regularization
par: Altinok, Duygu
Publié: (2025) -
Smooth Operators: LLMs Translating Imperfect Hints into Disfluency-Rich Transcripts
par: Altinok, Duygu
Publié: (2025) -
Performant ASR Models for Medical Entities in Accented Speech
par: Afonja, Tejumade, et autres
Publié: (2024) -
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
par: Adedeji, Ayo, et autres
Publié: (2024) -
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
par: Wang, Zilai, et autres
Publié: (2026)