Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zilai, Shankar, Natarajan Balaji, Zhang, Kaiyuan, Wang, Zihan, Alwan, Abeer |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Selective Attention Merging for low resource tasks: A case study of Child ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2025)
par: Shankar, Natarajan Balaji, et autres
Publié: (2025)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
CHSER: A Dataset and Case Study on Generative Speech Error Correction for Child ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2025)
par: Shankar, Natarajan Balaji, et autres
Publié: (2025)
Comparing Unsupervised and Supervised Semantic Speech Tokens: A Case Study of Child ASR
par: Shi, Mohan, et autres
Publié: (2025)
par: Shi, Mohan, et autres
Publié: (2025)
STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs
par: Zhang, Kaiyuan, et autres
Publié: (2026)
par: Zhang, Kaiyuan, et autres
Publié: (2026)
Exploring SSL Discrete Tokens for Multilingual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Mind the Gap: Entity-Preserved Context-Aware ASR Structured Transcriptions
par: Altinok, Duygu
Publié: (2025)
par: Altinok, Duygu
Publié: (2025)
Vedavani: A Benchmark Corpus for ASR on Vedic Sanskrit Poetry
par: Kumar, Sujeet, et autres
Publié: (2025)
par: Kumar, Sujeet, et autres
Publié: (2025)
Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices
par: Velikovich, Leonid, et autres
Publié: (2024)
par: Velikovich, Leonid, et autres
Publié: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
par: Eren, Eray, et autres
Publié: (2025)
par: Eren, Eray, et autres
Publié: (2025)
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
par: Rangappa, Pradeep, et autres
Publié: (2025)
par: Rangappa, Pradeep, et autres
Publié: (2025)
OCR-Enhanced Multimodal ASR Can Read While Listening
par: Chen, Junli, et autres
Publié: (2026)
par: Chen, Junli, et autres
Publié: (2026)
Qwen3-ASR Technical Report
par: Shi, Xian, et autres
Publié: (2026)
par: Shi, Xian, et autres
Publié: (2026)
Enhancing Age-Related Robustness in Children Speaker Verification
par: Shetty, Vishwas M., et autres
Publié: (2025)
par: Shetty, Vishwas M., et autres
Publié: (2025)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
PromptASR for contextualized ASR with controllable style
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
An Age-Agnostic System for Robust Speaker Verification
par: Zheng, Jiusi, et autres
Publié: (2025)
par: Zheng, Jiusi, et autres
Publié: (2025)
The THUEE System Description for the IARPA OpenASR21 Challenge
par: Zhao, Jing, et autres
Publié: (2022)
par: Zhao, Jing, et autres
Publié: (2022)
Attentive Merging of Hidden Embeddings from Pre-trained Speech Model for Anti-spoofing Detection
par: Pan, Zihan, et autres
Publié: (2024)
par: Pan, Zihan, et autres
Publié: (2024)
LA-RAG:Enhancing LLM-based ASR Accuracy with Retrieval-Augmented Generation
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
par: Wang, Fangyuan, et autres
Publié: (2022)
par: Wang, Fangyuan, et autres
Publié: (2022)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
par: Chen, Qian, et autres
Publié: (2023)
par: Chen, Qian, et autres
Publié: (2023)
Context-Enhanced Granular Edit Representation for Efficient and Accurate ASR Post-editing
par: Vejsiu, Luan, et autres
Publié: (2025)
par: Vejsiu, Luan, et autres
Publié: (2025)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
par: Yuhang, Yang, et autres
Publié: (2024)
par: Yuhang, Yang, et autres
Publié: (2024)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
par: Gündüz, Ahmet, et autres
Publié: (2024)
par: Gündüz, Ahmet, et autres
Publié: (2024)
Boosting CTC-Based ASR Using LLM-Based Intermediate Loss Regularization
par: Altinok, Duygu
Publié: (2025)
par: Altinok, Duygu
Publié: (2025)
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
par: Yan, Brian, et autres
Publié: (2024)
par: Yan, Brian, et autres
Publié: (2024)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
par: Carofilis, Andres, et autres
Publié: (2025)
par: Carofilis, Andres, et autres
Publié: (2025)
Evolutionary Prompt Design for LLM-Based Post-ASR Error Correction
par: Sachdev, Rithik, et autres
Publié: (2024)
par: Sachdev, Rithik, et autres
Publié: (2024)
Enhancing the Robustness of Contextual ASR to Varying Biasing Information Volumes Through Purified Semantic Correlation Joint Modeling
par: Gu, Yue, et autres
Publié: (2025)
par: Gu, Yue, et autres
Publié: (2025)
Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
par: Cheng, Yao-Fei, et autres
Publié: (2024)
par: Cheng, Yao-Fei, et autres
Publié: (2024)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
par: Lin, Zhennan, et autres
Publié: (2026)
par: Lin, Zhennan, et autres
Publié: (2026)
Documents similaires
-
Selective Attention Merging for low resource tasks: A case study of Child ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2025) -
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
par: Fan, Ruchao, et autres
Publié: (2024) -
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
par: Fan, Ruchao, et autres
Publié: (2024) -
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024) -
CHSER: A Dataset and Case Study on Generative Speech Error Correction for Child ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2025)