UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Ruchao, Shanka, Natarajan Balaji, Alwan, Abeer |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
di: Wang, Zilai, et al.
Pubblicazione: (2026)
di: Wang, Zilai, et al.
Pubblicazione: (2026)
Selective Attention Merging for low resource tasks: A case study of Child ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
Exploring SSL Discrete Tokens for Multilingual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
di: Eren, Eray, et al.
Pubblicazione: (2025)
di: Eren, Eray, et al.
Pubblicazione: (2025)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
di: Mdhaffar, Salima, et al.
Pubblicazione: (2024)
di: Mdhaffar, Salima, et al.
Pubblicazione: (2024)
Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs
di: Xie, Yuan, et al.
Pubblicazione: (2026)
di: Xie, Yuan, et al.
Pubblicazione: (2026)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
di: Shakeel, Muhammad, et al.
Pubblicazione: (2025)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2025)
Performant ASR Models for Medical Entities in Accented Speech
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
di: Chen, Qian, et al.
Pubblicazione: (2023)
di: Chen, Qian, et al.
Pubblicazione: (2023)
Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
Configurable Multilingual ASR with Speech Summary Representations
di: Zhu, Harrison, et al.
Pubblicazione: (2024)
di: Zhu, Harrison, et al.
Pubblicazione: (2024)
Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study
di: An, Keyu, et al.
Pubblicazione: (2024)
di: An, Keyu, et al.
Pubblicazione: (2024)
CHSER: A Dataset and Case Study on Generative Speech Error Correction for Child ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
Comparing Unsupervised and Supervised Semantic Speech Tokens: A Case Study of Child ASR
di: Shi, Mohan, et al.
Pubblicazione: (2025)
di: Shi, Mohan, et al.
Pubblicazione: (2025)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
Vedavani: A Benchmark Corpus for ASR on Vedic Sanskrit Poetry
di: Kumar, Sujeet, et al.
Pubblicazione: (2025)
di: Kumar, Sujeet, et al.
Pubblicazione: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
Crossmodal ASR Error Correction with Discrete Speech Units
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
di: Peng, Yifan, et al.
Pubblicazione: (2024)
di: Peng, Yifan, et al.
Pubblicazione: (2024)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
ASR-FAIRBENCH: Measuring and Benchmarking Equity Across Speech Recognition Systems
di: Rai, Anand, et al.
Pubblicazione: (2025)
di: Rai, Anand, et al.
Pubblicazione: (2025)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
di: Nguyen, Tuan, et al.
Pubblicazione: (2025)
di: Nguyen, Tuan, et al.
Pubblicazione: (2025)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
di: Wang, He, et al.
Pubblicazione: (2025)
di: Wang, He, et al.
Pubblicazione: (2025)
Advancing African-Accented Speech Recognition: Epistemic Uncertainty-Driven Data Selection for Generalizable ASR Models
di: Dossou, Bonaventure F. P.
Pubblicazione: (2023)
di: Dossou, Bonaventure F. P.
Pubblicazione: (2023)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
Enhancing Code-switched Text-to-Speech Synthesis Capability in Large Language Models with only Monolingual Corpora
di: Xu, Jing, et al.
Pubblicazione: (2024)
di: Xu, Jing, et al.
Pubblicazione: (2024)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
di: Yuhang, Yang, et al.
Pubblicazione: (2024)
di: Yuhang, Yang, et al.
Pubblicazione: (2024)
UniCoM: A Universal Code-Switching Speech Generator
di: Lee, Sangmin, et al.
Pubblicazione: (2025)
di: Lee, Sangmin, et al.
Pubblicazione: (2025)
Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models
di: Ljubešić, Nikola, et al.
Pubblicazione: (2025)
di: Ljubešić, Nikola, et al.
Pubblicazione: (2025)
Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices
di: Velikovich, Leonid, et al.
Pubblicazione: (2024)
di: Velikovich, Leonid, et al.
Pubblicazione: (2024)
Advancing Hearing Assessment: An ASR-Based Frequency-Specific Speech Test for Diagnosing Presbycusis
di: Bleeck, Stefan
Pubblicazione: (2025)
di: Bleeck, Stefan
Pubblicazione: (2025)
ASR Under the Stethoscope: Evaluating Biases in Clinical Speech Recognition across Indian Languages
di: Kumar, Subham, et al.
Pubblicazione: (2025)
di: Kumar, Subham, et al.
Pubblicazione: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Echotune: A Modular Extractor Leveraging the Variable-Length Nature of Speech in ASR Tasks
di: Chen, Sizhou, et al.
Pubblicazione: (2023)
di: Chen, Sizhou, et al.
Pubblicazione: (2023)
UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
di: Liu, Alexander H., et al.
Pubblicazione: (2025)
di: Liu, Alexander H., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024) -
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024) -
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
di: Wang, Zilai, et al.
Pubblicazione: (2026) -
Selective Attention Merging for low resource tasks: A case study of Child ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025) -
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)