Enregistré dans:
| Auteurs principaux: | Xu, Jingjing, Zhou, Wei, Yang, Zijian, Beck, Eugen, Schlueter, Ralf |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2407.18930 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dynamic Data Pruning for Automatic Speech Recognition
par: Xiao, Qiao, et autres
Publié: (2024)
par: Xiao, Qiao, et autres
Publié: (2024)
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
par: Tsunoo, Emiru, et autres
Publié: (2025)
par: Tsunoo, Emiru, et autres
Publié: (2025)
Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations
par: He, Linyang, et autres
Publié: (2025)
par: He, Linyang, et autres
Publié: (2025)
Data-Driven Mispronunciation Pattern Discovery for Robust Speech Recognition
par: Choi, Anna Seo Gyeong, et autres
Publié: (2025)
par: Choi, Anna Seo Gyeong, et autres
Publié: (2025)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary Prediction and Activation
par: Lin, Zhennan, et autres
Publié: (2025)
par: Lin, Zhennan, et autres
Publié: (2025)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
Speech-Based Depression Prediction Using Encoder-Weight-Only Transfer Learning and a Large Corpus
par: Harati, Amir, et autres
Publié: (2024)
par: Harati, Amir, et autres
Publié: (2024)
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
par: Yang, Tzu-Ting, et autres
Publié: (2024)
par: Yang, Tzu-Ting, et autres
Publié: (2024)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
par: Li, Bohan, et autres
Publié: (2025)
par: Li, Bohan, et autres
Publié: (2025)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
Training and Inference Efficiency of Encoder-Decoder Speech Models
par: Żelasko, Piotr, et autres
Publié: (2025)
par: Żelasko, Piotr, et autres
Publié: (2025)
Task-Agnostic Structured Pruning of Speech Representation Models
par: Wang, Haoyu, et autres
Publié: (2023)
par: Wang, Haoyu, et autres
Publié: (2023)
SpeechColab Leaderboard: An Open-Source Platform for Automatic Speech Recognition Evaluation
par: Du, Jiayu, et autres
Publié: (2024)
par: Du, Jiayu, et autres
Publié: (2024)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
par: Rossenbach, Nick, et autres
Publié: (2024)
par: Rossenbach, Nick, et autres
Publié: (2024)
Data Augmentation for End-to-end Code-switching Speech Recognition
par: Du, Chenpeng, et autres
Publié: (2020)
par: Du, Chenpeng, et autres
Publié: (2020)
Context-Driven Dynamic Pruning for Large Speech Foundation Models
par: Someki, Masao, et autres
Publié: (2025)
par: Someki, Masao, et autres
Publié: (2025)
Streaming Speech-to-Confusion Network Speech Recognition
par: Filimonov, Denis, et autres
Publié: (2023)
par: Filimonov, Denis, et autres
Publié: (2023)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
par: Shao, Qijie, et autres
Publié: (2025)
par: Shao, Qijie, et autres
Publié: (2025)
Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs
par: Sedláček, Šimon, et autres
Publié: (2025)
par: Sedláček, Šimon, et autres
Publié: (2025)
Advancing African-Accented Speech Recognition: Epistemic Uncertainty-Driven Data Selection for Generalizable ASR Models
par: Dossou, Bonaventure F. P.
Publié: (2023)
par: Dossou, Bonaventure F. P.
Publié: (2023)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
Convexity-based Pruning of Speech Representation Models
par: Dorszewski, Teresa, et autres
Publié: (2024)
par: Dorszewski, Teresa, et autres
Publié: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
DeCRED: Decoder-Centric Regularization for Encoder-Decoder Based Speech Recognition
par: Polok, Alexander, et autres
Publié: (2025)
par: Polok, Alexander, et autres
Publié: (2025)
On the Relation between Internal Language Model and Sequence Discriminative Training for Neural Transducers
par: Yang, Zijian, et autres
Publié: (2023)
par: Yang, Zijian, et autres
Publié: (2023)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation
par: Matsuura, Kohei, et autres
Publié: (2024)
par: Matsuura, Kohei, et autres
Publié: (2024)
Automatic Speech Recognition for Biomedical Data in Bengali Language
par: Kabir, Shariar, et autres
Publié: (2024)
par: Kabir, Shariar, et autres
Publié: (2024)
From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition
par: Wang, Tianduo, et autres
Publié: (2025)
par: Wang, Tianduo, et autres
Publié: (2025)
On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures
par: Hilmes, Benedikt, et autres
Publié: (2024)
par: Hilmes, Benedikt, et autres
Publié: (2024)
Chain of Correction for Full-text Speech Recognition with Large Language Models
par: Tang, Zhiyuan, et autres
Publié: (2025)
par: Tang, Zhiyuan, et autres
Publié: (2025)
Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise Distillation
par: Yang, Runyan, et autres
Publié: (2025)
par: Yang, Runyan, et autres
Publié: (2025)
AdaLTM: Adaptive Layer-wise Task Vector Merging for Categorical Speech Emotion Recognition with ASR Knowledge Integration
par: Lee, Chia-Yu, et autres
Publié: (2026)
par: Lee, Chia-Yu, et autres
Publié: (2026)
Accent-Invariant Automatic Speech Recognition via Saliency-Driven Spectrogram Masking
par: Sameti, Mohammad Hossein, et autres
Publié: (2025)
par: Sameti, Mohammad Hossein, et autres
Publié: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
par: Lin, Hsi-Che, et autres
Publié: (2024)
par: Lin, Hsi-Che, et autres
Publié: (2024)
Frontend Token Enhancement for Token-Based Speech Recognition
par: Ashihara, Takanori, et autres
Publié: (2026)
par: Ashihara, Takanori, et autres
Publié: (2026)
Documents similaires
-
Dynamic Data Pruning for Automatic Speech Recognition
par: Xiao, Qiao, et autres
Publié: (2024) -
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
par: Tsunoo, Emiru, et autres
Publié: (2025) -
Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations
par: He, Linyang, et autres
Publié: (2025) -
Data-Driven Mispronunciation Pattern Discovery for Robust Speech Recognition
par: Choi, Anna Seo Gyeong, et autres
Publié: (2025) -
Contextualized Automatic Speech Recognition with Dynamic Vocabulary Prediction and Activation
par: Lin, Zhennan, et autres
Publié: (2025)