Investigating the Effect of Label Topology and Training Criterion on ASR Performance and Alignment Quality
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Raissi, Tina, Lüscher, Christoph, Berger, Simon, Schlüter, Ralf, Ney, Hermann |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Right Label Context in End-to-End Training of Time-Synchronous ASR Models
par: Raissi, Tina, et autres
Publié: (2025)
par: Raissi, Tina, et autres
Publié: (2025)
Unified Learnable 2D Convolutional Feature Extraction for ASR
par: Vieting, Peter, et autres
Publié: (2025)
par: Vieting, Peter, et autres
Publié: (2025)
Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical Study
par: Yang, Zijian, et autres
Publié: (2026)
par: Yang, Zijian, et autres
Publié: (2026)
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
par: Zeineldeen, Mohammad, et autres
Publié: (2023)
par: Zeineldeen, Mohammad, et autres
Publié: (2023)
Label-Context-Dependent Internal Language Model Estimation for CTC
par: Yang, Zijian, et autres
Publié: (2025)
par: Yang, Zijian, et autres
Publié: (2025)
On the Relation between Internal Language Model and Sequence Discriminative Training for Neural Transducers
par: Yang, Zijian, et autres
Publié: (2023)
par: Yang, Zijian, et autres
Publié: (2023)
The Conformer Encoder May Reverse the Time Dimension
par: Schmitt, Robin, et autres
Publié: (2024)
par: Schmitt, Robin, et autres
Publié: (2024)
Regularizing Learnable Feature Extraction for Automatic Speech Recognition
par: Vieting, Peter, et autres
Publié: (2025)
par: Vieting, Peter, et autres
Publié: (2025)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
par: Zhou, Jiaming, et autres
Publié: (2023)
par: Zhou, Jiaming, et autres
Publié: (2023)
Alignment-Free Training for Transducer-based Multi-Talker ASR
par: Moriya, Takafumi, et autres
Publié: (2024)
par: Moriya, Takafumi, et autres
Publié: (2024)
Joint ASR and Speaker Role Tagging with Serialized Output Training
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR
par: Fan, Zhiyun, et autres
Publié: (2024)
par: Fan, Zhiyun, et autres
Publié: (2024)
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Index-ASR Technical Report
par: Song, Zheshu, et autres
Publié: (2025)
par: Song, Zheshu, et autres
Publié: (2025)
Effective Pre-Training of Audio Transformers for Sound Event Detection
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures
par: Hilmes, Benedikt, et autres
Publié: (2024)
par: Hilmes, Benedikt, et autres
Publié: (2024)
Robust Training for Speaker Verification against Noisy Labels
par: Fang, Zhihua, et autres
Publié: (2022)
par: Fang, Zhihua, et autres
Publié: (2022)
Multi-Label Training for Text-Independent Speaker Identification
par: Xue, Yuqi
Publié: (2022)
par: Xue, Yuqi
Publié: (2022)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
par: Gündüz, Ahmet, et autres
Publié: (2024)
par: Gündüz, Ahmet, et autres
Publié: (2024)
Continued Pretraining for Low-Resource Swahili ASR: Achieving State-of-the-Art Performance with Minimal Labeled Data
par: Mutisya, Hillary, et autres
Publié: (2026)
par: Mutisya, Hillary, et autres
Publié: (2026)
Effects of automotive microphone frequency response characteristics and noise conditions on speech and ASR quality -- an experimental evaluation
par: Buccoli, Michele, et autres
Publié: (2025)
par: Buccoli, Michele, et autres
Publié: (2025)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
par: Wu, Minghui, et autres
Publié: (2024)
par: Wu, Minghui, et autres
Publié: (2024)
Investigating Training Objectives for Generative Speech Enhancement
par: Richter, Julius, et autres
Publié: (2024)
par: Richter, Julius, et autres
Publié: (2024)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
Speaker Adaptation for Quantised End-to-End ASR Models
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2024)
par: Salvi, Davide, et autres
Publié: (2024)
Consistency Based Unsupervised Self-training For ASR Personalisation
par: Zhang, Jisi, et autres
Publié: (2024)
par: Zhang, Jisi, et autres
Publié: (2024)
persoDA: Personalized Data Augmentation for Personalized ASR
par: Parada, Pablo Peso, et autres
Publié: (2025)
par: Parada, Pablo Peso, et autres
Publié: (2025)
Semantic Proximity Alignment: Towards Human Perception-consistent Audio Tagging by Aligning with Label Text Description
par: Liu, Wuyang, et autres
Publié: (2023)
par: Liu, Wuyang, et autres
Publié: (2023)
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
par: Zezario, Ryandhimas E., et autres
Publié: (2026)
par: Zezario, Ryandhimas E., et autres
Publié: (2026)
Comparative Study on Noise-Augmented Training and its Effect on Adversarial Robustness in ASR Systems
par: Pizzi, Karla, et autres
Publié: (2024)
par: Pizzi, Karla, et autres
Publié: (2024)
Learning When to Trust Which Teacher for Weakly Supervised ASR
par: Agrawal, Aakriti, et autres
Publié: (2023)
par: Agrawal, Aakriti, et autres
Publié: (2023)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
par: He, Xiluo, et autres
Publié: (2025)
par: He, Xiluo, et autres
Publié: (2025)
Technical Report: A Practical Guide to Kaldi ASR Optimization
par: Hong, Mengze, et autres
Publié: (2025)
par: Hong, Mengze, et autres
Publié: (2025)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
par: Udupa, Sathvik, et autres
Publié: (2025)
par: Udupa, Sathvik, et autres
Publié: (2025)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
par: Yang, Yufeng, et autres
Publié: (2024)
par: Yang, Yufeng, et autres
Publié: (2024)
Documents similaires
-
Right Label Context in End-to-End Training of Time-Synchronous ASR Models
par: Raissi, Tina, et autres
Publié: (2025) -
Unified Learnable 2D Convolutional Feature Extraction for ASR
par: Vieting, Peter, et autres
Publié: (2025) -
Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical Study
par: Yang, Zijian, et autres
Publié: (2026) -
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
par: Zeineldeen, Mohammad, et autres
Publié: (2023) -
Label-Context-Dependent Internal Language Model Estimation for CTC
par: Yang, Zijian, et autres
Publié: (2025)