Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hentschel, Michael, Nishikawa, Yuta, Komatsu, Tatsuya, Fujita, Yusuke |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio Fingerprinting with Holographic Reduced Representations
par: Fujita, Yusuke, et autres
Publié: (2024)
par: Fujita, Yusuke, et autres
Publié: (2024)
Universal Score-based Speech Enhancement with High Content Preservation
par: Scheibler, Robin, et autres
Publié: (2024)
par: Scheibler, Robin, et autres
Publié: (2024)
Music Tagging with Classifier Group Chains
par: Hasumi, Takuya, et autres
Publié: (2025)
par: Hasumi, Takuya, et autres
Publié: (2025)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025)
par: Hirano, Yuta, et autres
Publié: (2025)
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
par: Munakata, Hokuto, et autres
Publié: (2024)
par: Munakata, Hokuto, et autres
Publié: (2024)
Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge
par: Žavoronkov, Aleksei, et autres
Publié: (2025)
par: Žavoronkov, Aleksei, et autres
Publié: (2025)
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Language-based Audio Moment Retrieval
par: Munakata, Hokuto, et autres
Publié: (2024)
par: Munakata, Hokuto, et autres
Publié: (2024)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
Efficient Interleaved Speech Modeling through Knowledge Distillation
par: Nouriborji, Mohammadmahdi, et autres
Publié: (2025)
par: Nouriborji, Mohammadmahdi, et autres
Publié: (2025)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
par: Lin, Yi-Cheng, et autres
Publié: (2026)
par: Lin, Yi-Cheng, et autres
Publié: (2026)
Efficient Speech Translation through Model Compression and Knowledge Distillation
par: Moslem, Yasmin
Publié: (2025)
par: Moslem, Yasmin
Publié: (2025)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation
par: Wang, Chen, et autres
Publié: (2024)
par: Wang, Chen, et autres
Publié: (2024)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
par: Kando, Shunsuke, et autres
Publié: (2025)
par: Kando, Shunsuke, et autres
Publié: (2025)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
par: Le, Trang, et autres
Publié: (2024)
par: Le, Trang, et autres
Publié: (2024)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
par: Cheng, Shanbo, et autres
Publié: (2024)
par: Cheng, Shanbo, et autres
Publié: (2024)
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders
par: Shi, Hao, et autres
Publié: (2023)
par: Shi, Hao, et autres
Publié: (2023)
WCTC-Biasing: Retraining-free Contextual Biasing ASR with Wildcard CTC-based Keyword Spotting and Inter-layer Biasing
par: Nakagome, Yu, et autres
Publié: (2025)
par: Nakagome, Yu, et autres
Publié: (2025)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
par: Wang, Peidong, et autres
Publié: (2024)
par: Wang, Peidong, et autres
Publié: (2024)
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
par: Munakata, Hokuto, et autres
Publié: (2025)
par: Munakata, Hokuto, et autres
Publié: (2025)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
par: Cheng, Shanbo, et autres
Publié: (2025)
par: Cheng, Shanbo, et autres
Publié: (2025)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
par: Cui, Wenqian, et autres
Publié: (2025)
par: Cui, Wenqian, et autres
Publié: (2025)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
par: Higuchi, Yosuke, et autres
Publié: (2023)
par: Higuchi, Yosuke, et autres
Publié: (2023)
SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge?
par: Ashihara, Takanori, et autres
Publié: (2023)
par: Ashihara, Takanori, et autres
Publié: (2023)
Self-supervised learning method using multiple sampling strategies for general-purpose audio representation
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
Multilingual DistilWhisper: Efficient Distillation of Multi-task Speech Models via Language-Specific Experts
par: Ferraz, Thomas Palmeira, et autres
Publié: (2023)
par: Ferraz, Thomas Palmeira, et autres
Publié: (2023)
Leave No Knowledge Behind During Knowledge Distillation: Towards Practical and Effective Knowledge Distillation for Code-Switching ASR Using Realistic Data
par: Tseng, Liang-Hsuan, et autres
Publié: (2024)
par: Tseng, Liang-Hsuan, et autres
Publié: (2024)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
Exploration of Adapter for Noise Robust Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
NAIST Simultaneous Speech Translation System for IWSLT 2024
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
ProLAP: Probabilistic Language-Audio Pre-Training
par: Manabe, Toranosuke, et autres
Publié: (2025)
par: Manabe, Toranosuke, et autres
Publié: (2025)
Documents similaires
-
Audio Fingerprinting with Holographic Reduced Representations
par: Fujita, Yusuke, et autres
Publié: (2024) -
Universal Score-based Speech Enhancement with High Content Preservation
par: Scheibler, Robin, et autres
Publié: (2024) -
Music Tagging with Classifier Group Chains
par: Hasumi, Takuya, et autres
Publié: (2025) -
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025) -
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
par: Munakata, Hokuto, et autres
Publié: (2024)