Enhancing Fully Formatted End-to-End Speech Recognition with Knowledge Distillation via Multi-Codebook Vector Quantization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | You, Jian, Li, Xiangfeng, Zerhouni, Erwan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lightweight and Robust Multi-Channel End-to-End Speech Recognition with Spherical Harmonic Transform
par: Kong, Xiangzhu, et autres
Publié: (2025)
par: Kong, Xiangzhu, et autres
Publié: (2025)
End-to-End Speech Recognition with Pre-trained Masked Language Model
par: Higuchi, Yosuke, et autres
Publié: (2024)
par: Higuchi, Yosuke, et autres
Publié: (2024)
CUSIDE-array: A Streaming Multi-Channel End-to-End Speech Recognition System with Realistic Evaluations
par: Kong, Xiangzhu, et autres
Publié: (2024)
par: Kong, Xiangzhu, et autres
Publié: (2024)
Using Adapters to Overcome Catastrophic Forgetting in End-to-End Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2022)
par: Eeckt, Steven Vander, et autres
Publié: (2022)
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
par: Wang, Pu, et autres
Publié: (2024)
par: Wang, Pu, et autres
Publié: (2024)
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
par: Dai, Wang, et autres
Publié: (2024)
par: Dai, Wang, et autres
Publié: (2024)
Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation
par: Matsuura, Kohei, et autres
Publié: (2024)
par: Matsuura, Kohei, et autres
Publié: (2024)
Breaking Walls: Pioneering Automatic Speech Recognition for Central Kurdish: End-to-End Transformer Paradigm
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
ERVQ: Enhanced Residual Vector Quantization with Intra-and-Inter-Codebook Optimization for Neural Audio Codecs
par: Zheng, Rui-Chen, et autres
Publié: (2024)
par: Zheng, Rui-Chen, et autres
Publié: (2024)
End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios
par: Jing, Kangqi, et autres
Publié: (2025)
par: Jing, Kangqi, et autres
Publié: (2025)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
par: Zhuang, Zhuoran, et autres
Publié: (2026)
par: Zhuang, Zhuoran, et autres
Publié: (2026)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription
par: Dai, Yuhang, et autres
Publié: (2026)
par: Dai, Yuhang, et autres
Publié: (2026)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
par: Guimarães, Heitor R., et autres
Publié: (2024)
par: Guimarães, Heitor R., et autres
Publié: (2024)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
par: Liu, Heyang, et autres
Publié: (2024)
par: Liu, Heyang, et autres
Publié: (2024)
AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
par: Chen, Yushen, et autres
Publié: (2025)
par: Chen, Yushen, et autres
Publié: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Toward Fully-End-to-End Listened Speech Decoding from EEG Signals
par: Lee, Jihwan, et autres
Publié: (2024)
par: Lee, Jihwan, et autres
Publié: (2024)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
par: Plaquet, Alexis, et autres
Publié: (2025)
par: Plaquet, Alexis, et autres
Publié: (2025)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
par: Ghane, Mohsen, et autres
Publié: (2025)
par: Ghane, Mohsen, et autres
Publié: (2025)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
par: You, Zhenghai, et autres
Publié: (2025)
par: You, Zhenghai, et autres
Publié: (2025)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
Data Augmentation for End-to-end Code-switching Speech Recognition
par: Du, Chenpeng, et autres
Publié: (2020)
par: Du, Chenpeng, et autres
Publié: (2020)
End-to-End Transformer-based Automatic Speech Recognition for Northern Kurdish: A Pioneering Approach
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
Continual Learning for Monolingual End-to-End Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2021)
par: Eeckt, Steven Vander, et autres
Publié: (2021)
An Ultra-Low Latency, End-to-End Streaming Speech Synthesis Architecture via Block-Wise Generation and Depth-Wise Codec Decoding
par: Su, Tianhui, et autres
Publié: (2026)
par: Su, Tianhui, et autres
Publié: (2026)
Qifusion-Net: Layer-adapted Stream/Non-stream Model for End-to-End Multi-Accent Speech Recognition
par: Chen, Jinming, et autres
Publié: (2024)
par: Chen, Jinming, et autres
Publié: (2024)
UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
par: Wang, Ziqian, et autres
Publié: (2025)
par: Wang, Ziqian, et autres
Publié: (2025)
Decoder-only Architecture for Streaming End-to-end Speech Recognition
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
par: He, Xinlu, et autres
Publié: (2025)
par: He, Xinlu, et autres
Publié: (2025)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
par: Lin, Wan, et autres
Publié: (2024)
par: Lin, Wan, et autres
Publié: (2024)
Code-Switching in End-to-End Automatic Speech Recognition: A Systematic Literature Review
par: Agro, Maha Tufail, et autres
Publié: (2025)
par: Agro, Maha Tufail, et autres
Publié: (2025)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
par: Ahmad, Hawraz A., et autres
Publié: (2024)
par: Ahmad, Hawraz A., et autres
Publié: (2024)
On Improving Error Resilience of Neural End-to-End Speech Coders
par: Gupta, Kishan, et autres
Publié: (2024)
par: Gupta, Kishan, et autres
Publié: (2024)
Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
par: Farhadipour, Aref, et autres
Publié: (2023)
par: Farhadipour, Aref, et autres
Publié: (2023)
Optimizing Contextual Speech Recognition Using Vector Quantization for Efficient Retrieval
par: Flemotomos, Nikolaos, et autres
Publié: (2024)
par: Flemotomos, Nikolaos, et autres
Publié: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
par: Yuan, Xihao, et autres
Publié: (2025)
par: Yuan, Xihao, et autres
Publié: (2025)
Documents similaires
-
Lightweight and Robust Multi-Channel End-to-End Speech Recognition with Spherical Harmonic Transform
par: Kong, Xiangzhu, et autres
Publié: (2025) -
End-to-End Speech Recognition with Pre-trained Masked Language Model
par: Higuchi, Yosuke, et autres
Publié: (2024) -
CUSIDE-array: A Streaming Multi-Channel End-to-End Speech Recognition System with Realistic Evaluations
par: Kong, Xiangzhu, et autres
Publié: (2024) -
Using Adapters to Overcome Catastrophic Forgetting in End-to-End Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2022) -
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
par: Wang, Pu, et autres
Publié: (2024)