BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Chen, Liao, Minpeng, Huang, Zhongqiang, Zhang, Jiajun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
por: Wang, Chen, et al.
Publicado: (2023)
por: Wang, Chen, et al.
Publicado: (2023)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
por: Wang, Chen, et al.
Publicado: (2024)
por: Wang, Chen, et al.
Publicado: (2024)
GenDistiller: Distilling Pre-trained Language Models based on an Autoregressive Generative Model
por: Gao, Yingying, et al.
Publicado: (2024)
por: Gao, Yingying, et al.
Publicado: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
por: Lin, Hsi-Che, et al.
Publicado: (2024)
por: Lin, Hsi-Che, et al.
Publicado: (2024)
MFSN: Multi-perspective Fusion Search Network For Pre-training Knowledge in Speech Emotion Recognition
por: Sun, Haiyang, et al.
Publicado: (2023)
por: Sun, Haiyang, et al.
Publicado: (2023)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
por: Zhu, Yongxin, et al.
Publicado: (2024)
por: Zhu, Yongxin, et al.
Publicado: (2024)
Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training
por: Dong, Lukuan, et al.
Publicado: (2024)
por: Dong, Lukuan, et al.
Publicado: (2024)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
por: Bijoy, Mehedi Hasan, et al.
Publicado: (2025)
por: Bijoy, Mehedi Hasan, et al.
Publicado: (2025)
Efficient Interleaved Speech Modeling through Knowledge Distillation
por: Nouriborji, Mohammadmahdi, et al.
Publicado: (2025)
por: Nouriborji, Mohammadmahdi, et al.
Publicado: (2025)
UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
por: Liu, Alexander H., et al.
Publicado: (2025)
por: Liu, Alexander H., et al.
Publicado: (2025)
Multilingual DistilWhisper: Efficient Distillation of Multi-task Speech Models via Language-Specific Experts
por: Ferraz, Thomas Palmeira, et al.
Publicado: (2023)
por: Ferraz, Thomas Palmeira, et al.
Publicado: (2023)
Efficient Speech Translation through Model Compression and Knowledge Distillation
por: Moslem, Yasmin
Publicado: (2025)
por: Moslem, Yasmin
Publicado: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
por: Wang, Yujin, et al.
Publicado: (2022)
por: Wang, Yujin, et al.
Publicado: (2022)
Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers
por: Hentschel, Michael, et al.
Publicado: (2024)
por: Hentschel, Michael, et al.
Publicado: (2024)
Attentive Merging of Hidden Embeddings from Pre-trained Speech Model for Anti-spoofing Detection
por: Pan, Zihan, et al.
Publicado: (2024)
por: Pan, Zihan, et al.
Publicado: (2024)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
por: Yuhang, Yang, et al.
Publicado: (2024)
por: Yuhang, Yang, et al.
Publicado: (2024)
Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
por: Tang, Yun, et al.
Publicado: (2025)
por: Tang, Yun, et al.
Publicado: (2025)
Fine-grained Speech Sentiment Analysis in Chinese Psychological Support Hotlines Based on Large-scale Pre-trained Model
por: Chen, Zhonglong, et al.
Publicado: (2024)
por: Chen, Zhonglong, et al.
Publicado: (2024)
USAD: Universal Speech and Audio Representation via Distillation
por: Chang, Heng-Jui, et al.
Publicado: (2025)
por: Chang, Heng-Jui, et al.
Publicado: (2025)
Leave No Knowledge Behind During Knowledge Distillation: Towards Practical and Effective Knowledge Distillation for Code-Switching ASR Using Realistic Data
por: Tseng, Liang-Hsuan, et al.
Publicado: (2024)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2024)
To Distill or Not to Distill? On the Robustness of Robust Knowledge Distillation
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
por: Shakeel, Muhammad, et al.
Publicado: (2024)
por: Shakeel, Muhammad, et al.
Publicado: (2024)
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model
por: Lehečka, Jan, et al.
Publicado: (2024)
por: Lehečka, Jan, et al.
Publicado: (2024)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
por: Hwang, Min-Jae, et al.
Publicado: (2024)
por: Hwang, Min-Jae, et al.
Publicado: (2024)
Generative Pre-training for Speech with Flow Matching
por: Liu, Alexander H., et al.
Publicado: (2023)
por: Liu, Alexander H., et al.
Publicado: (2023)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
por: Thorbecke, Iuliia, et al.
Publicado: (2024)
por: Thorbecke, Iuliia, et al.
Publicado: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
por: Shao, Hang, et al.
Publicado: (2023)
por: Shao, Hang, et al.
Publicado: (2023)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
por: Wang, Haoyu, et al.
Publicado: (2022)
por: Wang, Haoyu, et al.
Publicado: (2022)
Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study
por: An, Keyu, et al.
Publicado: (2024)
por: An, Keyu, et al.
Publicado: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
por: Jang, Kangwook, et al.
Publicado: (2023)
por: Jang, Kangwook, et al.
Publicado: (2023)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
por: Cui, Mingyu, et al.
Publicado: (2024)
por: Cui, Mingyu, et al.
Publicado: (2024)
Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
por: Mi, Jinyi, et al.
Publicado: (2024)
por: Mi, Jinyi, et al.
Publicado: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
por: Shi, Xiaohan, et al.
Publicado: (2023)
por: Shi, Xiaohan, et al.
Publicado: (2023)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
por: Tang, Zhiyuan, et al.
Publicado: (2024)
por: Tang, Zhiyuan, et al.
Publicado: (2024)
Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space
por: Ma, Zhengrui, et al.
Publicado: (2025)
por: Ma, Zhengrui, et al.
Publicado: (2025)
Ejemplares similares
-
BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
por: Wang, Chen, et al.
Publicado: (2023) -
BLSP-Emo: Towards Empathetic Large Speech-Language Models
por: Wang, Chen, et al.
Publicado: (2024) -
GenDistiller: Distilling Pre-trained Language Models based on an Autoregressive Generative Model
por: Gao, Yingying, et al.
Publicado: (2024) -
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
por: Lin, Hsi-Che, et al.
Publicado: (2024) -
MFSN: Multi-perspective Fusion Search Network For Pre-training Knowledge in Speech Emotion Recognition
por: Sun, Haiyang, et al.
Publicado: (2023)