BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Chen, Liao, Minpeng, Huang, Zhongqiang, Lu, Jinliang, Wu, Junhong, Liu, Yuchen, Zong, Chengqing, Zhang, Jiajun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability
di: Zhu, Xiaoxu, et al.
Pubblicazione: (2025)
di: Zhu, Xiaoxu, et al.
Pubblicazione: (2025)
Target Speech Extraction with Pre-trained Self-supervised Learning Models
di: Peng, Junyi, et al.
Pubblicazione: (2024)
di: Peng, Junyi, et al.
Pubblicazione: (2024)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
di: Wang, Tianrui, et al.
Pubblicazione: (2024)
di: Wang, Tianrui, et al.
Pubblicazione: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
A Study of Data Selection Strategies for Pre-training Self-Supervised Speech Models
di: Whetten, Ryan, et al.
Pubblicazione: (2026)
di: Whetten, Ryan, et al.
Pubblicazione: (2026)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
di: Wu, Wenxuan, et al.
Pubblicazione: (2024)
di: Wu, Wenxuan, et al.
Pubblicazione: (2024)
PEFT-SER: On the Use of Parameter Efficient Transfer Learning Approaches For Speech Emotion Recognition Using Pre-trained Speech Models
di: Feng, Tiantian, et al.
Pubblicazione: (2023)
di: Feng, Tiantian, et al.
Pubblicazione: (2023)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
Pre-training Autoencoder for Acoustic Event Classification via Blinky
di: Liu, Xiaoyang, et al.
Pubblicazione: (2025)
di: Liu, Xiaoyang, et al.
Pubblicazione: (2025)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
di: Wang, Huimeng, et al.
Pubblicazione: (2024)
di: Wang, Huimeng, et al.
Pubblicazione: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
di: Ma, Ding, et al.
Pubblicazione: (2026)
di: Ma, Ding, et al.
Pubblicazione: (2026)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
di: Zhao, Hang, et al.
Pubblicazione: (2024)
di: Zhao, Hang, et al.
Pubblicazione: (2024)
Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training
di: Dong, Lukuan, et al.
Pubblicazione: (2024)
di: Dong, Lukuan, et al.
Pubblicazione: (2024)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
LARP: Language Audio Relational Pre-training for Cold-Start Playlist Continuation
di: Salganik, Rebecca, et al.
Pubblicazione: (2024)
di: Salganik, Rebecca, et al.
Pubblicazione: (2024)
STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling
di: Yuan, Jiajun, et al.
Pubblicazione: (2025)
di: Yuan, Jiajun, et al.
Pubblicazione: (2025)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
di: Wang, Chen, et al.
Pubblicazione: (2025)
di: Wang, Chen, et al.
Pubblicazione: (2025)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
di: Zhao, Yan, et al.
Pubblicazione: (2024)
di: Zhao, Yan, et al.
Pubblicazione: (2024)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
di: Li, Dongyuan, et al.
Pubblicazione: (2024)
di: Li, Dongyuan, et al.
Pubblicazione: (2024)
Analysing the Masked predictive coding training criterion for pre-training a Speech Representation Model
di: Yadav, Hemant, et al.
Pubblicazione: (2023)
di: Yadav, Hemant, et al.
Pubblicazione: (2023)
LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
di: Tang, Yun, et al.
Pubblicazione: (2025)
di: Tang, Yun, et al.
Pubblicazione: (2025)
UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
di: Liu, Alexander H., et al.
Pubblicazione: (2025)
di: Liu, Alexander H., et al.
Pubblicazione: (2025)
Efficient Adapter Tuning of Pre-trained Speech Models for Automatic Speaker Verification
di: Sang, Mufan, et al.
Pubblicazione: (2024)
di: Sang, Mufan, et al.
Pubblicazione: (2024)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
di: Yuhang, Yang, et al.
Pubblicazione: (2024)
di: Yuhang, Yang, et al.
Pubblicazione: (2024)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation
di: Wang, Chen, et al.
Pubblicazione: (2024) -
BLSP-Emo: Towards Empathetic Large Speech-Language Models
di: Wang, Chen, et al.
Pubblicazione: (2024) -
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023) -
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
di: Sun, Xingwei, et al.
Pubblicazione: (2025) -
Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability
di: Zhu, Xiaoxu, et al.
Pubblicazione: (2025)