Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Yongxin, Su, Dan, He, Liqiang, Xu, Linli, Yu, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Communication-Efficient Personalized Federated Learning for Speech-to-Text Tasks
por: Du, Yichao, et al.
Publicado: (2024)
por: Du, Yichao, et al.
Publicado: (2024)
UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
por: Liu, Alexander H., et al.
Publicado: (2025)
por: Liu, Alexander H., et al.
Publicado: (2025)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training
por: Dong, Lukuan, et al.
Publicado: (2024)
por: Dong, Lukuan, et al.
Publicado: (2024)
BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation
por: Wang, Chen, et al.
Publicado: (2024)
por: Wang, Chen, et al.
Publicado: (2024)
BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
por: Wang, Chen, et al.
Publicado: (2023)
por: Wang, Chen, et al.
Publicado: (2023)
GenDistiller: Distilling Pre-trained Language Models based on an Autoregressive Generative Model
por: Gao, Yingying, et al.
Publicado: (2024)
por: Gao, Yingying, et al.
Publicado: (2024)
Attentive Merging of Hidden Embeddings from Pre-trained Speech Model for Anti-spoofing Detection
por: Pan, Zihan, et al.
Publicado: (2024)
por: Pan, Zihan, et al.
Publicado: (2024)
Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
por: Tang, Yun, et al.
Publicado: (2025)
por: Tang, Yun, et al.
Publicado: (2025)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
por: Yuhang, Yang, et al.
Publicado: (2024)
por: Yuhang, Yang, et al.
Publicado: (2024)
Generative Pre-training for Speech with Flow Matching
por: Liu, Alexander H., et al.
Publicado: (2023)
por: Liu, Alexander H., et al.
Publicado: (2023)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
Fine-grained Speech Sentiment Analysis in Chinese Psychological Support Hotlines Based on Large-scale Pre-trained Model
por: Chen, Zhonglong, et al.
Publicado: (2024)
por: Chen, Zhonglong, et al.
Publicado: (2024)
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model
por: Lehečka, Jan, et al.
Publicado: (2024)
por: Lehečka, Jan, et al.
Publicado: (2024)
Re-Parameterization of Lightweight Transformer for On-Device Speech Emotion Recognition
por: Zhang, Zixing, et al.
Publicado: (2024)
por: Zhang, Zixing, et al.
Publicado: (2024)
MFSN: Multi-perspective Fusion Search Network For Pre-training Knowledge in Speech Emotion Recognition
por: Sun, Haiyang, et al.
Publicado: (2023)
por: Sun, Haiyang, et al.
Publicado: (2023)
Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study
por: An, Keyu, et al.
Publicado: (2024)
por: An, Keyu, et al.
Publicado: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
Long-Form Speech Generation with Spoken Language Models
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
HAFFormer: A Hierarchical Attention-Free Framework for Alzheimer's Disease Detection From Spontaneous Speech
por: Dong, Zhongren, et al.
Publicado: (2024)
por: Dong, Zhongren, et al.
Publicado: (2024)
SSR: Alignment-Aware Modality Connector for Speech Language Models
por: Tan, Weiting, et al.
Publicado: (2024)
por: Tan, Weiting, et al.
Publicado: (2024)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
por: Sun, Chunyu, et al.
Publicado: (2025)
por: Sun, Chunyu, et al.
Publicado: (2025)
Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space
por: Ma, Zhengrui, et al.
Publicado: (2025)
por: Ma, Zhengrui, et al.
Publicado: (2025)
Small-E: Small Language Model with Linear Attention for Efficient Speech Synthesis
por: Lemerle, Théodor, et al.
Publicado: (2024)
por: Lemerle, Théodor, et al.
Publicado: (2024)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
por: Tang, Zhiyuan, et al.
Publicado: (2024)
por: Tang, Zhiyuan, et al.
Publicado: (2024)
From Statistical Methods to Pre-Trained Models; A Survey on Automatic Speech Recognition for Resource Scarce Urdu Language
por: Sharif, Muhammad, et al.
Publicado: (2024)
por: Sharif, Muhammad, et al.
Publicado: (2024)
Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability
por: Zhu, Xiaoxu, et al.
Publicado: (2025)
por: Zhu, Xiaoxu, et al.
Publicado: (2025)
SpeechAlign: Aligning Speech Generation to Human Preferences
por: Zhang, Dong, et al.
Publicado: (2024)
por: Zhang, Dong, et al.
Publicado: (2024)
Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models
por: Ljubešić, Nikola, et al.
Publicado: (2025)
por: Ljubešić, Nikola, et al.
Publicado: (2025)
Talk With Human-like Agents: Empathetic Dialogue Through Perceptible Acoustic Reception and Reaction
por: Yan, Haoqiu, et al.
Publicado: (2024)
por: Yan, Haoqiu, et al.
Publicado: (2024)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
por: Zhang, Dong, et al.
Publicado: (2024)
por: Zhang, Dong, et al.
Publicado: (2024)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
por: Shao, Yiwen, et al.
Publicado: (2025)
por: Shao, Yiwen, et al.
Publicado: (2025)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
por: Li, Zhu, et al.
Publicado: (2025)
por: Li, Zhu, et al.
Publicado: (2025)
Recent Advances in Speech Language Models: A Survey
por: Cui, Wenqian, et al.
Publicado: (2024)
por: Cui, Wenqian, et al.
Publicado: (2024)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
por: Fang, Yuanbo, et al.
Publicado: (2025)
por: Fang, Yuanbo, et al.
Publicado: (2025)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
Ejemplares similares
-
Communication-Efficient Personalized Federated Learning for Speech-to-Text Tasks
por: Du, Yichao, et al.
Publicado: (2024) -
UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
por: Liu, Alexander H., et al.
Publicado: (2025) -
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
por: Zeng, Aohan, et al.
Publicado: (2024) -
Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training
por: Dong, Lukuan, et al.
Publicado: (2024) -
BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation
por: Wang, Chen, et al.
Publicado: (2024)