SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Chunyu, Liu, Bingyu, Cui, Zhichao, Shi, Junhan, Qi, Anbin, Zhang, Tian-hao, Zhou, Dinghao, Lu, Lewei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
Retrieval Augmented Correction of Named Entity Speech Recognition Errors
par: Pusateri, Ernest, et autres
Publié: (2024)
par: Pusateri, Ernest, et autres
Publié: (2024)
Retrieval-Augmented Speech Recognition Approach for Domain Challenges
par: Shen, Peng, et autres
Publié: (2025)
par: Shen, Peng, et autres
Publié: (2025)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
par: Zhang, Tian-Hao, et autres
Publié: (2023)
par: Zhang, Tian-Hao, et autres
Publié: (2023)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
par: Nespoli, Francesco, et autres
Publié: (2024)
par: Nespoli, Francesco, et autres
Publié: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
par: Leung, Wing-Zin, et autres
Publié: (2024)
par: Leung, Wing-Zin, et autres
Publié: (2024)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
par: Deng, Yimin, et autres
Publié: (2024)
par: Deng, Yimin, et autres
Publié: (2024)
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
par: Cui, Zhongjian, et autres
Publié: (2025)
par: Cui, Zhongjian, et autres
Publié: (2025)
RepCodec: A Speech Representation Codec for Speech Tokenization
par: Huang, Zhichao, et autres
Publié: (2023)
par: Huang, Zhichao, et autres
Publié: (2023)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
par: Wang, Siyang, et autres
Publié: (2024)
par: Wang, Siyang, et autres
Publié: (2024)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
par: Huang, Ziling, et autres
Publié: (2025)
par: Huang, Ziling, et autres
Publié: (2025)
Creating Personalized Synthetic Voices from Articulation Impaired Speech Using Augmented Reconstruction Loss
par: Tian, Yusheng, et autres
Publié: (2024)
par: Tian, Yusheng, et autres
Publié: (2024)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
par: Yang, Qingran, et autres
Publié: (2026)
par: Yang, Qingran, et autres
Publié: (2026)
NAST: Noise Aware Speech Tokenization for Speech Language Models
par: Messica, Shoval, et autres
Publié: (2024)
par: Messica, Shoval, et autres
Publié: (2024)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
par: Alsayegh, Ali, et autres
Publié: (2025)
par: Alsayegh, Ali, et autres
Publié: (2025)
Zero-Shot Crate Digging: DJ Tool Retrieval Using Speech Activity, Music Structure And CLAP Embeddings
par: Orife, Iroro
Publié: (2024)
par: Orife, Iroro
Publié: (2024)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
par: Sun, Xingwei, et autres
Publié: (2025)
par: Sun, Xingwei, et autres
Publié: (2025)
DENSE: Dynamic Embedding Causal Target Speech Extraction
par: Wang, Yiwen, et autres
Publié: (2024)
par: Wang, Yiwen, et autres
Publié: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
par: Wang, Shih-heng, et autres
Publié: (2024)
par: Wang, Shih-heng, et autres
Publié: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Coarse-to-fine Alignment Makes Better Speech-image Retrieval
par: Zhou, Lifeng, et autres
Publié: (2024)
par: Zhou, Lifeng, et autres
Publié: (2024)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
par: Garg, Ashi, et autres
Publié: (2025)
par: Garg, Ashi, et autres
Publié: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
Unsupervised Single-Channel Speech Separation with a Diffusion Prior under Speaker-Embedding Guidance
par: Shi, Runwu, et autres
Publié: (2025)
par: Shi, Runwu, et autres
Publié: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
An Explainable Probabilistic Attribute Embedding Approach for Spoofed Speech Characterization
par: Chhibber, Manasi, et autres
Publié: (2024)
par: Chhibber, Manasi, et autres
Publié: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
par: Tao, Dehua, et autres
Publié: (2024)
par: Tao, Dehua, et autres
Publié: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
par: Chen, Yanan, et autres
Publié: (2024)
par: Chen, Yanan, et autres
Publié: (2024)
FLASepformer: Efficient Speech Separation with Gated Focused Linear Attention Transformer
par: Wang, Haoxu, et autres
Publié: (2025)
par: Wang, Haoxu, et autres
Publié: (2025)
Documents similaires
-
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
par: Sun, Haoqin, et autres
Publié: (2025) -
Retrieval Augmented Correction of Named Entity Speech Recognition Errors
par: Pusateri, Ernest, et autres
Publié: (2024) -
Retrieval-Augmented Speech Recognition Approach for Domain Challenges
par: Shen, Peng, et autres
Publié: (2025) -
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
par: Xue, Jinlong, et autres
Publié: (2024) -
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
par: Zhang, Tian-Hao, et autres
Publié: (2023)