Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Qiongqiong, Sailor, Hardik B., Wong, Jeremy H. M., Liu, Tianchi, Sun, Shuo, Zhang, Wenyu, Huzaifah, Muhammad, Chen, Nancy, Aw, Ai Ti |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation
por: Wang, Qiongqiong, et al.
Publicado: (2025)
por: Wang, Qiongqiong, et al.
Publicado: (2025)
MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond
por: Huzaifah, Muhammad, et al.
Publicado: (2024)
por: Huzaifah, Muhammad, et al.
Publicado: (2024)
Attentive Merging of Hidden Embeddings from Pre-trained Speech Model for Anti-spoofing Detection
por: Pan, Zihan, et al.
Publicado: (2024)
por: Pan, Zihan, et al.
Publicado: (2024)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
por: Zhang, Wenyu, et al.
Publicado: (2025)
por: Zhang, Wenyu, et al.
Publicado: (2025)
Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024
por: Guragain, Anmol, et al.
Publicado: (2024)
por: Guragain, Anmol, et al.
Publicado: (2024)
Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing
por: Liu, Tianchi, et al.
Publicado: (2024)
por: Liu, Tianchi, et al.
Publicado: (2024)
Benchmarking Contextual and Paralinguistic Reasoning in Speech-LLMs: A Case Study with In-the-Wild Data
por: Wang, Qiongqiong, et al.
Publicado: (2025)
por: Wang, Qiongqiong, et al.
Publicado: (2025)
Interpolating Speaker Identities in Embedding Space for Data Expansion
por: Liu, Tianchi, et al.
Publicado: (2025)
por: Liu, Tianchi, et al.
Publicado: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models
por: Wang, Bin, et al.
Publicado: (2025)
por: Wang, Bin, et al.
Publicado: (2025)
Towards Machine Unlearning for Paralinguistic Speech Processing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
por: Yang, Shu-wen, et al.
Publicado: (2025)
por: Yang, Shu-wen, et al.
Publicado: (2025)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
por: Kang, Wonjune, et al.
Publicado: (2024)
por: Kang, Wonjune, et al.
Publicado: (2024)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
por: Kim, Heeseung, et al.
Publicado: (2024)
por: Kim, Heeseung, et al.
Publicado: (2024)
UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations
por: Haq, Attia Nafees ul, et al.
Publicado: (2026)
por: Haq, Attia Nafees ul, et al.
Publicado: (2026)
Golden Gemini is All You Need: Finding the Sweet Spots for Speaker Verification
por: Liu, Tianchi, et al.
Publicado: (2023)
por: Liu, Tianchi, et al.
Publicado: (2023)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
por: Zhang, Wenyu, et al.
Publicado: (2024)
por: Zhang, Wenyu, et al.
Publicado: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
por: Lin, Guan-Ting, et al.
Publicado: (2023)
por: Lin, Guan-Ting, et al.
Publicado: (2023)
Rethinking Cross-Corpus Speech Emotion Recognition Benchmarking: Are Paralinguistic Pre-Trained Representations Sufficient?
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
por: Buitrago, Pol, et al.
Publicado: (2026)
por: Buitrago, Pol, et al.
Publicado: (2026)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
por: Wu, Jinyang, et al.
Publicado: (2026)
por: Wu, Jinyang, et al.
Publicado: (2026)
SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding
por: Bai, Bingsong, et al.
Publicado: (2025)
por: Bai, Bingsong, et al.
Publicado: (2025)
Source Tracing of Synthetic Speech Systems Through Paralinguistic Pre-Trained Representations
por: Girish, et al.
Publicado: (2025)
por: Girish, et al.
Publicado: (2025)
RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
por: Ren, Bo, et al.
Publicado: (2026)
por: Ren, Bo, et al.
Publicado: (2026)
A Survey on Speech Large Language Models for Understanding
por: Peng, Jing, et al.
Publicado: (2024)
por: Peng, Jing, et al.
Publicado: (2024)
A Lightweight Hybrid Dual Channel Speech Enhancement System under Low-SNR Conditions
por: Wang, Zheng, et al.
Publicado: (2025)
por: Wang, Zheng, et al.
Publicado: (2025)
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
por: Jiang, Feng, et al.
Publicado: (2025)
por: Jiang, Feng, et al.
Publicado: (2025)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
por: Lou, Haowei, et al.
Publicado: (2025)
por: Lou, Haowei, et al.
Publicado: (2025)
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
por: Pešán, Jan, et al.
Publicado: (2024)
por: Pešán, Jan, et al.
Publicado: (2024)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
por: Zhang, Zixing, et al.
Publicado: (2024)
por: Zhang, Zixing, et al.
Publicado: (2024)
Enhancing Acoustic-to-Articulatory Speech Inversion by Incorporating Nasality
por: Tabatabaee, Saba, et al.
Publicado: (2025)
por: Tabatabaee, Saba, et al.
Publicado: (2025)
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
por: Shao, Mingchen, et al.
Publicado: (2025)
por: Shao, Mingchen, et al.
Publicado: (2025)
Recovering Performance in Speech Emotion Recognition from Discrete Tokens via Multi-Layer Fusion and Paralinguistic Feature Integration
por: Sun, Esther, et al.
Publicado: (2026)
por: Sun, Esther, et al.
Publicado: (2026)
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
por: Cheng, Yifan, et al.
Publicado: (2025)
por: Cheng, Yifan, et al.
Publicado: (2025)
ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech
por: Lou, Haowei, et al.
Publicado: (2026)
por: Lou, Haowei, et al.
Publicado: (2026)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
por: Fu, Li, et al.
Publicado: (2025)
por: Fu, Li, et al.
Publicado: (2025)
Ejemplares similares
-
Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation
por: Wang, Qiongqiong, et al.
Publicado: (2025) -
MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond
por: Huzaifah, Muhammad, et al.
Publicado: (2024) -
Attentive Merging of Hidden Embeddings from Pre-trained Speech Model for Anti-spoofing Detection
por: Pan, Zihan, et al.
Publicado: (2024) -
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
por: Zhang, Wenyu, et al.
Publicado: (2025) -
Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024
por: Guragain, Anmol, et al.
Publicado: (2024)