When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xiangyu, Liu, Hexin, Xu, Kaishuai, Zhang, Qiquan, Liu, Daijiao, Ahmed, Beena, Epps, Julien |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
por: Zhang, Xiangyu, et al.
Publicado: (2025)
por: Zhang, Xiangyu, et al.
Publicado: (2025)
Mamba in Speech: Towards an Alternative to Self-Attention
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection
por: Zhang, Xiangyu, et al.
Publicado: (2025)
por: Zhang, Xiangyu, et al.
Publicado: (2025)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
por: Shahin, Mostafa, et al.
Publicado: (2025)
por: Shahin, Mostafa, et al.
Publicado: (2025)
Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization
por: Zhang, Xiangyu, et al.
Publicado: (2026)
por: Zhang, Xiangyu, et al.
Publicado: (2026)
Distinctive Feature Codec: An Adaptive Efficient Speech Representation for Depression Detection
por: Zhang, Xiangyu, et al.
Publicado: (2025)
por: Zhang, Xiangyu, et al.
Publicado: (2025)
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Rethinking Mamba in Speech Processing by Self-Supervised Models
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning
por: Xue, Hongfei, et al.
Publicado: (2025)
por: Xue, Hongfei, et al.
Publicado: (2025)
When Large Language Models Meet Speech: A Survey on Integration Approaches
por: Yang, Zhengdong, et al.
Publicado: (2025)
por: Yang, Zhengdong, et al.
Publicado: (2025)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
por: Xie, Xurong, et al.
Publicado: (2022)
por: Xie, Xurong, et al.
Publicado: (2022)
LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech
por: Mu, Bingshen, et al.
Publicado: (2026)
por: Mu, Bingshen, et al.
Publicado: (2026)
Abusive Speech Detection in Indic Languages Using Acoustic Features
por: Spiesberger, Anika A., et al.
Publicado: (2024)
por: Spiesberger, Anika A., et al.
Publicado: (2024)
Binaural Selective Attention Model for Target Speaker Extraction
por: Meng, Hanyu, et al.
Publicado: (2024)
por: Meng, Hanyu, et al.
Publicado: (2024)
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
por: Zhang, Qiquan, et al.
Publicado: (2025)
por: Zhang, Qiquan, et al.
Publicado: (2025)
Efficient Long Speech Sequence Modelling for Time-Domain Depression Level Estimation
por: Li, Shuanglin, et al.
Publicado: (2025)
por: Li, Shuanglin, et al.
Publicado: (2025)
When Voice Matters: Evidence of Gender Disparity in Positional Bias of SpeechLLMs
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2025)
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2025)
Evaluating Parkinson's Disease Detection in Anonymized Speech: A Performance and Acoustic Analysis
por: Franzreb, Carlos, et al.
Publicado: (2026)
por: Franzreb, Carlos, et al.
Publicado: (2026)
EELE: Exploring Efficient and Extensible LoRA Integration in Emotional Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
Should Audio Front-ends be Adaptive? Comparing Learnable and Adaptive Front-ends
por: Zhang, Qiquan, et al.
Publicado: (2025)
por: Zhang, Qiquan, et al.
Publicado: (2025)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
A Joint Spectro-Temporal Relational Thinking Based Acoustic Modeling Framework
por: Nan, Zheng, et al.
Publicado: (2024)
por: Nan, Zheng, et al.
Publicado: (2024)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
por: Qian, Xinyuan, et al.
Publicado: (2024)
por: Qian, Xinyuan, et al.
Publicado: (2024)
Acoustic BPE for Speech Generation with Discrete Tokens
por: Shen, Feiyu, et al.
Publicado: (2023)
por: Shen, Feiyu, et al.
Publicado: (2023)
Integrating Pause Information with Word Embeddings in Language Models for Alzheimer's Disease Detection from Spontaneous Speech
por: Pu, Yu, et al.
Publicado: (2025)
por: Pu, Yu, et al.
Publicado: (2025)
Selective State Space Model for Monaural Speech Enhancement
por: Chen, Moran, et al.
Publicado: (2024)
por: Chen, Moran, et al.
Publicado: (2024)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
por: Wu, Jinyang, et al.
Publicado: (2026)
por: Wu, Jinyang, et al.
Publicado: (2026)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
por: Wan, Zixiang, et al.
Publicado: (2024)
por: Wan, Zixiang, et al.
Publicado: (2024)
Data-Efficient Low-Complexity Acoustic Scene Classification via Distilling and Progressive Pruning
por: Han, Bing, et al.
Publicado: (2024)
por: Han, Bing, et al.
Publicado: (2024)
Bridging ASR and LLMs for Dysarthric Speech Recognition: Benchmarking Self-Supervised and Generative Approaches
por: Aboeitta, Ahmed, et al.
Publicado: (2025)
por: Aboeitta, Ahmed, et al.
Publicado: (2025)
Universal Acoustic Adversarial Attacks for Flexible Control of Speech-LLMs
por: Ma, Rao, et al.
Publicado: (2025)
por: Ma, Rao, et al.
Publicado: (2025)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
por: Liu, Hexin, et al.
Publicado: (2025)
por: Liu, Hexin, et al.
Publicado: (2025)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
por: Daeglau, Mareike, et al.
Publicado: (2025)
por: Daeglau, Mareike, et al.
Publicado: (2025)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
por: Huang, Mengcheng, et al.
Publicado: (2026)
por: Huang, Mengcheng, et al.
Publicado: (2026)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
por: Chen, Wenxi, et al.
Publicado: (2025)
por: Chen, Wenxi, et al.
Publicado: (2025)
Ejemplares similares
-
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
por: Zhang, Xiangyu, et al.
Publicado: (2025) -
Mamba in Speech: Towards an Alternative to Self-Attention
por: Zhang, Xiangyu, et al.
Publicado: (2024) -
Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction
por: Zhang, Xiangyu, et al.
Publicado: (2024) -
Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection
por: Zhang, Xiangyu, et al.
Publicado: (2025) -
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
por: Shahin, Mostafa, et al.
Publicado: (2025)