SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xiangyu, Liu, Hexin, Zhang, Qiquan, Ahmed, Beena, Epps, Julien |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025)
Distinctive Feature Codec: An Adaptive Efficient Speech Representation for Depression Detection
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025)
Mamba in Speech: Towards an Alternative to Self-Attention
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
Rethinking Mamba in Speech Processing by Self-Supervised Models
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
di: Shahin, Mostafa, et al.
Pubblicazione: (2025)
di: Shahin, Mostafa, et al.
Pubblicazione: (2025)
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
Selective State Space Model for Monaural Speech Enhancement
di: Chen, Moran, et al.
Pubblicazione: (2024)
di: Chen, Moran, et al.
Pubblicazione: (2024)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
di: Liu, Hexin, et al.
Pubblicazione: (2025)
di: Liu, Hexin, et al.
Pubblicazione: (2025)
Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization
di: Zhang, Xiangyu, et al.
Pubblicazione: (2026)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2026)
Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
di: Liu, Hexin, et al.
Pubblicazione: (2024)
di: Liu, Hexin, et al.
Pubblicazione: (2024)
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
Learning Time-Graph Frequency Representation for Monaural Speech Enhancement
di: Wang, Tingting, et al.
Pubblicazione: (2025)
di: Wang, Tingting, et al.
Pubblicazione: (2025)
Exploring Length Generalization For Transformer-based Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
Time-Graph Frequency Representation with Singular Value Decomposition for Neural Speech Enhancement
di: Wang, Tingting, et al.
Pubblicazione: (2024)
di: Wang, Tingting, et al.
Pubblicazione: (2024)
RAG-Boost: Retrieval-Augmented Generation Enhanced LLM-based Speech Recognition
di: Wang, Pengcheng, et al.
Pubblicazione: (2025)
di: Wang, Pengcheng, et al.
Pubblicazione: (2025)
Automatic Detection of Depression in Speech Using Ensemble Convolutional Neural Networks
di: Vázquez-Romero, Adrián, et al.
Pubblicazione: (2024)
di: Vázquez-Romero, Adrián, et al.
Pubblicazione: (2024)
Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model
di: Lehečka, Jan, et al.
Pubblicazione: (2024)
di: Lehečka, Jan, et al.
Pubblicazione: (2024)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
di: Yeo, Yue Heng, et al.
Pubblicazione: (2026)
di: Yeo, Yue Heng, et al.
Pubblicazione: (2026)
Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation
di: Zuo, Tianlun, et al.
Pubblicazione: (2025)
di: Zuo, Tianlun, et al.
Pubblicazione: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
di: Zhang, Haoyang, et al.
Pubblicazione: (2026)
di: Zhang, Haoyang, et al.
Pubblicazione: (2026)
Who is Speaking or Who is Depressed? A Controlled Study of Speaker Leakage in Speech-Based Depression Detection
di: Yeh, Hsiang-Chen, et al.
Pubblicazione: (2026)
di: Yeh, Hsiang-Chen, et al.
Pubblicazione: (2026)
Validating Computational Markers of Depressive Behavior: Cross-Linguistic Speech-Based Depression Detection with Neurophysiological Validation
di: Tao, Fuxiang, et al.
Pubblicazione: (2026)
di: Tao, Fuxiang, et al.
Pubblicazione: (2026)
Retrieval Augmented Correction of Named Entity Speech Recognition Errors
di: Pusateri, Ernest, et al.
Pubblicazione: (2024)
di: Pusateri, Ernest, et al.
Pubblicazione: (2024)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
GEC-RAG: Improving Generative Error Correction via Retrieval-Augmented Generation for Automatic Speech Recognition Systems
di: Robatian, Amin, et al.
Pubblicazione: (2025)
di: Robatian, Amin, et al.
Pubblicazione: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
Speech Retrieval-Augmented Generation without Automatic Speech Recognition
di: Min, Do June, et al.
Pubblicazione: (2024)
di: Min, Do June, et al.
Pubblicazione: (2024)
Revisiting Interpolation Augmentation for Speech-to-Text Generation
di: Xu, Chen, et al.
Pubblicazione: (2024)
di: Xu, Chen, et al.
Pubblicazione: (2024)
Adaptive Speaker Embedding Self-Augmentation for Personal Voice Activity Detection with Short Enrollment Speech
di: Feng, Fuyuan, et al.
Pubblicazione: (2026)
di: Feng, Fuyuan, et al.
Pubblicazione: (2026)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
di: Sun, Haoqin, et al.
Pubblicazione: (2025)
di: Sun, Haoqin, et al.
Pubblicazione: (2025)
Data Augmentation for Pathological Speech Enhancement
di: Hou, Mingchi, et al.
Pubblicazione: (2026)
di: Hou, Mingchi, et al.
Pubblicazione: (2026)
Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
di: Zhao, Jinzheng, et al.
Pubblicazione: (2024)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024) -
Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025) -
Distinctive Feature Codec: An Adaptive Efficient Speech Representation for Depression Detection
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025) -
Mamba in Speech: Towards an Alternative to Self-Attention
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024) -
Rethinking Mamba in Speech Processing by Self-Supervised Models
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)