Speech-based Clinical Depression Screening: An Empirical Study
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yangbin, Xu, Chenyang, Liang, Chunfeng, Tao, Yanbao, Shi, Chuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Incremental FastPitch: Chunk-based High Quality Text to Speech
par: Du, Muyang, et autres
Publié: (2024)
par: Du, Muyang, et autres
Publié: (2024)
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
A Tutorial on Clinical Speech AI Development: From Data Collection to Model Validation
par: Ng, Si-Ioi, et autres
Publié: (2024)
par: Ng, Si-Ioi, et autres
Publié: (2024)
Deploying UDM Series in Real-Life Stuttered Speech Applications: A Clinical Evaluation Framework
par: Zhang, Eric, et autres
Publié: (2025)
par: Zhang, Eric, et autres
Publié: (2025)
MEBM-Speech: Multi-scale Enhanced BrainMagic for Robust MEG Speech Detection
par: Songyi, Li, et autres
Publié: (2026)
par: Songyi, Li, et autres
Publié: (2026)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks
par: Wang, Shih-Heng, et autres
Publié: (2026)
par: Wang, Shih-Heng, et autres
Publié: (2026)
Contrastive Augmentation: An Unsupervised Learning Approach for Keyword Spotting in Speech Technology
par: Dai, Weinan, et autres
Publié: (2024)
par: Dai, Weinan, et autres
Publié: (2024)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
par: Choi, Yerin, et autres
Publié: (2024)
par: Choi, Yerin, et autres
Publié: (2024)
Study of the Performance of CEEMDAN in Underdetermined Speech Separation
par: Melhem, Rawad, et autres
Publié: (2024)
par: Melhem, Rawad, et autres
Publié: (2024)
Dual Information Speech Language Models for Emotional Conversations
par: Wang, Chun, et autres
Publié: (2025)
par: Wang, Chun, et autres
Publié: (2025)
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Tiny-Align: Bridging Automatic Speech Recognition and Large Language Model on the Edge
par: Qin, Ruiyang, et autres
Publié: (2024)
par: Qin, Ruiyang, et autres
Publié: (2024)
TIGER: Time-frequency Interleaved Gain Extraction and Reconstruction for Efficient Speech Separation
par: Xu, Mohan, et autres
Publié: (2024)
par: Xu, Mohan, et autres
Publié: (2024)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
par: Qi, Xin, et autres
Publié: (2024)
par: Qi, Xin, et autres
Publié: (2024)
Safe Guard: an LLM-agent for Real-time Voice-based Hate Speech Detection in Social Virtual Reality
par: Xu, Yiwen, et autres
Publié: (2024)
par: Xu, Yiwen, et autres
Publié: (2024)
Color-based Emotion Representation for Speech Emotion Recognition
par: Nagase, Ryotaro, et autres
Publié: (2026)
par: Nagase, Ryotaro, et autres
Publié: (2026)
ECTSpeech: Enhancing Efficient Speech Synthesis via Easy Consistency Tuning
par: Zhu, Tao, et autres
Publié: (2025)
par: Zhu, Tao, et autres
Publié: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
par: Wang, Xinsheng, et autres
Publié: (2025)
par: Wang, Xinsheng, et autres
Publié: (2025)
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
par: Mai, Jialong, et autres
Publié: (2025)
par: Mai, Jialong, et autres
Publié: (2025)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
par: Neekhara, Paarth, et autres
Publié: (2024)
par: Neekhara, Paarth, et autres
Publié: (2024)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
par: Yao, Wenhan, et autres
Publié: (2024)
par: Yao, Wenhan, et autres
Publié: (2024)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
par: Xu, Haoning, et autres
Publié: (2025)
par: Xu, Haoning, et autres
Publié: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
par: Nguyen, Tan Dat, et autres
Publié: (2024)
par: Nguyen, Tan Dat, et autres
Publié: (2024)
Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
Estimating Respiratory Effort from Nocturnal Breathing Sounds for Obstructive Sleep Apnoea Screening
par: Xu, Xiaolei, et autres
Publié: (2025)
par: Xu, Xiaolei, et autres
Publié: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024)
par: Truong, Duc-Tuan, et autres
Publié: (2024)
A Study of the Scale Invariant Signal to Distortion Ratio in Speech Separation with Noisy References
par: Jepsen, Simon Dahl, et autres
Publié: (2025)
par: Jepsen, Simon Dahl, et autres
Publié: (2025)
Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
BinauralFlow: A Causal and Streamable Approach for High-Quality Binaural Speech Synthesis with Flow Matching Models
par: Liang, Susan, et autres
Publié: (2025)
par: Liang, Susan, et autres
Publié: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
par: Kim, Jaeyoung, et autres
Publié: (2024)
par: Kim, Jaeyoung, et autres
Publié: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
par: Lin, Zijian, et autres
Publié: (2025)
par: Lin, Zijian, et autres
Publié: (2025)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
par: Wang, Yongqi, et autres
Publié: (2023)
par: Wang, Yongqi, et autres
Publié: (2023)
Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems
par: Raymondaud, Quentin, et autres
Publié: (2024)
par: Raymondaud, Quentin, et autres
Publié: (2024)
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
par: Zhang, Leying, et autres
Publié: (2026)
par: Zhang, Leying, et autres
Publié: (2026)
CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training
par: Du, Zhihao, et autres
Publié: (2025)
par: Du, Zhihao, et autres
Publié: (2025)
Improvement and Implementation of a Speech Emotion Recognition Model Based on Dual-Layer LSTM
par: Yang, Xiaoran, et autres
Publié: (2024)
par: Yang, Xiaoran, et autres
Publié: (2024)
Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis
par: Ji, Zhoulin, et autres
Publié: (2024)
par: Ji, Zhoulin, et autres
Publié: (2024)
Documents similaires
-
Incremental FastPitch: Chunk-based High Quality Text to Speech
par: Du, Muyang, et autres
Publié: (2024) -
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
par: Zhang, Xiangyu, et autres
Publié: (2024) -
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
par: Wang, Cong, et autres
Publié: (2025) -
A Tutorial on Clinical Speech AI Development: From Data Collection to Model Validation
par: Ng, Si-Ioi, et autres
Publié: (2024) -
Deploying UDM Series in Real-Life Stuttered Speech Applications: A Clinical Evaluation Framework
par: Zhang, Eric, et autres
Publié: (2025)