Salvato in:
| Autori principali: | Yu, Hangbin, Yang, Yudong, Su, Rongfeng, Yan, Nan, Wang, Lan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2604.10181 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language Model
di: Yang, Yudong, et al.
Pubblicazione: (2025)
di: Yang, Yudong, et al.
Pubblicazione: (2025)
An Audio-textual Diffusion Model For Converting Speech Signals Into Ultrasound Tongue Imaging Data
di: Yang, Yudong, et al.
Pubblicazione: (2024)
di: Yang, Yudong, et al.
Pubblicazione: (2024)
From Speech to Profile: A Protocol-Driven LLM Agent for Psychological Profile Generation
di: Yang, Xingjian, et al.
Pubblicazione: (2026)
di: Yang, Xingjian, et al.
Pubblicazione: (2026)
Personality-Enhanced Multimodal Depression Detection in the Elderly
di: Wang, Honghong, et al.
Pubblicazione: (2025)
di: Wang, Honghong, et al.
Pubblicazione: (2025)
READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)
Exploring Machine Learning and Language Models for Multimodal Depression Detection
di: Hong, Javier Si Zhao, et al.
Pubblicazione: (2025)
di: Hong, Javier Si Zhao, et al.
Pubblicazione: (2025)
Test-Time Training for Depression Detection
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
Self-Supervised Embeddings for Detecting Individual Symptoms of Depression
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
ComFeAT: Combination of Neural and Spectral Features for Improved Depression Detection
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Voice Biomarkers for Depression and Anxiety
di: Abramenko, Oleksii, et al.
Pubblicazione: (2026)
di: Abramenko, Oleksii, et al.
Pubblicazione: (2026)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
di: Li, Yuxin, et al.
Pubblicazione: (2025)
di: Li, Yuxin, et al.
Pubblicazione: (2025)
Multimodal Magic Elevating Depression Detection with a Fusion of Text and Audio Intelligence
di: Gan, Lindy, et al.
Pubblicazione: (2025)
di: Gan, Lindy, et al.
Pubblicazione: (2025)
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
Investigating Acoustic-Textual Emotional Inconsistency Information for Automatic Depression Detection
di: Su, Rongfeng, et al.
Pubblicazione: (2024)
di: Su, Rongfeng, et al.
Pubblicazione: (2024)
A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks
di: Ishikawa, Takehiro, et al.
Pubblicazione: (2026)
di: Ishikawa, Takehiro, et al.
Pubblicazione: (2026)
IHearYou: Linking Acoustic Features to DSM-5 Depressive Behavior Indicators
di: Länzlinger, Jonas, et al.
Pubblicazione: (2025)
di: Länzlinger, Jonas, et al.
Pubblicazione: (2025)
Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
di: Li, Shuyu, et al.
Pubblicazione: (2025)
di: Li, Shuyu, et al.
Pubblicazione: (2025)
Recurrence-Based Nonlinear Vocal Dynamics as Digital Biomarkers for Depression Detection from Conversational Speech
di: Samanta, Himadri S
Pubblicazione: (2026)
di: Samanta, Himadri S
Pubblicazione: (2026)
Speech-based Clinical Depression Screening: An Empirical Study
di: Chen, Yangbin, et al.
Pubblicazione: (2024)
di: Chen, Yangbin, et al.
Pubblicazione: (2024)
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
di: Cai, Pengfei, et al.
Pubblicazione: (2025)
di: Cai, Pengfei, et al.
Pubblicazione: (2025)
RBA-FE: A Robust Brain-Inspired Audio Feature Extractor for Depression Diagnosis
di: Wu, Yu-Xuan, et al.
Pubblicazione: (2025)
di: Wu, Yu-Xuan, et al.
Pubblicazione: (2025)
Efficient Long Speech Sequence Modelling for Time-Domain Depression Level Estimation
di: Li, Shuanglin, et al.
Pubblicazione: (2025)
di: Li, Shuanglin, et al.
Pubblicazione: (2025)
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought
di: Li, Xuanchen, et al.
Pubblicazione: (2026)
di: Li, Xuanchen, et al.
Pubblicazione: (2026)
Deep CLAS: Deep Contextual Listen, Attend and Spell
di: Wang, Mengzhi, et al.
Pubblicazione: (2024)
di: Wang, Mengzhi, et al.
Pubblicazione: (2024)
Robust and Explainable Depression Identification from Speech Using Vowel-Based Ensemble Learning Approaches
di: Feng, Kexin, et al.
Pubblicazione: (2024)
di: Feng, Kexin, et al.
Pubblicazione: (2024)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
di: Gu, Yu, et al.
Pubblicazione: (2024)
di: Gu, Yu, et al.
Pubblicazione: (2024)
AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition
di: Wang, Yunsheng, et al.
Pubblicazione: (2026)
di: Wang, Yunsheng, et al.
Pubblicazione: (2026)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Predicting Individual Depression Symptoms from Acoustic Features During Speech
di: Rodriguez, Sebastian, et al.
Pubblicazione: (2024)
di: Rodriguez, Sebastian, et al.
Pubblicazione: (2024)
EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction
di: Jing, Chong, et al.
Pubblicazione: (2026)
di: Jing, Chong, et al.
Pubblicazione: (2026)
MOSA: Music Motion with Semantic Annotation Dataset for Cross-Modal Music Processing
di: Huang, Yu-Fen, et al.
Pubblicazione: (2024)
di: Huang, Yu-Fen, et al.
Pubblicazione: (2024)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
di: Lin, Yueqian, et al.
Pubblicazione: (2025)
di: Lin, Yueqian, et al.
Pubblicazione: (2025)
Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT
di: Du, Zhihao, et al.
Pubblicazione: (2023)
di: Du, Zhihao, et al.
Pubblicazione: (2023)
Two-Stage Acoustic Adaptation with Gated Cross-Attention Adapters for LLM-Based Multi-Talker Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2026)
di: Shi, Hao, et al.
Pubblicazione: (2026)
Emotional Vietnamese Speech-Based Depression Diagnosis Using Dynamic Attention Mechanism
di: D., Quang-Anh N., et al.
Pubblicazione: (2024)
di: D., Quang-Anh N., et al.
Pubblicazione: (2024)
LPGNet: A Lightweight Network with Parallel Attention and Gated Fusion for Multimodal Emotion Recognition
di: He, Zhining, et al.
Pubblicazione: (2025)
di: He, Zhining, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language Model
di: Yang, Yudong, et al.
Pubblicazione: (2025) -
An Audio-textual Diffusion Model For Converting Speech Signals Into Ultrasound Tongue Imaging Data
di: Yang, Yudong, et al.
Pubblicazione: (2024) -
From Speech to Profile: A Protocol-Driven LLM Agent for Psychological Profile Generation
di: Yang, Xingjian, et al.
Pubblicazione: (2026) -
Personality-Enhanced Multimodal Depression Detection in the Elderly
di: Wang, Honghong, et al.
Pubblicazione: (2025) -
READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)