MDD-Net: Multimodal Depression Detection through Mutual Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Haque, Md Rezwanul, Islam, Md. Milon, Raju, S M Taslim Uddin, Altaheri, Hamdi, Nassar, Lobna, Karray, Fakhri |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
par: Haque, Md Rezwanul, et autres
Publié: (2025)
par: Haque, Md Rezwanul, et autres
Publié: (2025)
GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning
par: Raju, S M Taslim Uddin, et autres
Publié: (2025)
par: Raju, S M Taslim Uddin, et autres
Publié: (2025)
FusionEnsemble-Net: An Attention-Based Ensemble of Spatiotemporal Networks for Multimodal Sign Language Recognition
par: Islam, Md. Milon, et autres
Publié: (2025)
par: Islam, Md. Milon, et autres
Publié: (2025)
A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition
par: Haque, Md Rezwanul, et autres
Publié: (2025)
par: Haque, Md Rezwanul, et autres
Publié: (2025)
Personality-Enhanced Multimodal Depression Detection in the Elderly
par: Wang, Honghong, et autres
Publié: (2025)
par: Wang, Honghong, et autres
Publié: (2025)
Bridging Brain with Foundation Models through Self-Supervised Learning
par: Altaheri, Hamdi, et autres
Publié: (2025)
par: Altaheri, Hamdi, et autres
Publié: (2025)
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Missingness-resilient Video-enhanced Multimodal Disfluency Detection
par: Mohapatra, Payal, et autres
Publié: (2024)
par: Mohapatra, Payal, et autres
Publié: (2024)
Target Speech Diarization with Multimodal Prompts
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
Iola Walker: A Mobile Footfall Detection System for Music Composition
par: James, William B.
Publié: (2025)
par: James, William B.
Publié: (2025)
MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
par: Zhou, Wangjin, et autres
Publié: (2024)
par: Zhou, Wangjin, et autres
Publié: (2024)
Exploring compressibility of transformer based text-to-music (TTM) models
par: Moschopoulos, Vasileios, et autres
Publié: (2024)
par: Moschopoulos, Vasileios, et autres
Publié: (2024)
A Survey on Multimodal Music Emotion Recognition
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
Multimodal Fish Feeding Intensity Assessment in Aquaculture
par: Cui, Meng, et autres
Publié: (2023)
par: Cui, Meng, et autres
Publié: (2023)
MMSD-Net: Towards Multi-modal Stuttering Detection
par: Nie, Liangyu, et autres
Publié: (2024)
par: Nie, Liangyu, et autres
Publié: (2024)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
par: Zhang, Xiaohui, et autres
Publié: (2024)
par: Zhang, Xiaohui, et autres
Publié: (2024)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
par: Li, Sifei, et autres
Publié: (2025)
par: Li, Sifei, et autres
Publié: (2025)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
par: Song, Jiahao, et autres
Publié: (2025)
par: Song, Jiahao, et autres
Publié: (2025)
X-CrossNet: A complex spectral mapping approach to target speaker extraction with cross attention speaker embedding fusion
par: Sun, Chang, et autres
Publié: (2024)
par: Sun, Chang, et autres
Publié: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
par: Chen, Gehui, et autres
Publié: (2024)
par: Chen, Gehui, et autres
Publié: (2024)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
par: Zhao, Qihao, et autres
Publié: (2026)
par: Zhao, Qihao, et autres
Publié: (2026)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
par: Yao, Dong, et autres
Publié: (2023)
par: Yao, Dong, et autres
Publié: (2023)
Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations
par: Wachter, Maximilian, et autres
Publié: (2026)
par: Wachter, Maximilian, et autres
Publié: (2026)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
par: Gu, Ke, et autres
Publié: (2025)
par: Gu, Ke, et autres
Publié: (2025)
Trusted Fake Audio Detection Based on Dirichlet Distribution
par: Ding, Chi, et autres
Publié: (2025)
par: Ding, Chi, et autres
Publié: (2025)
A Unified Framework for Modality-Agnostic Deepfakes Detection
par: Yu, Cai, et autres
Publié: (2023)
par: Yu, Cai, et autres
Publié: (2023)
Efficient Video to Audio Mapper with Visual Scene Detection
par: Yi, Mingjing, et autres
Publié: (2024)
par: Yi, Mingjing, et autres
Publié: (2024)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
par: Luo, Jing, et autres
Publié: (2024)
par: Luo, Jing, et autres
Publié: (2024)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
par: Li, Xiaolou, et autres
Publié: (2024)
par: Li, Xiaolou, et autres
Publié: (2024)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
par: Zhang, You, et autres
Publié: (2024)
par: Zhang, You, et autres
Publié: (2024)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
par: Yang, Kaixing, et autres
Publié: (2024)
par: Yang, Kaixing, et autres
Publié: (2024)
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
par: Salvi, Davide, et autres
Publié: (2024)
par: Salvi, Davide, et autres
Publié: (2024)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
par: Huang, Lian, et autres
Publié: (2024)
par: Huang, Lian, et autres
Publié: (2024)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
par: Clarke, Jason, et autres
Publié: (2025)
par: Clarke, Jason, et autres
Publié: (2025)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
par: Wang, Anna, et autres
Publié: (2024)
par: Wang, Anna, et autres
Publié: (2024)
SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement
par: Yang, Chenyu, et autres
Publié: (2025)
par: Yang, Chenyu, et autres
Publié: (2025)
Documents similaires
-
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
par: Haque, Md Rezwanul, et autres
Publié: (2025) -
GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning
par: Raju, S M Taslim Uddin, et autres
Publié: (2025) -
FusionEnsemble-Net: An Attention-Based Ensemble of Spatiotemporal Networks for Multimodal Sign Language Recognition
par: Islam, Md. Milon, et autres
Publié: (2025) -
A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition
par: Haque, Md Rezwanul, et autres
Publié: (2025) -
Personality-Enhanced Multimodal Depression Detection in the Elderly
par: Wang, Honghong, et autres
Publié: (2025)