Personality-Enhanced Multimodal Depression Detection in the Elderly
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Honghong, Deng, Jing, Zheng, Rong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
Efficient Adapter Tuning for Joint Singing Voice Beat and Downbeat Tracking with Self-supervised Learning Features
por: Deng, Jiajun, et al.
Publicado: (2025)
por: Deng, Jiajun, et al.
Publicado: (2025)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
por: Song, Jiahao, et al.
Publicado: (2025)
por: Song, Jiahao, et al.
Publicado: (2025)
Multimodal Fish Feeding Intensity Assessment in Aquaculture
por: Cui, Meng, et al.
Publicado: (2023)
por: Cui, Meng, et al.
Publicado: (2023)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
por: Chen, Gehui, et al.
Publicado: (2024)
por: Chen, Gehui, et al.
Publicado: (2024)
A Survey on Multimodal Music Emotion Recognition
por: Liyanarachchi, Rashini, et al.
Publicado: (2025)
por: Liyanarachchi, Rashini, et al.
Publicado: (2025)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Trusted Fake Audio Detection Based on Dirichlet Distribution
por: Ding, Chi, et al.
Publicado: (2025)
por: Ding, Chi, et al.
Publicado: (2025)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
por: Zang, Yongyi, et al.
Publicado: (2024)
por: Zang, Yongyi, et al.
Publicado: (2024)
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
por: Zhang, Xiaohui, et al.
Publicado: (2024)
por: Zhang, Xiaohui, et al.
Publicado: (2024)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
por: Li, Sifei, et al.
Publicado: (2025)
por: Li, Sifei, et al.
Publicado: (2025)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
por: Li, Xiaolou, et al.
Publicado: (2024)
por: Li, Xiaolou, et al.
Publicado: (2024)
A Unified Framework for Modality-Agnostic Deepfakes Detection
por: Yu, Cai, et al.
Publicado: (2023)
por: Yu, Cai, et al.
Publicado: (2023)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
por: Zhao, Qihao, et al.
Publicado: (2026)
por: Zhao, Qihao, et al.
Publicado: (2026)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
por: Li, Jizhen, et al.
Publicado: (2024)
por: Li, Jizhen, et al.
Publicado: (2024)
Mitigating Category Imbalance: Fosafer System for the Multimodal Emotion and Intent Joint Understanding Challenge
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
por: Wang, Anna, et al.
Publicado: (2024)
por: Wang, Anna, et al.
Publicado: (2024)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
por: Gu, Ke, et al.
Publicado: (2025)
por: Gu, Ke, et al.
Publicado: (2025)
Efficient Video to Audio Mapper with Visual Scene Detection
por: Yi, Mingjing, et al.
Publicado: (2024)
por: Yi, Mingjing, et al.
Publicado: (2024)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
por: Zhang, You, et al.
Publicado: (2024)
por: Zhang, You, et al.
Publicado: (2024)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
por: Clarke, Jason, et al.
Publicado: (2025)
por: Clarke, Jason, et al.
Publicado: (2025)
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
por: Huang, Lian, et al.
Publicado: (2024)
por: Huang, Lian, et al.
Publicado: (2024)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
por: Huang, Qiaochu, et al.
Publicado: (2024)
por: Huang, Qiaochu, et al.
Publicado: (2024)
Intelligent Text-Conditioned Music Generation
por: Xie, Zhouyao, et al.
Publicado: (2024)
por: Xie, Zhouyao, et al.
Publicado: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
por: Lu, Wenhuan, et al.
Publicado: (2025)
por: Lu, Wenhuan, et al.
Publicado: (2025)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
por: Biyani, Ishan D., et al.
Publicado: (2025)
por: Biyani, Ishan D., et al.
Publicado: (2025)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
por: Yang, Kaixing, et al.
Publicado: (2024)
por: Yang, Kaixing, et al.
Publicado: (2024)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
por: Qian, Yikai, et al.
Publicado: (2024)
por: Qian, Yikai, et al.
Publicado: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
por: Lv, Yishan, et al.
Publicado: (2026)
por: Lv, Yishan, et al.
Publicado: (2026)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
por: Yao, Dong, et al.
Publicado: (2023)
por: Yao, Dong, et al.
Publicado: (2023)
M6: Multi-generator, Multi-domain, Multi-lingual and cultural, Multi-genres, Multi-instrument Machine-Generated Music Detection Databases
por: Li, Yupei, et al.
Publicado: (2024)
por: Li, Yupei, et al.
Publicado: (2024)
AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
Speech Emotion Recognition Using Fine-Tuned DWFormer:A Study on Track 1 of the IERPChallenge 2024
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025)
por: Tian, Wenjie, et al.
Publicado: (2025)
Ejemplares similares
-
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
por: Niu, Xinlei, et al.
Publicado: (2025) -
Efficient Adapter Tuning for Joint Singing Voice Beat and Downbeat Tracking with Self-supervised Learning Features
por: Deng, Jiajun, et al.
Publicado: (2025) -
MusFlow: Multimodal Music Generation via Conditional Flow Matching
por: Song, Jiahao, et al.
Publicado: (2025) -
Multimodal Fish Feeding Intensity Assessment in Aquaculture
por: Cui, Meng, et al.
Publicado: (2023) -
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
por: Chen, Gehui, et al.
Publicado: (2024)