Explainable Parkinsons Disease Gait Recognition Using Multimodal RGB-D Fusion and Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Alnaasan, Manar, Sarowar, Md Selim, Kim, Sungho |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VLM6D: VLM based 6Dof Pose Estimation based on RGB-D Images
by: Sarowar, Md Selim, et al.
Published: (2025)
by: Sarowar, Md Selim, et al.
Published: (2025)
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
by: Sarowar, Md Selim, et al.
Published: (2025)
by: Sarowar, Md Selim, et al.
Published: (2025)
GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models
by: Sarowar, Md Selim, et al.
Published: (2026)
by: Sarowar, Md Selim, et al.
Published: (2026)
Application of Multimodal Fusion Deep Learning Model in Disease Recognition
by: Liu, Xiaoyi, et al.
Published: (2024)
by: Liu, Xiaoyi, et al.
Published: (2024)
GateFuseNet: An Adaptive 3D Multimodal Neuroimaging Fusion Network for Parkinson's Disease Diagnosis
by: Jin, Rui, et al.
Published: (2025)
by: Jin, Rui, et al.
Published: (2025)
FusionEnsemble-Net: An Attention-Based Ensemble of Spatiotemporal Networks for Multimodal Sign Language Recognition
by: Islam, Md. Milon, et al.
Published: (2025)
by: Islam, Md. Milon, et al.
Published: (2025)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
by: Zhang, Jingrui, et al.
Published: (2026)
by: Zhang, Jingrui, et al.
Published: (2026)
A Bidirectional Siamese Recurrent Neural Network for Accurate Gait Recognition Using Body Landmarks
by: Progga, Proma Hossain, et al.
Published: (2024)
by: Progga, Proma Hossain, et al.
Published: (2024)
SIM-Net: A Multimodal Fusion Network Using Inferred 3D Object Shape Point Clouds from RGB Images for 2D Classification
by: Sklab, Youcef, et al.
Published: (2025)
by: Sklab, Youcef, et al.
Published: (2025)
Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions
by: Lu, Zhiyang, et al.
Published: (2026)
by: Lu, Zhiyang, et al.
Published: (2026)
Foundation versus Domain-specific Models: Performance Comparison, Fusion, and Explainability in Face Recognition
by: Sony, Redwan, et al.
Published: (2025)
by: Sony, Redwan, et al.
Published: (2025)
Parkinson's Disease Diagnosis Through Deep Learning: A Novel LSTM-Based Approach for Freezing of Gait Detection
by: Mir, Aqib Nazir, et al.
Published: (2024)
by: Mir, Aqib Nazir, et al.
Published: (2024)
DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion
by: Lu, Zhiyang, et al.
Published: (2026)
by: Lu, Zhiyang, et al.
Published: (2026)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
by: Ye, Zhipeng, et al.
Published: (2026)
by: Ye, Zhipeng, et al.
Published: (2026)
On Denoising Walking Videos for Gait Recognition
by: Jin, Dongyang, et al.
Published: (2025)
by: Jin, Dongyang, et al.
Published: (2025)
Rethinking RGB-D Fusion for Semantic Segmentation in Surgical Datasets
by: Jamal, Muhammad Abdullah, et al.
Published: (2024)
by: Jamal, Muhammad Abdullah, et al.
Published: (2024)
Collaborative Learning for 3D Hand-Object Reconstruction and Compositional Action Recognition from Egocentric RGB Videos Using Superquadrics
by: Tse, Tze Ho Elden, et al.
Published: (2025)
by: Tse, Tze Ho Elden, et al.
Published: (2025)
LeafLife: An Explainable Deep Learning Framework with Robustness for Grape Leaf Disease Recognition
by: Alam, B. M. Shahria, et al.
Published: (2026)
by: Alam, B. M. Shahria, et al.
Published: (2026)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
by: She, Yifei, et al.
Published: (2025)
by: She, Yifei, et al.
Published: (2025)
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
by: Huang, Zhengchao, et al.
Published: (2024)
by: Huang, Zhengchao, et al.
Published: (2024)
EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
by: Sun, Haoran, et al.
Published: (2025)
by: Sun, Haoran, et al.
Published: (2025)
Towards Explainable Skin Cancer Classification: A Dual-Network Attention Model with Lesion Segmentation and Clinical Metadata Fusion
by: Atiq, Md. Enamul, et al.
Published: (2025)
by: Atiq, Md. Enamul, et al.
Published: (2025)
An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis
by: Sk., Md. Sajeebul Islam, et al.
Published: (2026)
by: Sk., Md. Sajeebul Islam, et al.
Published: (2026)
Benchmarking Multimodal Large Language Models for Face Recognition
by: Shahreza, Hatef Otroshi, et al.
Published: (2025)
by: Shahreza, Hatef Otroshi, et al.
Published: (2025)
CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
by: Dang, Yunkai, et al.
Published: (2026)
by: Dang, Yunkai, et al.
Published: (2026)
A Lightweight and Explainable DenseNet-121 Framework for Grape Leaf Disease Classification
by: Haque, Md. Ehsanul, et al.
Published: (2026)
by: Haque, Md. Ehsanul, et al.
Published: (2026)
Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines
by: Kim, Junwan, et al.
Published: (2026)
by: Kim, Junwan, et al.
Published: (2026)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
by: Haq, Ijazul, et al.
Published: (2025)
by: Haq, Ijazul, et al.
Published: (2025)
QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation
by: Wasfy, Ahmed, et al.
Published: (2025)
by: Wasfy, Ahmed, et al.
Published: (2025)
GaitCrafter: Diffusion Model for Biometric Preserving Gait Synthesis
by: Mitra, Sirshapan, et al.
Published: (2025)
by: Mitra, Sirshapan, et al.
Published: (2025)
RA-CMF: Region-Adaptive Conditional MeanFlow for CT Image Reconstruction
by: Apurba, Md Shifatul Ahsan, et al.
Published: (2026)
by: Apurba, Md Shifatul Ahsan, et al.
Published: (2026)
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
by: Jung, Woojun, et al.
Published: (2025)
by: Jung, Woojun, et al.
Published: (2025)
A Clinically Interpretable Deep CNN Framework for Early Chronic Kidney Disease Prediction Using Grad-CAM-Based Explainable AI
by: Ayub, Anas Bin, et al.
Published: (2025)
by: Ayub, Anas Bin, et al.
Published: (2025)
Cross-Modal Purification and Fusion for Small-Object RGB-D Transmission-Line Defect Detection
by: Cui, Jiaming, et al.
Published: (2026)
by: Cui, Jiaming, et al.
Published: (2026)
Tangram: Benchmark for Evaluating Geometric Element Recognition in Large Multimodal Models
by: Zhang, Chao, et al.
Published: (2024)
by: Zhang, Chao, et al.
Published: (2024)
XMACNet: An Explainable Lightweight Attention based CNN with Multi Modal Fusion for Chili Disease Classification
by: Ray, Tapon Kumer, et al.
Published: (2026)
by: Ray, Tapon Kumer, et al.
Published: (2026)
RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation
by: Wang, Sheng
Published: (2025)
by: Wang, Sheng
Published: (2025)
QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models
by: Wang, Jiale, et al.
Published: (2026)
by: Wang, Jiale, et al.
Published: (2026)
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
by: Shen, Guanxi
Published: (2025)
by: Shen, Guanxi
Published: (2025)
Similar Items
-
VLM6D: VLM based 6Dof Pose Estimation based on RGB-D Images
by: Sarowar, Md Selim, et al.
Published: (2025) -
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
by: Sarowar, Md Selim, et al.
Published: (2025) -
GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models
by: Sarowar, Md Selim, et al.
Published: (2026) -
Application of Multimodal Fusion Deep Learning Model in Disease Recognition
by: Liu, Xiaoyi, et al.
Published: (2024) -
GateFuseNet: An Adaptive 3D Multimodal Neuroimaging Fusion Network for Parkinson's Disease Diagnosis
by: Jin, Rui, et al.
Published: (2025)