Dissecting RGB-D Learning for Improved Multi-modal Fusion
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Hao, Zhou, Haoran, Zhang, Yunshu, Lin, Zheng, Deng, Yongjian |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion
by: Tang, Linfeng, et al.
Published: (2025)
by: Tang, Linfeng, et al.
Published: (2025)
Self-supervised 3D Patient Modeling with Multi-modal Attentive Fusion
by: Zheng, Meng, et al.
Published: (2024)
by: Zheng, Meng, et al.
Published: (2024)
Visual Object Tracking on Multi-modal RGB-D Videos: A Review
by: Zhu, Xue-Feng, et al.
Published: (2022)
by: Zhu, Xue-Feng, et al.
Published: (2022)
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
by: Zhang, Zhihao, et al.
Published: (2023)
by: Zhang, Zhihao, et al.
Published: (2023)
TUNI: Real-time RGB-T Semantic Segmentation with Unified Multi-Modal Feature Extraction and Cross-Modal Feature Fusion
by: Guo, Xiaodong, et al.
Published: (2025)
by: Guo, Xiaodong, et al.
Published: (2025)
MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
by: Wang, Hanshi, et al.
Published: (2025)
by: Wang, Hanshi, et al.
Published: (2025)
Deep Unfolding Multi-modal Image Fusion Network via Attribution Analysis
by: Bai, Haowen, et al.
Published: (2025)
by: Bai, Haowen, et al.
Published: (2025)
Learning Adaptive Fusion Bank for Multi-modal Salient Object Detection
by: Wang, Kunpeng, et al.
Published: (2024)
by: Wang, Kunpeng, et al.
Published: (2024)
RGB-T Object Detection via Group Shuffled Multi-receptive Attention and Multi-modal Supervision
by: Wang, Jinzhong, et al.
Published: (2024)
by: Wang, Jinzhong, et al.
Published: (2024)
CalibNet: Dual-branch Cross-modal Calibration for RGB-D Salient Instance Segmentation
by: Pei, Jialun, et al.
Published: (2023)
by: Pei, Jialun, et al.
Published: (2023)
Spatially-guided Temporal Aggregation for Robust Event-RGB Optical Flow Estimation
by: Zhou, Qianang, et al.
Published: (2025)
by: Zhou, Qianang, et al.
Published: (2025)
Cross-modal State Space Modeling for Real-time RGB-thermal Wild Scene Semantic Segmentation
by: Guo, Xiaodong, et al.
Published: (2025)
by: Guo, Xiaodong, et al.
Published: (2025)
MSCoTDet: Language-driven Multi-modal Fusion for Improved Multispectral Pedestrian Detection
by: Kim, Taeheon, et al.
Published: (2024)
by: Kim, Taeheon, et al.
Published: (2024)
Supervise-assisted Multi-modality Fusion Diffusion Model for PET Restoration
by: Zhang, Yingkai, et al.
Published: (2026)
by: Zhang, Yingkai, et al.
Published: (2026)
GaitMA: Pose-guided Multi-modal Feature Fusion for Gait Recognition
by: Min, Fanxu, et al.
Published: (2024)
by: Min, Fanxu, et al.
Published: (2024)
TemCoCo: Temporally Consistent Multi-modal Video Fusion with Visual-Semantic Collaboration
by: Gong, Meiqi, et al.
Published: (2025)
by: Gong, Meiqi, et al.
Published: (2025)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
by: Ma, Zehong, et al.
Published: (2025)
by: Ma, Zehong, et al.
Published: (2025)
CoCoNet: Coupled Contrastive Learning Network with Multi-level Feature Ensemble for Multi-modality Image Fusion
by: Liu, Jinyuan, et al.
Published: (2022)
by: Liu, Jinyuan, et al.
Published: (2022)
Multi-modal and Multi-view Fundus Image Fusion for Retinopathy Diagnosis via Multi-scale Cross-attention and Shifted Window Self-attention
by: Huang, Yonghao, et al.
Published: (2025)
by: Huang, Yonghao, et al.
Published: (2025)
Middle Fusion and Multi-Stage, Multi-Form Prompts for Robust RGB-T Tracking
by: Wang, Qiming, et al.
Published: (2024)
by: Wang, Qiming, et al.
Published: (2024)
Dual Mutual Learning Network with Global-local Awareness for RGB-D Salient Object Detection
by: Yi, Kang, et al.
Published: (2025)
by: Yi, Kang, et al.
Published: (2025)
Glass Surface Segmentation with an RGB-D Camera via Weighted Feature Fusion for Service Robots
by: Lin, Henghong, et al.
Published: (2025)
by: Lin, Henghong, et al.
Published: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
by: Zhang, Bob, et al.
Published: (2025)
by: Zhang, Bob, et al.
Published: (2025)
Multi-modal Document Presentation Attack Detection With Forensics Trace Disentanglement
by: Chen, Changsheng, et al.
Published: (2024)
by: Chen, Changsheng, et al.
Published: (2024)
MapFusion: A Novel BEV Feature Fusion Network for Multi-modal Map Construction
by: Hao, Xiaoshuai, et al.
Published: (2025)
by: Hao, Xiaoshuai, et al.
Published: (2025)
DepthGait: Multi-Scale Cross-Level Feature Fusion of RGB-Derived Depth and Silhouette Sequences for Robust Gait Recognition
by: Li, Xinzhu, et al.
Published: (2025)
by: Li, Xinzhu, et al.
Published: (2025)
Multi-modal Fusion based Q-distribution Prediction for Controlled Nuclear Fusion
by: Wang, Shiao, et al.
Published: (2024)
by: Wang, Shiao, et al.
Published: (2024)
Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition
by: He, Wen-Jue, et al.
Published: (2025)
by: He, Wen-Jue, et al.
Published: (2025)
TFDet: Target-Aware Fusion for RGB-T Pedestrian Detection
by: Zhang, Xue, et al.
Published: (2023)
by: Zhang, Xue, et al.
Published: (2023)
CardiacMamba: A Multimodal RGB-RF Fusion Framework with State Space Models for Remote Physiological Measurement
by: Wu, Zheng, et al.
Published: (2025)
by: Wu, Zheng, et al.
Published: (2025)
Bridging the Gap between Multi-focus and Multi-modal: A Focused Integration Framework for Multi-modal Image Fusion
by: Li, Xilai, et al.
Published: (2023)
by: Li, Xilai, et al.
Published: (2023)
Rethinking RGB-D Salient Object Detection: Models, Data Sets, and Large-Scale Benchmarks
by: Fan, Deng-Ping, et al.
Published: (2019)
by: Fan, Deng-Ping, et al.
Published: (2019)
Prune and Repaint: Content-Aware Image Retargeting for any Ratio
by: Shen, Feihong, et al.
Published: (2024)
by: Shen, Feihong, et al.
Published: (2024)
Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation
by: Zhang, Hao, et al.
Published: (2025)
by: Zhang, Hao, et al.
Published: (2025)
UniPose: Unified Cross-modality Pose Prior Propagation towards RGB-D data for Weakly Supervised 3D Human Pose Estimation
by: Zheng, Jinghong, et al.
Published: (2025)
by: Zheng, Jinghong, et al.
Published: (2025)
Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
by: Zhao, Zhen, et al.
Published: (2023)
by: Zhao, Zhen, et al.
Published: (2023)
MM-Gaussian: 3D Gaussian-based Multi-modal Fusion for Localization and Reconstruction in Unbounded Scenes
by: Wu, Chenyang, et al.
Published: (2024)
by: Wu, Chenyang, et al.
Published: (2024)
GauS-SLAM: Dense RGB-D SLAM with Gaussian Surfels
by: Su, Yongxin, et al.
Published: (2025)
by: Su, Yongxin, et al.
Published: (2025)
Progressive Multi-modal Conditional Prompt Tuning
by: Qiu, Xiaoyu, et al.
Published: (2024)
by: Qiu, Xiaoyu, et al.
Published: (2024)
Towards RGB-NIR Cross-modality Image Registration and Beyond
by: Li, Huadong, et al.
Published: (2024)
by: Li, Huadong, et al.
Published: (2024)
Similar Items
-
VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion
by: Tang, Linfeng, et al.
Published: (2025) -
Self-supervised 3D Patient Modeling with Multi-modal Attentive Fusion
by: Zheng, Meng, et al.
Published: (2024) -
Visual Object Tracking on Multi-modal RGB-D Videos: A Review
by: Zhu, Xue-Feng, et al.
Published: (2022) -
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
by: Zhang, Zhihao, et al.
Published: (2023) -
TUNI: Real-time RGB-T Semantic Segmentation with Unified Multi-Modal Feature Extraction and Cross-Modal Feature Fusion
by: Guo, Xiaodong, et al.
Published: (2025)