RGB-T Object Detection via Group Shuffled Multi-receptive Attention and Multi-modal Supervision
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Jinzhong, Tian, Xuetao, Dai, Shun, Zhuo, Tao, Zeng, Haorui, Liu, Hongjuan, Liu, Jiaqi, Zhang, Xiuwei, Zhang, Yanning |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FreDFT: Frequency Domain Fusion Transformer for Visible-Infrared Object Detection
by: Wu, Wencong, et al.
Published: (2025)
by: Wu, Wencong, et al.
Published: (2025)
AdaSemiCD: An Adaptive Semi-Supervised Change Detection Method Based on Pseudo-Label Evaluation
by: Lingyan, Ran, et al.
Published: (2024)
by: Lingyan, Ran, et al.
Published: (2024)
SOMA: Feature Gradient Enhanced Affine-Flow Matching for SAR-Optical Registration
by: Wang, Haodong, et al.
Published: (2025)
by: Wang, Haodong, et al.
Published: (2025)
Cross-modal Offset-guided Dynamic Alignment and Fusion for Weakly Aligned UAV Object Detection
by: Zongzhen, Liu, et al.
Published: (2025)
by: Zongzhen, Liu, et al.
Published: (2025)
Open-World Human-Object Interaction Detection via Multi-modal Prompts
by: Yang, Jie, et al.
Published: (2024)
by: Yang, Jie, et al.
Published: (2024)
Awesome Multi-modal Object Tracking
by: Zhang, Chunhui, et al.
Published: (2024)
by: Zhang, Chunhui, et al.
Published: (2024)
SimDistill: Simulated Multi-modal Distillation for BEV 3D Object Detection
by: Zhao, Haimei, et al.
Published: (2023)
by: Zhao, Haimei, et al.
Published: (2023)
Shuffle Mamba: State Space Models with Random Shuffle for Multi-Modal Image Fusion
by: Cao, Ke, et al.
Published: (2024)
by: Cao, Ke, et al.
Published: (2024)
M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention
by: Yang, Xiaofan, et al.
Published: (2026)
by: Yang, Xiaofan, et al.
Published: (2026)
Visual Object Tracking on Multi-modal RGB-D Videos: A Review
by: Zhu, Xue-Feng, et al.
Published: (2022)
by: Zhu, Xue-Feng, et al.
Published: (2022)
Dissecting RGB-D Learning for Improved Multi-modal Fusion
by: Chen, Hao, et al.
Published: (2023)
by: Chen, Hao, et al.
Published: (2023)
Evolving from Single-modal to Multi-modal Facial Deepfake Detection: Progress and Challenges
by: Liu, Ping, et al.
Published: (2024)
by: Liu, Ping, et al.
Published: (2024)
Small Object Detection in Complex Backgrounds with Multi-Scale Attention and Global Relation Modeling
by: Tao, Wenguang, et al.
Published: (2026)
by: Tao, Wenguang, et al.
Published: (2026)
MS-DETR: Multispectral Pedestrian Detection Transformer with Loosely Coupled Fusion and Modality-Balanced Optimization
by: Xing, Yinghui, et al.
Published: (2023)
by: Xing, Yinghui, et al.
Published: (2023)
Learning Adaptive Fusion Bank for Multi-modal Salient Object Detection
by: Wang, Kunpeng, et al.
Published: (2024)
by: Wang, Kunpeng, et al.
Published: (2024)
Supervise-assisted Multi-modality Fusion Diffusion Model for PET Restoration
by: Zhang, Yingkai, et al.
Published: (2026)
by: Zhang, Yingkai, et al.
Published: (2026)
Referring Camouflaged Object Detection With Multi-Context Overlapped Windows Cross-Attention
by: Wen, Yu, et al.
Published: (2025)
by: Wen, Yu, et al.
Published: (2025)
Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP
by: Yu, Yating, et al.
Published: (2024)
by: Yu, Yating, et al.
Published: (2024)
Flexible Circular Antenna Sensor With Multi Loops for Plantar Pressure Detection
by: Chunyu Ao, et al.
Published: (2026)
by: Chunyu Ao, et al.
Published: (2026)
MambaSOD: Dual Mamba-Driven Cross-Modal Fusion Network for RGB-D Salient Object Detection
by: Zhan, Yue, et al.
Published: (2024)
by: Zhan, Yue, et al.
Published: (2024)
JanusNet: Hierarchical Slice-Block Shuffle and Displacement for Semi-Supervised 3D Multi-Organ Segmentation
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking
by: Yu, Yanqiu, et al.
Published: (2026)
by: Yu, Yanqiu, et al.
Published: (2026)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
by: Li, Yuhao, et al.
Published: (2024)
by: Li, Yuhao, et al.
Published: (2024)
ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking
by: Ge, Jiawei, et al.
Published: (2026)
by: Ge, Jiawei, et al.
Published: (2026)
NativE: Multi-modal Knowledge Graph Completion in the Wild
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
by: Zhang, Pingping, et al.
Published: (2024)
by: Zhang, Pingping, et al.
Published: (2024)
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
by: Liang, Yujia, et al.
Published: (2025)
by: Liang, Yujia, et al.
Published: (2025)
Weakly Supervised 3D Object Detection with Multi-Stage Generalization
by: He, Jiawei, et al.
Published: (2023)
by: He, Jiawei, et al.
Published: (2023)
Focus Through Motion: RGB-Event Collaborative Token Sparsification for Efficient Object Detection
by: Yang, Nan, et al.
Published: (2025)
by: Yang, Nan, et al.
Published: (2025)
MCAD: Multi-modal Conditioned Adversarial Diffusion Model for High-Quality PET Image Reconstruction
by: Cui, Jiaqi, et al.
Published: (2024)
by: Cui, Jiaqi, et al.
Published: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
by: Zhang, Kaichen, et al.
Published: (2024)
by: Zhang, Kaichen, et al.
Published: (2024)
M$^4$-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection
by: Liu, Jiyuan, et al.
Published: (2026)
by: Liu, Jiyuan, et al.
Published: (2026)
Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Instance by Instance: An Iterative Framework for Multi-instance 3D Registration
by: Cao, Xinyue, et al.
Published: (2024)
by: Cao, Xinyue, et al.
Published: (2024)
Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink
by: Wang, Yining, et al.
Published: (2025)
by: Wang, Yining, et al.
Published: (2025)
Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs
by: Cai, Zhaolin, et al.
Published: (2025)
by: Cai, Zhaolin, et al.
Published: (2025)
Fusion-Mamba for Cross-modality Object Detection
by: Dong, Wenhao, et al.
Published: (2024)
by: Dong, Wenhao, et al.
Published: (2024)
STENet: Superpixel Token Enhancing Network for RGB-D Salient Object Detection
by: Chen, Jianlin, et al.
Published: (2026)
by: Chen, Jianlin, et al.
Published: (2026)
Multi-modal Data based Semi-Supervised Learning for Vehicle Positioning
by: Huan, Ouwen, et al.
Published: (2024)
by: Huan, Ouwen, et al.
Published: (2024)
Real-time Multi-modal Object Detection and Tracking on Edge for Regulatory Compliance Monitoring
by: Lim, Jia Syuen, et al.
Published: (2023)
by: Lim, Jia Syuen, et al.
Published: (2023)
Similar Items
-
FreDFT: Frequency Domain Fusion Transformer for Visible-Infrared Object Detection
by: Wu, Wencong, et al.
Published: (2025) -
AdaSemiCD: An Adaptive Semi-Supervised Change Detection Method Based on Pseudo-Label Evaluation
by: Lingyan, Ran, et al.
Published: (2024) -
SOMA: Feature Gradient Enhanced Affine-Flow Matching for SAR-Optical Registration
by: Wang, Haodong, et al.
Published: (2025) -
Cross-modal Offset-guided Dynamic Alignment and Fusion for Weakly Aligned UAV Object Detection
by: Zongzhen, Liu, et al.
Published: (2025) -
Open-World Human-Object Interaction Detection via Multi-modal Prompts
by: Yang, Jie, et al.
Published: (2024)