Saved in:
| Main Authors: | Wang, Mengzhao, Li, Huafeng, Zhang, Yafei, Li, Jinxing, Xie, Minghong, Tao, Dapeng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2411.17481 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding
by: Xie, Minghong, et al.
Published: (2024)
by: Xie, Minghong, et al.
Published: (2024)
Depth Information Assisted Collaborative Mutual Promotion Network for Single Image Dehazing
by: Zhang, Yafei, et al.
Published: (2024)
by: Zhang, Yafei, et al.
Published: (2024)
UniFuse: A Unified All-in-One Framework for Multi-Modal Medical Image Fusion Under Diverse Degradations and Misalignments
by: Su, Dayong, et al.
Published: (2025)
by: Su, Dayong, et al.
Published: (2025)
Single-Image HDR Reconstruction Assisted Ghost Suppression and Detail Preservation Network for Multi-Exposure HDR Imaging
by: Li, Huafeng, et al.
Published: (2024)
by: Li, Huafeng, et al.
Published: (2024)
Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding
by: Tan, Chaolei, et al.
Published: (2024)
by: Tan, Chaolei, et al.
Published: (2024)
Infrared-Assisted Single-Stage Framework for Joint Restoration and Fusion of Visible and Infrared Images under Hazy Conditions
by: Li, Huafeng, et al.
Published: (2024)
by: Li, Huafeng, et al.
Published: (2024)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
by: Zhang, Yafei, et al.
Published: (2025)
by: Zhang, Yafei, et al.
Published: (2025)
Weakly Supervised Visible-Infrared Person Re-Identification via Heterogeneous Expert Collaborative Consistency Learning
by: Zhang, Yafei, et al.
Published: (2025)
by: Zhang, Yafei, et al.
Published: (2025)
CHITNet: A Complementary to Harmonious Information Transfer Network for Infrared and Visible Image Fusion
by: Du, Keying, et al.
Published: (2023)
by: Du, Keying, et al.
Published: (2023)
Instruction-Driven Fusion of Infrared-Visible Images: Tailoring for Diverse Downstream Tasks
by: Yang, Zengyi, et al.
Published: (2024)
by: Yang, Zengyi, et al.
Published: (2024)
Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared
by: Zhang, Yafei, et al.
Published: (2026)
by: Zhang, Yafei, et al.
Published: (2026)
Breaking Degradation Coupling: A Structural Entropy Guided Decoupled Framework and Benchmark for Infrared Enhancement
by: Li, Pu, et al.
Published: (2026)
by: Li, Pu, et al.
Published: (2026)
Context Consistency Learning via Sentence Removal for Semi-Supervised Video Paragraph Grounding
by: Zhong, Yaokun, et al.
Published: (2025)
by: Zhong, Yaokun, et al.
Published: (2025)
Adaptive Dynamic Dehazing via Instruction-Driven and Task-Feedback Closed-Loop Optimization for Diverse Downstream Task Adaptation
by: Zhang, Yafei, et al.
Published: (2026)
by: Zhang, Yafei, et al.
Published: (2026)
SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
by: Tan, Chaolei, et al.
Published: (2024)
by: Tan, Chaolei, et al.
Published: (2024)
Expandable, Compressible, Mineable: Open-World Thermal Image Restoration
by: Li, Pu, et al.
Published: (2026)
by: Li, Pu, et al.
Published: (2026)
Paragraph-to-Image Generation with Information-Enriched Diffusion Model
by: Wu, Weijia, et al.
Published: (2023)
by: Wu, Weijia, et al.
Published: (2023)
Co-speech Gesture Video Generation via Motion-Based Graph Retrieval
by: Song, Yafei, et al.
Published: (2025)
by: Song, Yafei, et al.
Published: (2025)
Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion
by: Yang, Zengyi, et al.
Published: (2026)
by: Yang, Zengyi, et al.
Published: (2026)
BSAFusion: A Bidirectional Stepwise Feature Alignment Network for Unaligned Medical Image Fusion
by: Li, Huafeng, et al.
Published: (2024)
by: Li, Huafeng, et al.
Published: (2024)
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
by: Chen, Sishuo, et al.
Published: (2024)
by: Chen, Sishuo, et al.
Published: (2024)
GEM-VPC: A dual Graph-Enhanced Multimodal integration for Video Paragraph Captioning
by: Wang, Eileen, et al.
Published: (2024)
by: Wang, Eileen, et al.
Published: (2024)
Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification
by: Zhou, Linhan, et al.
Published: (2025)
by: Zhou, Linhan, et al.
Published: (2025)
Joint-Motion Mutual Learning for Pose Estimation in Videos
by: Wu, Sifan, et al.
Published: (2024)
by: Wu, Sifan, et al.
Published: (2024)
TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding
by: Li, Jinxuan, et al.
Published: (2025)
by: Li, Jinxuan, et al.
Published: (2025)
Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval
by: Wang, Jiamian, et al.
Published: (2024)
by: Wang, Jiamian, et al.
Published: (2024)
MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction
by: Li, Xilai, et al.
Published: (2026)
by: Li, Xilai, et al.
Published: (2026)
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding
by: Li, Kangcong, et al.
Published: (2026)
by: Li, Kangcong, et al.
Published: (2026)
OccScene: Semantic Occupancy-based Cross-task Mutual Learning for 3D Scene Generation
by: Li, Bohan, et al.
Published: (2024)
by: Li, Bohan, et al.
Published: (2024)
VideoMAC: Video Masked Autoencoders Meet ConvNets
by: Pei, Gensheng, et al.
Published: (2024)
by: Pei, Gensheng, et al.
Published: (2024)
AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
by: Xue, Zhucun, et al.
Published: (2025)
by: Xue, Zhucun, et al.
Published: (2025)
TSJNet: A Multi-modality Target and Semantic Awareness Joint-driven Image Fusion Network
by: Jie, Yuchan, et al.
Published: (2024)
by: Jie, Yuchan, et al.
Published: (2024)
Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers
by: Kosmydel, Jakub, et al.
Published: (2026)
by: Kosmydel, Jakub, et al.
Published: (2026)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
by: Chen, Houlun, et al.
Published: (2026)
by: Chen, Houlun, et al.
Published: (2026)
Multi-Sentence Grounding for Long-term Instructional Video
by: Li, Zeqian, et al.
Published: (2023)
by: Li, Zeqian, et al.
Published: (2023)
UMCFuse: A Unified Multiple Complex Scenes Infrared and Visible Image Fusion Framework
by: Li, Xilai, et al.
Published: (2024)
by: Li, Xilai, et al.
Published: (2024)
Enhance-A-Video: Better Generated Video for Free
by: Luo, Yang, et al.
Published: (2025)
by: Luo, Yang, et al.
Published: (2025)
Personalizing Retrieval using Joint Embeddings or "the Return of Fluffy"
by: Korbar, Bruno, et al.
Published: (2025)
by: Korbar, Bruno, et al.
Published: (2025)
Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools
by: Yuan, Zhenlong, et al.
Published: (2025)
by: Yuan, Zhenlong, et al.
Published: (2025)
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
by: Han, Tingting, et al.
Published: (2026)
by: Han, Tingting, et al.
Published: (2026)
Similar Items
-
Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding
by: Xie, Minghong, et al.
Published: (2024) -
Depth Information Assisted Collaborative Mutual Promotion Network for Single Image Dehazing
by: Zhang, Yafei, et al.
Published: (2024) -
UniFuse: A Unified All-in-One Framework for Multi-Modal Medical Image Fusion Under Diverse Degradations and Misalignments
by: Su, Dayong, et al.
Published: (2025) -
Single-Image HDR Reconstruction Assisted Ghost Suppression and Detail Preservation Network for Multi-Exposure HDR Imaging
by: Li, Huafeng, et al.
Published: (2024) -
Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding
by: Tan, Chaolei, et al.
Published: (2024)