Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Deng, Yifei, Li, Chenglong, Chen, Zhenyu, Xu, Zihen, Tang, Jin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark
by: Deng, Yifei, et al.
Published: (2026)
by: Deng, Yifei, et al.
Published: (2026)
Modality-missing RGBT Tracking: Invertible Prompt Learning and High-quality Benchmarks
by: Lu, Andong, et al.
Published: (2023)
by: Lu, Andong, et al.
Published: (2023)
Dynamic Disentangled Fusion Network for RGBT Tracking
by: Li, Chenglong, et al.
Published: (2024)
by: Li, Chenglong, et al.
Published: (2024)
Graph-based Semantic Calibration Network for Unaligned UAV RGBT Image Semantic Segmentation and A Large-scale Benchmark
by: Fan, Fangqiang, et al.
Published: (2026)
by: Fan, Fangqiang, et al.
Published: (2026)
Alignment-Free RGBT Salient Object Detection: Semantics-guided Asymmetric Correlation Network and A Unified Benchmark
by: Wang, Kunpeng, et al.
Published: (2024)
by: Wang, Kunpeng, et al.
Published: (2024)
AFter: Attention-based Fusion Router for RGBT Tracking
by: Lu, Andong, et al.
Published: (2024)
by: Lu, Andong, et al.
Published: (2024)
Breaking Modality Gap in RGBT Tracking: Coupled Knowledge Distillation
by: Lu, Andong, et al.
Published: (2024)
by: Lu, Andong, et al.
Published: (2024)
Cross-modulated Attention Transformer for RGBT Tracking
by: Xiao, Yun, et al.
Published: (2024)
by: Xiao, Yun, et al.
Published: (2024)
RGBT Tracking via All-layer Multimodal Interactions with Progressive Fusion Mamba
by: Lu, Andong, et al.
Published: (2024)
by: Lu, Andong, et al.
Published: (2024)
Multimodal Spatio-temporal Graph Learning for Alignment-free RGBT Video Object Detection
by: Wang, Qishun, et al.
Published: (2025)
by: Wang, Qishun, et al.
Published: (2025)
Revisiting RGBT Tracking Benchmarks from the Perspective of Modality Validity: A New Benchmark, Problem, and Solution
by: Tang, Zhangyong, et al.
Published: (2024)
by: Tang, Zhangyong, et al.
Published: (2024)
Breaking Shallow Limits: Task-Driven Pixel Fusion for Gap-free RGBT Tracking
by: Lu, Andong, et al.
Published: (2025)
by: Lu, Andong, et al.
Published: (2025)
Transformer RGBT Tracking with Spatio-Temporal Multimodal Tokens
by: Sun, Dengdi, et al.
Published: (2024)
by: Sun, Dengdi, et al.
Published: (2024)
X Modality Assisting RGBT Object Tracking
by: Ding, Zhaisheng, et al.
Published: (2023)
by: Ding, Zhaisheng, et al.
Published: (2023)
Temporal Adaptive RGBT Tracking with Modality Prompt
by: Wang, Hongyu, et al.
Published: (2024)
by: Wang, Hongyu, et al.
Published: (2024)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
by: Huang, Hailang, et al.
Published: (2024)
by: Huang, Hailang, et al.
Published: (2024)
COXNet: Cross-Layer Fusion with Adaptive Alignment and Scale Integration for RGBT Tiny Object Detection
by: Peng, Peiran, et al.
Published: (2025)
by: Peng, Peiran, et al.
Published: (2025)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
by: Wang, Shaokun, et al.
Published: (2026)
by: Wang, Shaokun, et al.
Published: (2026)
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
by: Yin, Hao, et al.
Published: (2025)
by: Yin, Hao, et al.
Published: (2025)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
by: Zhao, Zixu, et al.
Published: (2025)
by: Zhao, Zixu, et al.
Published: (2025)
Mixture of Scale Experts for Alignment-free RGBT Video Object Detection and A Unified Benchmark
by: Wang, Qishun, et al.
Published: (2024)
by: Wang, Qishun, et al.
Published: (2024)
RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
Compositional-Degradation UAV Image Restoration: Conditional Decoupled MoE Network and A Benchmark
by: Yan, Jinquan, et al.
Published: (2026)
by: Yan, Jinquan, et al.
Published: (2026)
CADTrack: Learning Contextual Aggregation with Deformable Alignment for Robust RGBT Tracking
by: Li, Hao, et al.
Published: (2025)
by: Li, Hao, et al.
Published: (2025)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
by: Qian, Chengxuan, et al.
Published: (2025)
by: Qian, Chengxuan, et al.
Published: (2025)
Towards Robust Optical-SAR Object Detection under Missing Modalities: A Dynamic Quality-Aware Fusion Framework
by: Zhao, Zhicheng, et al.
Published: (2025)
by: Zhao, Zhicheng, et al.
Published: (2025)
CPCL: Cross-Modal Prototypical Contrastive Learning for Weakly Supervised Text-based Person Retrieval
by: Zhao, Xinpeng, et al.
Published: (2024)
by: Zhao, Xinpeng, et al.
Published: (2024)
CattleFace-RGBT: RGB-T Cattle Facial Landmark Benchmark
by: Coffman, Ethan, et al.
Published: (2024)
by: Coffman, Ethan, et al.
Published: (2024)
TVPR: Text-to-Video Person Retrieval and a New Benchmark
by: Zhang, Xu, et al.
Published: (2023)
by: Zhang, Xu, et al.
Published: (2023)
MambaPlace:Text-to-Point-Cloud Cross-Modal Place Recognition with Attention Mamba Mechanisms
by: Shang, Tianyi, et al.
Published: (2024)
by: Shang, Tianyi, et al.
Published: (2024)
SpatiaLoc: Leveraging Multi-Level Spatial Enhanced Descriptors for Cross-Modal Localization
by: Shang, Tianyi, et al.
Published: (2026)
by: Shang, Tianyi, et al.
Published: (2026)
Bridging the Gap: Multi-Level Cross-Modality Joint Alignment for Visible-Infrared Person Re-Identification
by: Liang, Tengfei, et al.
Published: (2023)
by: Liang, Tengfei, et al.
Published: (2023)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
by: Shang, Tianyi, et al.
Published: (2025)
by: Shang, Tianyi, et al.
Published: (2025)
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
by: Li, Mingxiao, et al.
Published: (2025)
by: Li, Mingxiao, et al.
Published: (2025)
RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios
by: Zhao, Tianyi, et al.
Published: (2025)
by: Zhao, Tianyi, et al.
Published: (2025)
Nighttime Person Re-Identification via Collaborative Enhancement Network with Multi-domain Learning
by: Lu, Andong, et al.
Published: (2023)
by: Lu, Andong, et al.
Published: (2023)
Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization
by: Zhou, Hefeng, et al.
Published: (2026)
by: Zhou, Hefeng, et al.
Published: (2026)
CKDA: Cross-modality Knowledge Disentanglement and Alignment for Visible-Infrared Lifelong Person Re-identification
by: Cui, Zhenyu, et al.
Published: (2025)
by: Cui, Zhenyu, et al.
Published: (2025)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
by: Ma, Wenxuan, et al.
Published: (2024)
by: Ma, Wenxuan, et al.
Published: (2024)
AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
by: Lin, Yiheng, et al.
Published: (2025)
by: Lin, Yiheng, et al.
Published: (2025)
Similar Items
-
Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark
by: Deng, Yifei, et al.
Published: (2026) -
Modality-missing RGBT Tracking: Invertible Prompt Learning and High-quality Benchmarks
by: Lu, Andong, et al.
Published: (2023) -
Dynamic Disentangled Fusion Network for RGBT Tracking
by: Li, Chenglong, et al.
Published: (2024) -
Graph-based Semantic Calibration Network for Unaligned UAV RGBT Image Semantic Segmentation and A Large-scale Benchmark
by: Fan, Fangqiang, et al.
Published: (2026) -
Alignment-Free RGBT Salient Object Detection: Semantics-guided Asymmetric Correlation Network and A Unified Benchmark
by: Wang, Kunpeng, et al.
Published: (2024)