Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Deng, Yifei, Li, Chenglong, Zhang, Yuyang, Hu, Guyue, Tang, Jin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark
by: Deng, Yifei, et al.
Published: (2025)
by: Deng, Yifei, et al.
Published: (2025)
RefAerial: A Benchmark and Approach for Referring Detection in Aerial Images
by: Hu, Guyue, et al.
Published: (2026)
by: Hu, Guyue, et al.
Published: (2026)
Mix-modal Federated Learning for MRI Image Segmentation
by: Hu, Guyue, et al.
Published: (2025)
by: Hu, Guyue, et al.
Published: (2025)
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
by: Yin, Hao, et al.
Published: (2025)
by: Yin, Hao, et al.
Published: (2025)
DeTrack: A Benchmark and Altitude-Aware Dual World Model for Drone-embodied Tracking
by: Hu, Guyue, et al.
Published: (2026)
by: Hu, Guyue, et al.
Published: (2026)
Graph-based Semantic Calibration Network for Unaligned UAV RGBT Image Semantic Segmentation and A Large-scale Benchmark
by: Fan, Fangqiang, et al.
Published: (2026)
by: Fan, Fangqiang, et al.
Published: (2026)
Structure and Progress Aware Diffusion for Medical Image Segmentation
by: Song, Siyuan, et al.
Published: (2026)
by: Song, Siyuan, et al.
Published: (2026)
Text-based Aerial-Ground Person Retrieval
by: Zhou, Xinyu, et al.
Published: (2025)
by: Zhou, Xinyu, et al.
Published: (2025)
GSAlign: Geometric and Semantic Alignment Network for Aerial-Ground Person Re-Identification
by: Li, Qiao, et al.
Published: (2025)
by: Li, Qiao, et al.
Published: (2025)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
by: Yu, Hang, et al.
Published: (2025)
by: Yu, Hang, et al.
Published: (2025)
Federated Client-tailored Adapter for Medical Image Segmentation
by: Hu, Guyue, et al.
Published: (2025)
by: Hu, Guyue, et al.
Published: (2025)
Alignment-Free RGB-T Salient Object Detection: A Large-scale Dataset and Progressive Correlation Network
by: Wang, Kunpeng, et al.
Published: (2024)
by: Wang, Kunpeng, et al.
Published: (2024)
IRGPT: Understanding Real-world Infrared Image with Bi-cross-modal Curriculum on Large-scale Benchmark
by: Cao, Zhe, et al.
Published: (2025)
by: Cao, Zhe, et al.
Published: (2025)
SCMM: Calibrating Cross-modal Representations for Text-Based Person Search
by: Liu, Jing, et al.
Published: (2023)
by: Liu, Jing, et al.
Published: (2023)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
by: Zhu, Mengdan, et al.
Published: (2025)
by: Zhu, Mengdan, et al.
Published: (2025)
Visible-Thermal Multiple Object Tracking: Large-scale Video Dataset and Progressive Fusion Approach
by: Zhu, Yabin, et al.
Published: (2024)
by: Zhu, Yabin, et al.
Published: (2024)
TVPR: Text-to-Video Person Retrieval and a New Benchmark
by: Zhang, Xu, et al.
Published: (2023)
by: Zhang, Xu, et al.
Published: (2023)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
by: Wang, Shaokun, et al.
Published: (2026)
by: Wang, Shaokun, et al.
Published: (2026)
Text-Guided Coarse-to-Fine Fusion Network for Robust Remote Sensing Visual Question Answering
by: Zhao, Zhicheng, et al.
Published: (2024)
by: Zhao, Zhicheng, et al.
Published: (2024)
LATex: Leveraging Attribute-based Text Knowledge for Aerial-Ground Person Re-Identification
by: Zhang, Pingping, et al.
Published: (2025)
by: Zhang, Pingping, et al.
Published: (2025)
AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment
by: Li, Yan, et al.
Published: (2024)
by: Li, Yan, et al.
Published: (2024)
GEA: Generation-Enhanced Alignment for Text-to-Image Person Retrieval
by: Zou, Hao, et al.
Published: (2025)
by: Zou, Hao, et al.
Published: (2025)
Nighttime Person Re-Identification via Collaborative Enhancement Network with Multi-domain Learning
by: Lu, Andong, et al.
Published: (2023)
by: Lu, Andong, et al.
Published: (2023)
MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval
by: Tang, Haoran, et al.
Published: (2024)
by: Tang, Haoran, et al.
Published: (2024)
View-Aware Semantic Alignment for Aerial-Ground Person Re-Identification
by: Zhang, Quan, et al.
Published: (2026)
by: Zhang, Quan, et al.
Published: (2026)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
by: Wang, Yabing, et al.
Published: (2024)
by: Wang, Yabing, et al.
Published: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
by: Zhang, Kaichen, et al.
Published: (2024)
by: Zhang, Kaichen, et al.
Published: (2024)
CKDA: Cross-modality Knowledge Disentanglement and Alignment for Visible-Infrared Lifelong Person Re-identification
by: Cui, Zhenyu, et al.
Published: (2025)
by: Cui, Zhenyu, et al.
Published: (2025)
Alignment-Free RGBT Salient Object Detection: Semantics-guided Asymmetric Correlation Network and A Unified Benchmark
by: Wang, Kunpeng, et al.
Published: (2024)
by: Wang, Kunpeng, et al.
Published: (2024)
UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark
by: Zhang, Yu, et al.
Published: (2026)
by: Zhang, Yu, et al.
Published: (2026)
Physics-Constrained Cross-Resolution Enhancement Network for Optics-Guided Thermal UAV Image Super-Resolution
by: Zhao, Zhicheng, et al.
Published: (2026)
by: Zhao, Zhicheng, et al.
Published: (2026)
Hyperbolic Hierarchical Alignment Reasoning Network for Text-3D Retrieval
by: Li, Wenrui, et al.
Published: (2025)
by: Li, Wenrui, et al.
Published: (2025)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
by: Zhao, Zixu, et al.
Published: (2025)
by: Zhao, Zixu, et al.
Published: (2025)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
by: Ma, Yiwei, et al.
Published: (2024)
by: Ma, Yiwei, et al.
Published: (2024)
DCG ReID: Disentangling Collaboration and Guidance Fusion Representations for Multi-modal Vehicle Re-Identification
by: Zheng, Aihua, et al.
Published: (2026)
by: Zheng, Aihua, et al.
Published: (2026)
Data Augmentation for Text-based Person Retrieval Using Large Language Models
by: Li, Zheng, et al.
Published: (2024)
by: Li, Zheng, et al.
Published: (2024)
Modality-missing RGBT Tracking: Invertible Prompt Learning and High-quality Benchmarks
by: Lu, Andong, et al.
Published: (2023)
by: Lu, Andong, et al.
Published: (2023)
Reliable Cross-modal Alignment via Prototype Iterative Construction
by: Ma, Xiang, et al.
Published: (2025)
by: Ma, Xiang, et al.
Published: (2025)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
by: Zhang, Ming, et al.
Published: (2024)
by: Zhang, Ming, et al.
Published: (2024)
Multi-modal Multi-platform Person Re-Identification: Benchmark and Method
by: Ha, Ruiyang, et al.
Published: (2025)
by: Ha, Ruiyang, et al.
Published: (2025)
Similar Items
-
Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark
by: Deng, Yifei, et al.
Published: (2025) -
RefAerial: A Benchmark and Approach for Referring Detection in Aerial Images
by: Hu, Guyue, et al.
Published: (2026) -
Mix-modal Federated Learning for MRI Image Segmentation
by: Hu, Guyue, et al.
Published: (2025) -
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
by: Yin, Hao, et al.
Published: (2025) -
DeTrack: A Benchmark and Altitude-Aware Dual World Model for Drone-embodied Tracking
by: Hu, Guyue, et al.
Published: (2026)