Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Minghong, Wang, Mengzhao, Li, Huafeng, Zhang, Yafei, Tao, Dapeng, Yu, Zhengtao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding
por: Wang, Mengzhao, et al.
Publicado: (2024)
por: Wang, Mengzhao, et al.
Publicado: (2024)
Single-Image HDR Reconstruction Assisted Ghost Suppression and Detail Preservation Network for Multi-Exposure HDR Imaging
por: Li, Huafeng, et al.
Publicado: (2024)
por: Li, Huafeng, et al.
Publicado: (2024)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
por: Zhang, Yafei, et al.
Publicado: (2025)
por: Zhang, Yafei, et al.
Publicado: (2025)
CHITNet: A Complementary to Harmonious Information Transfer Network for Infrared and Visible Image Fusion
por: Du, Keying, et al.
Publicado: (2023)
por: Du, Keying, et al.
Publicado: (2023)
Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared
por: Zhang, Yafei, et al.
Publicado: (2026)
por: Zhang, Yafei, et al.
Publicado: (2026)
Breaking Degradation Coupling: A Structural Entropy Guided Decoupled Framework and Benchmark for Infrared Enhancement
por: Li, Pu, et al.
Publicado: (2026)
por: Li, Pu, et al.
Publicado: (2026)
UniFuse: A Unified All-in-One Framework for Multi-Modal Medical Image Fusion Under Diverse Degradations and Misalignments
por: Su, Dayong, et al.
Publicado: (2025)
por: Su, Dayong, et al.
Publicado: (2025)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
por: Li, Ke, et al.
Publicado: (2026)
por: Li, Ke, et al.
Publicado: (2026)
Depth Information Assisted Collaborative Mutual Promotion Network for Single Image Dehazing
por: Zhang, Yafei, et al.
Publicado: (2024)
por: Zhang, Yafei, et al.
Publicado: (2024)
Instruction-Driven Fusion of Infrared-Visible Images: Tailoring for Diverse Downstream Tasks
por: Yang, Zengyi, et al.
Publicado: (2024)
por: Yang, Zengyi, et al.
Publicado: (2024)
Infrared-Assisted Single-Stage Framework for Joint Restoration and Fusion of Visible and Infrared Images under Hazy Conditions
por: Li, Huafeng, et al.
Publicado: (2024)
por: Li, Huafeng, et al.
Publicado: (2024)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
por: Qian, Chengxuan, et al.
Publicado: (2025)
por: Qian, Chengxuan, et al.
Publicado: (2025)
Generalised Medical Phrase Grounding
por: Zhang, Wenjun, et al.
Publicado: (2025)
por: Zhang, Wenjun, et al.
Publicado: (2025)
Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification
por: Zhou, Linhan, et al.
Publicado: (2025)
por: Zhou, Linhan, et al.
Publicado: (2025)
Weakly Supervised Visible-Infrared Person Re-Identification via Heterogeneous Expert Collaborative Consistency Learning
por: Zhang, Yafei, et al.
Publicado: (2025)
por: Zhang, Yafei, et al.
Publicado: (2025)
Adaptive Dynamic Dehazing via Instruction-Driven and Task-Feedback Closed-Loop Optimization for Diverse Downstream Task Adaptation
por: Zhang, Yafei, et al.
Publicado: (2026)
por: Zhang, Yafei, et al.
Publicado: (2026)
MatchAttention: Matching the Relative Positions for High-Resolution Cross-View Matching
por: Yan, Tingman, et al.
Publicado: (2025)
por: Yan, Tingman, et al.
Publicado: (2025)
Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding
por: Zou, Ke, et al.
Publicado: (2024)
por: Zou, Ke, et al.
Publicado: (2024)
Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion
por: Yang, Zengyi, et al.
Publicado: (2026)
por: Yang, Zengyi, et al.
Publicado: (2026)
Phrase Grounding-based Style Transfer for Single-Domain Generalized Object Detection
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation
por: Li, Jiachen, et al.
Publicado: (2026)
por: Li, Jiachen, et al.
Publicado: (2026)
Expandable, Compressible, Mineable: Open-World Thermal Image Restoration
por: Li, Pu, et al.
Publicado: (2026)
por: Li, Pu, et al.
Publicado: (2026)
AWM-Fuse: Multi-Modality Image Fusion for Adverse Weather via Global and Local Text Perception
por: Li, Xilai, et al.
Publicado: (2025)
por: Li, Xilai, et al.
Publicado: (2025)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
por: Nützel, Felix, et al.
Publicado: (2025)
por: Nützel, Felix, et al.
Publicado: (2025)
Enriching Phrases with Coupled Pixel and Object Contexts for Panoptic Narrative Grounding
por: Hui, Tianrui, et al.
Publicado: (2023)
por: Hui, Tianrui, et al.
Publicado: (2023)
MatchAnything: Universal Cross-Modality Image Matching with Large-Scale Pre-Training
por: He, Xingyi, et al.
Publicado: (2025)
por: He, Xingyi, et al.
Publicado: (2025)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
por: Yang, Danni, et al.
Publicado: (2024)
por: Yang, Danni, et al.
Publicado: (2024)
GTransPDM: A Graph-embedded Transformer with Positional Decoupling for Pedestrian Crossing Intention Prediction
por: Xie, Chen, et al.
Publicado: (2024)
por: Xie, Chen, et al.
Publicado: (2024)
Monocular Visual Place Recognition in LiDAR Maps via Cross-Modal State Space Model and Multi-View Matching
por: Yao, Gongxin, et al.
Publicado: (2024)
por: Yao, Gongxin, et al.
Publicado: (2024)
Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation
por: Wang, Jiaxi, et al.
Publicado: (2023)
por: Wang, Jiaxi, et al.
Publicado: (2023)
TPCap: Unlocking Zero-Shot Image Captioning with Trigger-Augmented and Multi-Modal Purification Modules
por: Zhang, Ruoyu, et al.
Publicado: (2025)
por: Zhang, Ruoyu, et al.
Publicado: (2025)
Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding
por: Kang, Minseok, et al.
Publicado: (2025)
por: Kang, Minseok, et al.
Publicado: (2025)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
por: Peng, Haosong, et al.
Publicado: (2025)
por: Peng, Haosong, et al.
Publicado: (2025)
BSAFusion: A Bidirectional Stepwise Feature Alignment Network for Unaligned Medical Image Fusion
por: Li, Huafeng, et al.
Publicado: (2024)
por: Li, Huafeng, et al.
Publicado: (2024)
CrossWeaver: Cross-modal Weaving for Arbitrary-Modality Semantic Segmentation
por: Zhang, Zelin, et al.
Publicado: (2026)
por: Zhang, Zelin, et al.
Publicado: (2026)
Visual Position Prompt for MLLM based Visual Grounding
por: Tang, Wei, et al.
Publicado: (2025)
por: Tang, Wei, et al.
Publicado: (2025)
Representation Space Constrained Learning with Modality Decoupling for Multimodal Object Detection
por: Shao, YiKang, et al.
Publicado: (2025)
por: Shao, YiKang, et al.
Publicado: (2025)
Uni-MDTrack: Learning Decoupled Memory and Dynamic States for Parameter-Efficient Visual Tracking in All Modality
por: Cai, Wenrui, et al.
Publicado: (2026)
por: Cai, Wenrui, et al.
Publicado: (2026)
Learning Cross-view Visual Geo-localization without Ground Truth
por: Li, Haoyuan, et al.
Publicado: (2024)
por: Li, Haoyuan, et al.
Publicado: (2024)
PEAR: Phrase-Based Hand-Object Interaction Anticipation
por: Zhang, Zichen, et al.
Publicado: (2024)
por: Zhang, Zichen, et al.
Publicado: (2024)
Ejemplares similares
-
Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding
por: Wang, Mengzhao, et al.
Publicado: (2024) -
Single-Image HDR Reconstruction Assisted Ghost Suppression and Detail Preservation Network for Multi-Exposure HDR Imaging
por: Li, Huafeng, et al.
Publicado: (2024) -
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
por: Zhang, Yafei, et al.
Publicado: (2025) -
CHITNet: A Complementary to Harmonious Information Transfer Network for Infrared and Visible Image Fusion
por: Du, Keying, et al.
Publicado: (2023) -
Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared
por: Zhang, Yafei, et al.
Publicado: (2026)