Cross-Modal Attention Alignment Network with Auxiliary Text Description for zero-shot sketch-based image retrieval
Fuente:
arXiv
Saved in:
| Main Authors: | Su, Hanwen, Song, Ge, Huang, Kai, Wang, Jiyan, Yang, Ming |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Dynamic Multi-level Weighted Alignment Network for Zero-shot Sketch-based Image Retrieval
by: Su, Hanwen, et al.
Published: (2025)
by: Su, Hanwen, et al.
Published: (2025)
Zero-shot sketch-based remote sensing image retrieval based on multi-level and attention-guided tokenization
by: Yang, Bo, et al.
Published: (2024)
by: Yang, Bo, et al.
Published: (2024)
Out-of-Distribution Detection Using Peer-Class Generated by Large Language Model
by: Huang, K, et al.
Published: (2024)
by: Huang, K, et al.
Published: (2024)
Multi-omic Prognosis of Alzheimer's Disease with Asymmetric Cross-Modal Cross-Attention Network
by: Ming, Yang, et al.
Published: (2025)
by: Ming, Yang, et al.
Published: (2025)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
by: Huang, Hailang, et al.
Published: (2024)
by: Huang, Hailang, et al.
Published: (2024)
Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition
by: Do, Jeonghyeok, et al.
Published: (2024)
by: Do, Jeonghyeok, et al.
Published: (2024)
Active Diffusion Matching: Score-based Iterative Alignment of Cross-Modal Retinal Images
by: Lee, Kanggeon, et al.
Published: (2026)
by: Lee, Kanggeon, et al.
Published: (2026)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
by: Zhao, Zixu, et al.
Published: (2025)
by: Zhao, Zixu, et al.
Published: (2025)
LERENet: Eliminating Intra-class Differences for Metal Surface Defect Few-shot Semantic Segmentation
by: Ding, Hanze, et al.
Published: (2024)
by: Ding, Hanze, et al.
Published: (2024)
Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image Attention
by: Xing, Junhao, et al.
Published: (2025)
by: Xing, Junhao, et al.
Published: (2025)
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
by: Li, Mingxiao, et al.
Published: (2025)
by: Li, Mingxiao, et al.
Published: (2025)
Bridge Feature Matching and Cross-Modal Alignment with Mutual-filtering for Zero-shot Anomaly Detection
by: Bai, Yuhu, et al.
Published: (2025)
by: Bai, Yuhu, et al.
Published: (2025)
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
by: Lei, Youbo, et al.
Published: (2023)
by: Lei, Youbo, et al.
Published: (2023)
Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark
by: Deng, Yifei, et al.
Published: (2025)
by: Deng, Yifei, et al.
Published: (2025)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
by: Wang, Shaokun, et al.
Published: (2026)
by: Wang, Shaokun, et al.
Published: (2026)
Multi-Grained Cross-modal Alignment for Learning Open-vocabulary Semantic Segmentation from Text Supervision
by: Liu, Yajie, et al.
Published: (2024)
by: Liu, Yajie, et al.
Published: (2024)
Text-image Alignment for Diffusion-based Perception
by: Kondapaneni, Neehar, et al.
Published: (2023)
by: Kondapaneni, Neehar, et al.
Published: (2023)
Retrieval-enriched zero-shot image classification in low-resource domains
by: Dall'Asen, Nicola, et al.
Published: (2024)
by: Dall'Asen, Nicola, et al.
Published: (2024)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
by: Ma, Wenxuan, et al.
Published: (2024)
by: Ma, Wenxuan, et al.
Published: (2024)
CPCL: Cross-Modal Prototypical Contrastive Learning for Weakly Supervised Text-based Person Retrieval
by: Zhao, Xinpeng, et al.
Published: (2024)
by: Zhao, Xinpeng, et al.
Published: (2024)
AttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention Anchors
by: Zhang, Junyang, et al.
Published: (2025)
by: Zhang, Junyang, et al.
Published: (2025)
Multi-Modal Face Anti-Spoofing via Cross-Modal Feature Transitions
by: Chong, Jun-Xiong, et al.
Published: (2025)
by: Chong, Jun-Xiong, et al.
Published: (2025)
Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model
by: Lee, SuBeen, et al.
Published: (2025)
by: Lee, SuBeen, et al.
Published: (2025)
Event-based Facial Keypoint Alignment via Cross-Modal Fusion Attention and Self-Supervised Multi-Event Representation Learning
by: Kang, Donghwa, et al.
Published: (2025)
by: Kang, Donghwa, et al.
Published: (2025)
TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
by: Baek, Kanghyun, et al.
Published: (2025)
by: Baek, Kanghyun, et al.
Published: (2025)
Step-wise Distribution Alignment Guided Style Prompt Tuning for Source-free Cross-domain Few-shot Learning
by: Xu, Huali, et al.
Published: (2024)
by: Xu, Huali, et al.
Published: (2024)
Improving Joint Audio-Video Generation with Cross-Modal Context Learning
by: Ma, Bingqi, et al.
Published: (2026)
by: Ma, Bingqi, et al.
Published: (2026)
E2MPL:An Enduring and Efficient Meta Prompt Learning Framework for Few-shot Unsupervised Domain Adaptation
by: Yang, Wanqi, et al.
Published: (2024)
by: Yang, Wanqi, et al.
Published: (2024)
sketch2symm: Symmetry-aware sketch-to-shape generation via semantic bridging
by: Zhou, Yan, et al.
Published: (2025)
by: Zhou, Yan, et al.
Published: (2025)
CLII: Visual-Text Inpainting via Cross-Modal Predictive Interaction
by: Zhao, Liang, et al.
Published: (2024)
by: Zhao, Liang, et al.
Published: (2024)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
by: Zheng, Jinzhi, et al.
Published: (2024)
by: Zheng, Jinzhi, et al.
Published: (2024)
CrossOver: 3D Scene Cross-Modal Alignment
by: Sarkar, Sayan Deb, et al.
Published: (2025)
by: Sarkar, Sayan Deb, et al.
Published: (2025)
Ultrasound Report Generation with Cross-Modality Feature Alignment via Unsupervised Guidance
by: Li, Jun, et al.
Published: (2024)
by: Li, Jun, et al.
Published: (2024)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
by: He, Xiang, et al.
Published: (2025)
by: He, Xiang, et al.
Published: (2025)
Align3D-AD: Cross-Modal Feature Alignment and Dual-Prompt Learning for Zero-shot 3D Anomaly Detection
by: Bai, Letian, et al.
Published: (2026)
by: Bai, Letian, et al.
Published: (2026)
Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation
by: Yang, Chen
Published: (2026)
by: Yang, Chen
Published: (2026)
Knowing Where to Focus: Attention-Guided Alignment for Text-based Person Search
by: Tan, Lei, et al.
Published: (2024)
by: Tan, Lei, et al.
Published: (2024)
Mask-guided cross-image attention for zero-shot in-silico histopathologic image generation with a diffusion model
by: Winter, Dominik, et al.
Published: (2024)
by: Winter, Dominik, et al.
Published: (2024)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
by: Liu, Xuyang, et al.
Published: (2023)
by: Liu, Xuyang, et al.
Published: (2023)
Cross-Modal Adapter for Vision-Language Retrieval
by: Jiang, Haojun, et al.
Published: (2022)
by: Jiang, Haojun, et al.
Published: (2022)
Similar Items
-
Dynamic Multi-level Weighted Alignment Network for Zero-shot Sketch-based Image Retrieval
by: Su, Hanwen, et al.
Published: (2025) -
Zero-shot sketch-based remote sensing image retrieval based on multi-level and attention-guided tokenization
by: Yang, Bo, et al.
Published: (2024) -
Out-of-Distribution Detection Using Peer-Class Generated by Large Language Model
by: Huang, K, et al.
Published: (2024) -
Multi-omic Prognosis of Alzheimer's Disease with Asymmetric Cross-Modal Cross-Attention Network
by: Ming, Yang, et al.
Published: (2025) -
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
by: Huang, Hailang, et al.
Published: (2024)