DVF: Advancing Robust and Accurate Fine-Grained Image Retrieval with Retrieval Guidelines
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Xin, Tang, Hao, Yan, Rui, Tang, Jinhui, Li, Zechao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Fine-grained Image Retrieval via Dual-Vision Adaptation
por: Jiang, Xin, et al.
Publicado: (2025)
por: Jiang, Xin, et al.
Publicado: (2025)
Learning Contrastive Self-Distillation for Ultra-Fine-Grained Visual Categorization Targeting Limited Samples
por: Fang, Ziye, et al.
Publicado: (2023)
por: Fang, Ziye, et al.
Publicado: (2023)
Multi-scale Activation, Refinement, and Aggregation: Exploring Diverse Cues for Fine-Grained Bird Recognition
por: Zhang, Zhicheng, et al.
Publicado: (2025)
por: Zhang, Zhicheng, et al.
Publicado: (2025)
Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection
por: Tang, Hao, et al.
Publicado: (2024)
por: Tang, Hao, et al.
Publicado: (2024)
Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval
por: Jiang, Xin, et al.
Publicado: (2025)
por: Jiang, Xin, et al.
Publicado: (2025)
OT-DETECTOR: Delving into Optimal Transport for Zero-shot Out-of-Distribution Detection
por: Liu, Yu, et al.
Publicado: (2025)
por: Liu, Yu, et al.
Publicado: (2025)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
por: Lin, Haoqiang, et al.
Publicado: (2025)
por: Lin, Haoqiang, et al.
Publicado: (2025)
ContextBLIP: Doubly Contextual Alignment for Contrastive Image Retrieval from Linguistically Complex Descriptions
por: Lin, Honglin, et al.
Publicado: (2024)
por: Lin, Honglin, et al.
Publicado: (2024)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
por: Zhang, Long, et al.
Publicado: (2025)
por: Zhang, Long, et al.
Publicado: (2025)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
por: Yang, Rui, et al.
Publicado: (2024)
por: Yang, Rui, et al.
Publicado: (2024)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
por: Hu, Xiaowan, et al.
Publicado: (2024)
por: Hu, Xiaowan, et al.
Publicado: (2024)
Beyond Coarse-Grained Matching in Video-Text Retrieval
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
por: Ding, Yiming, et al.
Publicado: (2026)
por: Ding, Yiming, et al.
Publicado: (2026)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
por: Yang, Yuxin, et al.
Publicado: (2026)
por: Yang, Yuxin, et al.
Publicado: (2026)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
por: Pu, Ruitao, et al.
Publicado: (2025)
por: Pu, Ruitao, et al.
Publicado: (2025)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
por: Xie, Zequn, et al.
Publicado: (2026)
por: Xie, Zequn, et al.
Publicado: (2026)
Pseudo-triplet Guided Few-shot Composed Image Retrieval
por: Hou, Bohan, et al.
Publicado: (2024)
por: Hou, Bohan, et al.
Publicado: (2024)
BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion
por: Jia, Tianzhi, et al.
Publicado: (2026)
por: Jia, Tianzhi, et al.
Publicado: (2026)
Scaling Prompt Instructed Zero Shot Composed Image Retrieval with Image-Only Data
por: Duan, Yiqun, et al.
Publicado: (2025)
por: Duan, Yiqun, et al.
Publicado: (2025)
Mitigating Cross-modal Representation Bias for Multicultural Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
PRVR: Partially Relevant Video Retrieval
por: Chen, Xianke, et al.
Publicado: (2022)
por: Chen, Xianke, et al.
Publicado: (2022)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
por: Huang, Hailang, et al.
Publicado: (2024)
por: Huang, Hailang, et al.
Publicado: (2024)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
Interactive Multi-Turn Retrieval for Health Videos
por: Wu, Chengzheng, et al.
Publicado: (2026)
por: Wu, Chengzheng, et al.
Publicado: (2026)
4D Gaussian Splatting with Scale-aware Residual Field and Adaptive Optimization for Real-time Rendering of Temporally Complex Dynamic Scenes
por: Yan, Jinbo, et al.
Publicado: (2024)
por: Yan, Jinbo, et al.
Publicado: (2024)
FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
por: Wen, Haokun, et al.
Publicado: (2026)
por: Wen, Haokun, et al.
Publicado: (2026)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
por: Nishimura, Taichi, et al.
Publicado: (2023)
por: Nishimura, Taichi, et al.
Publicado: (2023)
Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
por: Liu, Jiale, et al.
Publicado: (2025)
por: Liu, Jiale, et al.
Publicado: (2025)
Disparity-based Stereo Image Compression with Aligned Cross-View Priors
por: Zhai, Yongqi, et al.
Publicado: (2022)
por: Zhai, Yongqi, et al.
Publicado: (2022)
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
por: Lyu, Yibo, et al.
Publicado: (2025)
por: Lyu, Yibo, et al.
Publicado: (2025)
Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
por: Zhang, Bolin, et al.
Publicado: (2026)
por: Zhang, Bolin, et al.
Publicado: (2026)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
por: Zhu, Hongyi, et al.
Publicado: (2024)
por: Zhu, Hongyi, et al.
Publicado: (2024)
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval
por: Zhao, Ruixiang, et al.
Publicado: (2024)
por: Zhao, Ruixiang, et al.
Publicado: (2024)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
por: Wang, Yabing, et al.
Publicado: (2023)
por: Wang, Yabing, et al.
Publicado: (2023)
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
por: Dai, Guangyu, et al.
Publicado: (2025)
por: Dai, Guangyu, et al.
Publicado: (2025)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
por: Zhao, Zhixian, et al.
Publicado: (2026)
por: Zhao, Zhixian, et al.
Publicado: (2026)
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
por: Li, Yili, et al.
Publicado: (2025)
por: Li, Yili, et al.
Publicado: (2025)
Ejemplares similares
-
Fine-grained Image Retrieval via Dual-Vision Adaptation
por: Jiang, Xin, et al.
Publicado: (2025) -
Learning Contrastive Self-Distillation for Ultra-Fine-Grained Visual Categorization Targeting Limited Samples
por: Fang, Ziye, et al.
Publicado: (2023) -
Multi-scale Activation, Refinement, and Aggregation: Exploring Diverse Cues for Fine-Grained Bird Recognition
por: Zhang, Zhicheng, et al.
Publicado: (2025) -
Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection
por: Tang, Hao, et al.
Publicado: (2024) -
Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval
por: Jiang, Xin, et al.
Publicado: (2025)