Enregistré dans:
| Auteurs principaux: | Dordevic, Danilo, Kumar, Suryansh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2409.01082 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
FOR: Finetuning for Object Level Open Vocabulary Image Retrieval
par: Levi, Hila, et autres
Publié: (2024)
par: Levi, Hila, et autres
Publié: (2024)
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
par: Sogi, Naoya, et autres
Publié: (2024)
par: Sogi, Naoya, et autres
Publié: (2024)
Hierarchy-of-Visual-Words: a Learning-based Approach for Trademark Image Retrieval
par: Lourenço, Vítor N., et autres
Publié: (2019)
par: Lourenço, Vítor N., et autres
Publié: (2019)
Candidate Set Re-ranking for Composed Image Retrieval with Dual Multi-modal Encoder
par: Liu, Zheyuan, et autres
Publié: (2023)
par: Liu, Zheyuan, et autres
Publié: (2023)
Multi-event Video-Text Retrieval
par: Zhang, Gengyuan, et autres
Publié: (2023)
par: Zhang, Gengyuan, et autres
Publié: (2023)
Embedding-based Retrieval in Multimodal Content Moderation
par: Liang, Hanzhong, et autres
Publié: (2025)
par: Liang, Hanzhong, et autres
Publié: (2025)
Generalized Contrastive Learning for Multi-Modal Retrieval and Ranking
par: Zhu, Tianyu, et autres
Publié: (2024)
par: Zhu, Tianyu, et autres
Publié: (2024)
NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval
par: Liu, Zhuchenyang, et autres
Publié: (2026)
par: Liu, Zhuchenyang, et autres
Publié: (2026)
DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation Models
par: Wang, Yimu, et autres
Publié: (2024)
par: Wang, Yimu, et autres
Publié: (2024)
Online Learning via Memory: Retrieval-Augmented Detector Adaptation
par: Jian, Yanan, et autres
Publié: (2024)
par: Jian, Yanan, et autres
Publié: (2024)
Metric Compatible Training for Online Backfilling in Large-Scale Retrieval
par: Seo, Seonguk, et autres
Publié: (2023)
par: Seo, Seonguk, et autres
Publié: (2023)
Open Multimodal Retrieval-Augmented Factual Image Generation
par: Tian, Yang, et autres
Publié: (2025)
par: Tian, Yang, et autres
Publié: (2025)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
par: Xu, Yifan, et autres
Publié: (2024)
par: Xu, Yifan, et autres
Publié: (2024)
Sync from the Sea: Retrieving Alignable Videos from Large-Scale Datasets
par: Dave, Ishan Rajendrakumar, et autres
Publié: (2024)
par: Dave, Ishan Rajendrakumar, et autres
Publié: (2024)
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
par: Alomari, Hani, et autres
Publié: (2025)
par: Alomari, Hani, et autres
Publié: (2025)
LD-DETR: Loop Decoder DEtection TRansformer for Video Moment Retrieval and Highlight Detection
par: Zhao, Pengcheng, et autres
Publié: (2025)
par: Zhao, Pengcheng, et autres
Publié: (2025)
Dual Pose-invariant Embeddings: Learning Category and Object-specific Discriminative Representations for Recognition and Retrieval
par: Sarkar, Rohan, et autres
Publié: (2024)
par: Sarkar, Rohan, et autres
Publié: (2024)
Re-ranking the Context for Multimodal Retrieval Augmented Generation
par: Mortaheb, Matin, et autres
Publié: (2025)
par: Mortaheb, Matin, et autres
Publié: (2025)
RAG-Check: Evaluating Multimodal Retrieval Augmented Generation Performance
par: Mortaheb, Matin, et autres
Publié: (2025)
par: Mortaheb, Matin, et autres
Publié: (2025)
Transfer Learning with Self-Supervised Vision Transformers for Snake Identification
par: Miyaguchi, Anthony, et autres
Publié: (2024)
par: Miyaguchi, Anthony, et autres
Publié: (2024)
Multi-Label Plant Species Classification with Self-Supervised Vision Transformers
par: Gustineli, Murilo, et autres
Publié: (2024)
par: Gustineli, Murilo, et autres
Publié: (2024)
Improving Visual Recommendation on E-commerce Platforms Using Vision-Language Models
par: Yada, Yuki, et autres
Publié: (2025)
par: Yada, Yuki, et autres
Publié: (2025)
PICS: Pipeline for Image Captioning and Search
par: Rosario, Grant, et autres
Publié: (2024)
par: Rosario, Grant, et autres
Publié: (2024)
Multi-Label Plant Species Prediction with Metadata-Enhanced Multi-Head Vision Transformers
par: Herasimchyk, Hanna, et autres
Publié: (2025)
par: Herasimchyk, Hanna, et autres
Publié: (2025)
Image Fusion for Cross-Domain Sequential Recommendation
par: Wu, Wangyu, et autres
Publié: (2024)
par: Wu, Wangyu, et autres
Publié: (2024)
Image Outlier Detection Without Training using RANSAC
par: Tsai, Chen-Han, et autres
Publié: (2023)
par: Tsai, Chen-Han, et autres
Publié: (2023)
Sustainable transparency in Recommender Systems: Bayesian Ranking of Images for Explainability
par: Paz-Ruza, Jorge, et autres
Publié: (2023)
par: Paz-Ruza, Jorge, et autres
Publié: (2023)
Image Hashing via Cross-View Code Alignment in the Age of Foundation Models
par: Moummad, Ilyass, et autres
Publié: (2025)
par: Moummad, Ilyass, et autres
Publié: (2025)
Towards Resource-Efficient Streaming of Large-Scale Medical Image Datasets for Deep Learning
par: Kulkarni, Pranav, et autres
Publié: (2023)
par: Kulkarni, Pranav, et autres
Publié: (2023)
Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis
par: Pegia, Maria-Eirini, et autres
Publié: (2026)
par: Pegia, Maria-Eirini, et autres
Publié: (2026)
Revisit Anything: Visual Place Recognition via Image Segment Retrieval
par: Garg, Kartik, et autres
Publié: (2024)
par: Garg, Kartik, et autres
Publié: (2024)
Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models
par: Williams-Lekuona, Mikel, et autres
Publié: (2025)
par: Williams-Lekuona, Mikel, et autres
Publié: (2025)
Siamese Content-based Search Engine for a More Transparent Skin and Breast Cancer Diagnosis through Histological Imaging
par: Tabatabaei, Zahra, et autres
Publié: (2024)
par: Tabatabaei, Zahra, et autres
Publié: (2024)
CoopHash: Cooperative Learning of Multipurpose Descriptor and Contrastive Pair Generator via Variational MCMC Teaching for Supervised Image Hashing
par: Doan, Khoa D., et autres
Publié: (2022)
par: Doan, Khoa D., et autres
Publié: (2022)
Benchmarking Robustness of Contrastive Learning Models for Medical Image-Report Retrieval
par: Deanda, Demetrio, et autres
Publié: (2025)
par: Deanda, Demetrio, et autres
Publié: (2025)
Reasoning-Augmented Representations for Multimodal Retrieval
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures
par: Raja, Rahul, et autres
Publié: (2025)
par: Raja, Rahul, et autres
Publié: (2025)
FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA
par: Sarwar, Nobin
Publié: (2025)
par: Sarwar, Nobin
Publié: (2025)
TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations
par: Si, Jacob, et autres
Publié: (2025)
par: Si, Jacob, et autres
Publié: (2025)
Documents similaires
-
Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026) -
FOR: Finetuning for Object Level Open Vocabulary Image Retrieval
par: Levi, Hila, et autres
Publié: (2024) -
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
par: Sogi, Naoya, et autres
Publié: (2024) -
Hierarchy-of-Visual-Words: a Learning-based Approach for Trademark Image Retrieval
par: Lourenço, Vítor N., et autres
Publié: (2019) -
Candidate Set Re-ranking for Composed Image Retrieval with Dual Multi-modal Encoder
par: Liu, Zheyuan, et autres
Publié: (2023)