RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval
Fuente:
arXiv
Guardado en:
| Autores principales: | Skow, Tyler, Martin, Alexander, Van Durme, Benjamin, Chellappa, Rama, Kriz, Reno |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval
por: Reddy, Arun, et al.
Publicado: (2025)
por: Reddy, Arun, et al.
Publicado: (2025)
MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation
por: Chakraborty, Debashish, et al.
Publicado: (2026)
por: Chakraborty, Debashish, et al.
Publicado: (2026)
Multi-Vector Index Compression in Any Modality
por: Qin, Hanxiang, et al.
Publicado: (2026)
por: Qin, Hanxiang, et al.
Publicado: (2026)
Seeing Through the MiRAGE: Evaluating Multimodal Retrieval Augmented Generation
por: Martin, Alexander, et al.
Publicado: (2025)
por: Martin, Alexander, et al.
Publicado: (2025)
SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval
por: Yu, Xuzheng, et al.
Publicado: (2024)
por: Yu, Xuzheng, et al.
Publicado: (2024)
AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction
por: Yang, Jiashu, et al.
Publicado: (2026)
por: Yang, Jiashu, et al.
Publicado: (2026)
MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
por: Huang, Jinghao, et al.
Publicado: (2025)
por: Huang, Jinghao, et al.
Publicado: (2025)
Video Editing for Video Retrieval
por: Zhu, Bin, et al.
Publicado: (2024)
por: Zhu, Bin, et al.
Publicado: (2024)
Multi-event Video-Text Retrieval
por: Zhang, Gengyuan, et al.
Publicado: (2023)
por: Zhang, Gengyuan, et al.
Publicado: (2023)
MMMORRF: Multimodal Multilingual Modularized Reciprocal Rank Fusion
por: Samuel, Saron, et al.
Publicado: (2025)
por: Samuel, Saron, et al.
Publicado: (2025)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
por: Xiao, Jian, et al.
Publicado: (2024)
por: Xiao, Jian, et al.
Publicado: (2024)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
por: Xiao, Jian, et al.
Publicado: (2025)
por: Xiao, Jian, et al.
Publicado: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
por: Li, Minghan, et al.
Publicado: (2026)
por: Li, Minghan, et al.
Publicado: (2026)
Adapting MLLMs for Nuanced Video Retrieval
por: Bagad, Piyush, et al.
Publicado: (2025)
por: Bagad, Piyush, et al.
Publicado: (2025)
Event-aware Video Corpus Moment Retrieval
por: Hou, Danyang, et al.
Publicado: (2024)
por: Hou, Danyang, et al.
Publicado: (2024)
Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion
por: Thanh, Toan Le Ngo, et al.
Publicado: (2025)
por: Thanh, Toan Le Ngo, et al.
Publicado: (2025)
ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval
por: Zhang, Zhuocheng, et al.
Publicado: (2026)
por: Zhang, Zhuocheng, et al.
Publicado: (2026)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
por: Tu, Rong-Cheng, et al.
Publicado: (2025)
por: Tu, Rong-Cheng, et al.
Publicado: (2025)
BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment
por: Mounis, Mohamed Darwish, et al.
Publicado: (2026)
por: Mounis, Mohamed Darwish, et al.
Publicado: (2026)
Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement
por: Hou, Danyang, et al.
Publicado: (2024)
por: Hou, Danyang, et al.
Publicado: (2024)
A Replicability Study of XTR
por: Jha, Rohan, et al.
Publicado: (2026)
por: Jha, Rohan, et al.
Publicado: (2026)
AlbumFill: Album-Guided Reasoning and Retrieval for Personalized Image Completion
por: Tsai, Yu-Ju, et al.
Publicado: (2026)
por: Tsai, Yu-Ju, et al.
Publicado: (2026)
MR$^2$-Bench: Going Beyond Matching to Reasoning in Multimodal Retrieval
por: Zhou, Junjie, et al.
Publicado: (2025)
por: Zhou, Junjie, et al.
Publicado: (2025)
FIGROTD: A Friendly-to-Handle Dataset for Image Guided Retrieval with Optional Text
por: Le, Hoang-Bao, et al.
Publicado: (2025)
por: Le, Hoang-Bao, et al.
Publicado: (2025)
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach
por: Bai, Zechen, et al.
Publicado: (2024)
por: Bai, Zechen, et al.
Publicado: (2024)
A Resource-Efficient Training Framework for Remote Sensing Text--Image Retrieval
por: Zhang, Weihang, et al.
Publicado: (2025)
por: Zhang, Weihang, et al.
Publicado: (2025)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
por: Cai, Qifeng, et al.
Publicado: (2025)
por: Cai, Qifeng, et al.
Publicado: (2025)
TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval
por: Sun, Xinyu, et al.
Publicado: (2026)
por: Sun, Xinyu, et al.
Publicado: (2026)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
Personalized Video Summarization using Text-Based Queries and Conditional Modeling
por: Huang, Jia-Hong
Publicado: (2024)
por: Huang, Jia-Hong
Publicado: (2024)
HVD: Human Vision-Driven Video Representation Learning for Text-Video Retrieval
por: Xie, Zequn, et al.
Publicado: (2026)
por: Xie, Zequn, et al.
Publicado: (2026)
Towards Text-Image Interleaved Retrieval
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval
por: Byun, Jaeseok, et al.
Publicado: (2024)
por: Byun, Jaeseok, et al.
Publicado: (2024)
Interactive Multi-Turn Retrieval for Health Videos
por: Wu, Chengzheng, et al.
Publicado: (2026)
por: Wu, Chengzheng, et al.
Publicado: (2026)
Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval
por: Sun, Zengbao, et al.
Publicado: (2024)
por: Sun, Zengbao, et al.
Publicado: (2024)
A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback
por: Khaertdinov, Bulat, et al.
Publicado: (2025)
por: Khaertdinov, Bulat, et al.
Publicado: (2025)
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
por: Yu, Rongyi, et al.
Publicado: (2026)
por: Yu, Rongyi, et al.
Publicado: (2026)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
por: Dai, Ziqi, et al.
Publicado: (2025)
por: Dai, Ziqi, et al.
Publicado: (2025)
INQUIRE: A Natural World Text-to-Image Retrieval Benchmark
por: Vendrow, Edward, et al.
Publicado: (2024)
por: Vendrow, Edward, et al.
Publicado: (2024)
A Brief Comparison of Training-Free Multi-Vector Sequence Compression Methods
por: Jha, Rohan, et al.
Publicado: (2026)
por: Jha, Rohan, et al.
Publicado: (2026)
Ejemplares similares
-
Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval
por: Reddy, Arun, et al.
Publicado: (2025) -
MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation
por: Chakraborty, Debashish, et al.
Publicado: (2026) -
Multi-Vector Index Compression in Any Modality
por: Qin, Hanxiang, et al.
Publicado: (2026) -
Seeing Through the MiRAGE: Evaluating Multimodal Retrieval Augmented Generation
por: Martin, Alexander, et al.
Publicado: (2025) -
SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval
por: Yu, Xuzheng, et al.
Publicado: (2024)