Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval
Fuente:
arXiv
Guardado en:
| Autor principal: | Alavi, Ali |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning
por: Alavi, Ali
Publicado: (2026)
por: Alavi, Ali
Publicado: (2026)
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval
por: Gardères, François, et al.
Publicado: (2026)
por: Gardères, François, et al.
Publicado: (2026)
Candidate Set Re-ranking for Composed Image Retrieval with Dual Multi-modal Encoder
por: Liu, Zheyuan, et al.
Publicado: (2023)
por: Liu, Zheyuan, et al.
Publicado: (2023)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
por: Tu, Rong-Cheng, et al.
Publicado: (2025)
por: Tu, Rong-Cheng, et al.
Publicado: (2025)
Perception First: A Frontier Native-Video Model with Self-Consistency for Implicit Video Question Answering
por: Alavi, Ali
Publicado: (2026)
por: Alavi, Ali
Publicado: (2026)
CoVR-R:Reason-Aware Composed Video Retrieval
por: Thawakar, Omkar, et al.
Publicado: (2026)
por: Thawakar, Omkar, et al.
Publicado: (2026)
Zero Shot Composed Image Retrieval
por: Kakarla, Santhosh, et al.
Publicado: (2025)
por: Kakarla, Santhosh, et al.
Publicado: (2025)
Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval
por: Tang, Yuanmin, et al.
Publicado: (2024)
por: Tang, Yuanmin, et al.
Publicado: (2024)
G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval
por: Lim, Jiyoung, et al.
Publicado: (2026)
por: Lim, Jiyoung, et al.
Publicado: (2026)
Re-ranking the Context for Multimodal Retrieval Augmented Generation
por: Mortaheb, Matin, et al.
Publicado: (2025)
por: Mortaheb, Matin, et al.
Publicado: (2025)
ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval
por: Xing, Eric, et al.
Publicado: (2025)
por: Xing, Eric, et al.
Publicado: (2025)
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
por: Jeon, Mingyu, et al.
Publicado: (2026)
por: Jeon, Mingyu, et al.
Publicado: (2026)
Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures
por: Raja, Rahul, et al.
Publicado: (2025)
por: Raja, Rahul, et al.
Publicado: (2025)
Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
por: Xu, Chenhui, et al.
Publicado: (2025)
por: Xu, Chenhui, et al.
Publicado: (2025)
Domain-Aware Continual Zero-Shot Learning
por: Yi, Kai, et al.
Publicado: (2021)
por: Yi, Kai, et al.
Publicado: (2021)
CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval
por: Sun, Zelong, et al.
Publicado: (2025)
por: Sun, Zelong, et al.
Publicado: (2025)
SAM-Aware Graph Prompt Reasoning Network for Cross-Domain Few-Shot Segmentation
por: Peng, Shi-Feng, et al.
Publicado: (2024)
por: Peng, Shi-Feng, et al.
Publicado: (2024)
ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
por: Zhang, Shimin, et al.
Publicado: (2025)
por: Zhang, Shimin, et al.
Publicado: (2025)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
por: Xu, Yifan, et al.
Publicado: (2024)
por: Xu, Yifan, et al.
Publicado: (2024)
Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval
por: Wang, Tong, et al.
Publicado: (2026)
por: Wang, Tong, et al.
Publicado: (2026)
HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels
por: Jiang, Yingying, et al.
Publicado: (2024)
por: Jiang, Yingying, et al.
Publicado: (2024)
MCoT-RE: Multi-Faceted Chain-of-Thought and Re-Ranking for Training-Free Zero-Shot Composed Image Retrieval
por: Park, Jeong-Woo, et al.
Publicado: (2025)
por: Park, Jeong-Woo, et al.
Publicado: (2025)
Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization
por: Yu, Tao, et al.
Publicado: (2026)
por: Yu, Tao, et al.
Publicado: (2026)
Reasoning-Augmented Representations for Multimodal Retrieval
por: Zhang, Jianrui, et al.
Publicado: (2026)
por: Zhang, Jianrui, et al.
Publicado: (2026)
Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs
por: Hasanebrahimi, Afsaneh, et al.
Publicado: (2026)
por: Hasanebrahimi, Afsaneh, et al.
Publicado: (2026)
Cluster-Aware Similarity Diffusion for Instance Retrieval
por: Luo, Jifei, et al.
Publicado: (2024)
por: Luo, Jifei, et al.
Publicado: (2024)
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
por: Wang, Yabing, et al.
Publicado: (2025)
por: Wang, Yabing, et al.
Publicado: (2025)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
por: Yang, Qi, et al.
Publicado: (2025)
por: Yang, Qi, et al.
Publicado: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
por: Nagar, Aishik, et al.
Publicado: (2024)
por: Nagar, Aishik, et al.
Publicado: (2024)
Fine-Grained Zero-Shot Composed Image Retrieval with Complementary Visual-Semantic Integration
por: Ye, Yongcong, et al.
Publicado: (2026)
por: Ye, Yongcong, et al.
Publicado: (2026)
Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
Zero-Shot Vehicle Model Recognition via Text-Based Retrieval-Augmented Generation
por: Chang, Wei-Chia, et al.
Publicado: (2025)
por: Chang, Wei-Chia, et al.
Publicado: (2025)
FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA
por: Sarwar, Nobin
Publicado: (2025)
por: Sarwar, Nobin
Publicado: (2025)
Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning
por: Zhang, Wenlun, et al.
Publicado: (2026)
por: Zhang, Wenlun, et al.
Publicado: (2026)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
por: Lin, Haoqiang, et al.
Publicado: (2025)
por: Lin, Haoqiang, et al.
Publicado: (2025)
Zero-shot Composed Text-Image Retrieval
por: Liu, Yikun, et al.
Publicado: (2023)
por: Liu, Yikun, et al.
Publicado: (2023)
Towards Sparse Video Understanding and Reasoning
por: Xu, Chenwei, et al.
Publicado: (2026)
por: Xu, Chenwei, et al.
Publicado: (2026)
MINERVA: Evaluating Complex Video Reasoning
por: Nagrani, Arsha, et al.
Publicado: (2025)
por: Nagrani, Arsha, et al.
Publicado: (2025)
Ejemplares similares
-
TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning
por: Alavi, Ali
Publicado: (2026) -
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking
por: Li, Zixu, et al.
Publicado: (2026) -
FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval
por: Gardères, François, et al.
Publicado: (2026) -
Candidate Set Re-ranking for Composed Image Retrieval with Dual Multi-modal Encoder
por: Liu, Zheyuan, et al.
Publicado: (2023) -
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
por: Tu, Rong-Cheng, et al.
Publicado: (2025)