V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Dongyang, Wang, Chaoyang, Su, Dezhao, Xiao, Xi, Zhang, Zeyu, Xiong, Jing, Li, Qing, Shang, Yuzhang, Kan, Shichao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TMCIR: Token Merge Benefits Composed Image Retrieval
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
AdaTooler-V: Adaptive Tool-Use for Images and Videos
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
PLUME: Latent Reasoning Based Universal Multimodal Embedding
di: He, Chenwei, et al.
Pubblicazione: (2026)
di: He, Chenwei, et al.
Pubblicazione: (2026)
Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
HRDecoder: High-Resolution Decoder Network for Fundus Image Lesion Segmentation
di: Ding, Ziyuan, et al.
Pubblicazione: (2024)
di: Ding, Ziyuan, et al.
Pubblicazione: (2024)
Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
Efficient Multimodal Dataset Distillation via Generative Models
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
di: Li, Kunyang, et al.
Pubblicazione: (2026)
di: Li, Kunyang, et al.
Pubblicazione: (2026)
Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark
di: Liu, Xinxin, et al.
Pubblicazione: (2025)
di: Liu, Xinxin, et al.
Pubblicazione: (2025)
EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory
di: Li, Yuyang, et al.
Pubblicazione: (2026)
di: Li, Yuyang, et al.
Pubblicazione: (2026)
freePruner: A Training-free Approach for Large Multimodal Model Acceleration
di: Xu, Bingxin, et al.
Pubblicazione: (2024)
di: Xu, Bingxin, et al.
Pubblicazione: (2024)
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
di: Zhou, Weijie, et al.
Pubblicazione: (2025)
di: Zhou, Weijie, et al.
Pubblicazione: (2025)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
MR$^2$-Bench: Going Beyond Matching to Reasoning in Multimodal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2025)
di: Zhou, Junjie, et al.
Pubblicazione: (2025)
Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation
di: Zhang, Jing, et al.
Pubblicazione: (2026)
di: Zhang, Jing, et al.
Pubblicazione: (2026)
MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion
di: Li, Kunyang, et al.
Pubblicazione: (2026)
di: Li, Kunyang, et al.
Pubblicazione: (2026)
FBPT: A Fully Binary Point Transformer
di: Hou, Zhixing, et al.
Pubblicazione: (2024)
di: Hou, Zhixing, et al.
Pubblicazione: (2024)
Incorporating Degradation Estimation in Light Field Spatial Super-Resolution
di: Xiao, Zeyu, et al.
Pubblicazione: (2024)
di: Xiao, Zeyu, et al.
Pubblicazione: (2024)
ARK: A Dual-Axis Multimodal Retrieval Benchmark along Reasoning and Knowledge
di: Lin, Yijie, et al.
Pubblicazione: (2026)
di: Lin, Yijie, et al.
Pubblicazione: (2026)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes
di: Li, Di, et al.
Pubblicazione: (2026)
di: Li, Di, et al.
Pubblicazione: (2026)
Dataset Quantization with Active Learning based Adaptive Sampling
di: Zhao, Zhenghao, et al.
Pubblicazione: (2024)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2024)
Revisiting Diffusion Model Predictions Through Dimensionality
di: Jin, Qing, et al.
Pubblicazione: (2026)
di: Jin, Qing, et al.
Pubblicazione: (2026)
Object Retrieval for Visual Question Answering with Outside Knowledge
di: Kan, Shichao, et al.
Pubblicazione: (2024)
di: Kan, Shichao, et al.
Pubblicazione: (2024)
Medical SAM3: A Foundation Model for Universal Prompt-Driven Medical Image Segmentation
di: Jiang, Chongcong, et al.
Pubblicazione: (2026)
di: Jiang, Chongcong, et al.
Pubblicazione: (2026)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning
di: Zhang, Wenchuan, et al.
Pubblicazione: (2025)
di: Zhang, Wenchuan, et al.
Pubblicazione: (2025)
SurgVisAgent: Multimodal Agentic Model for Versatile Surgical Visual Enhancement
di: Lei, Zeyu, et al.
Pubblicazione: (2025)
di: Lei, Zeyu, et al.
Pubblicazione: (2025)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
di: Guo, Yifu, et al.
Pubblicazione: (2025)
di: Guo, Yifu, et al.
Pubblicazione: (2025)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
di: Yang, Wenhao, et al.
Pubblicazione: (2026)
di: Yang, Wenhao, et al.
Pubblicazione: (2026)
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models
di: Yao, Ruilin, et al.
Pubblicazione: (2025)
di: Yao, Ruilin, et al.
Pubblicazione: (2025)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
Supplementing Missing Visions via Dialog for Scene Graph Generations
di: Zhao, Zhenghao, et al.
Pubblicazione: (2022)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2022)
U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TMCIR: Token Merge Benefits Composed Image Retrieval
di: Wang, Chaoyang, et al.
Pubblicazione: (2025) -
AdaTooler-V: Adaptive Tool-Use for Images and Videos
di: Wang, Chaoyang, et al.
Pubblicazione: (2025) -
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
di: Wang, Chaoyang, et al.
Pubblicazione: (2026) -
PLUME: Latent Reasoning Based Universal Multimodal Embedding
di: He, Chenwei, et al.
Pubblicazione: (2026) -
Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)