Guardado en:
| Autores principales: | Lin, Yijie, Ding, Guofeng, Zhou, Haochen, Li, Haobin, Yang, Mouxing, Peng, Xi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.09839 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reliable Thinking with Images
por: Li, Haobin, et al.
Publicado: (2026)
por: Li, Haobin, et al.
Publicado: (2026)
LLaVA-ReID: Selective Multi-image Questioner for Interactive Person Re-Identification
por: Lu, Yiding, et al.
Publicado: (2025)
por: Lu, Yiding, et al.
Publicado: (2025)
Decoupled Contrastive Multi-View Clustering with High-Order Random Walks
por: Lu, Yiding, et al.
Publicado: (2023)
por: Lu, Yiding, et al.
Publicado: (2023)
A Survey on Deep Clustering: From the Prior Perspective
por: Lu, Yiding, et al.
Publicado: (2024)
por: Lu, Yiding, et al.
Publicado: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
por: Tian, Yuxin, et al.
Publicado: (2024)
por: Tian, Yuxin, et al.
Publicado: (2024)
AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition
por: Wang, Zeheng, et al.
Publicado: (2026)
por: Wang, Zeheng, et al.
Publicado: (2026)
Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning
por: Tan, Cheng, et al.
Publicado: (2024)
por: Tan, Cheng, et al.
Publicado: (2024)
Learning with Dual-level Noisy Correspondence for Multi-modal Entity Alignment
por: Li, Haobin, et al.
Publicado: (2025)
por: Li, Haobin, et al.
Publicado: (2025)
V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval
por: Chen, Dongyang, et al.
Publicado: (2026)
por: Chen, Dongyang, et al.
Publicado: (2026)
MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents
por: Xu, Dannong, et al.
Publicado: (2026)
por: Xu, Dannong, et al.
Publicado: (2026)
Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation
por: Zhang, Jianing, et al.
Publicado: (2026)
por: Zhang, Jianing, et al.
Publicado: (2026)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
por: Wang, Lehan, et al.
Publicado: (2025)
por: Wang, Lehan, et al.
Publicado: (2025)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
por: Liu, Chunxu, et al.
Publicado: (2025)
por: Liu, Chunxu, et al.
Publicado: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
por: Li, Jingyao, et al.
Publicado: (2025)
por: Li, Jingyao, et al.
Publicado: (2025)
Dual Learning with Dynamic Knowledge Distillation and Soft Alignment for Partially Relevant Video Retrieval
por: Dong, Jianfeng, et al.
Publicado: (2025)
por: Dong, Jianfeng, et al.
Publicado: (2025)
Toward Robust and Harmonious Adaptation for Cross-modal Retrieval
por: Li, Haobin, et al.
Publicado: (2025)
por: Li, Haobin, et al.
Publicado: (2025)
Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval
por: Suo, Yucheng, et al.
Publicado: (2024)
por: Suo, Yucheng, et al.
Publicado: (2024)
PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology
por: Sun, Yuxuan, et al.
Publicado: (2024)
por: Sun, Yuxuan, et al.
Publicado: (2024)
Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering
por: Li, Peize, et al.
Publicado: (2024)
por: Li, Peize, et al.
Publicado: (2024)
EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability
por: Wang, Ziyue, et al.
Publicado: (2025)
por: Wang, Ziyue, et al.
Publicado: (2025)
3DSRBench: A Comprehensive 3D Spatial Reasoning Benchmark
por: Ma, Wufei, et al.
Publicado: (2024)
por: Ma, Wufei, et al.
Publicado: (2024)
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
por: Hong, Yuyang, et al.
Publicado: (2025)
por: Hong, Yuyang, et al.
Publicado: (2025)
Multi-granularity Correspondence Learning from Long-term Noisy Videos
por: Lin, Yijie, et al.
Publicado: (2024)
por: Lin, Yijie, et al.
Publicado: (2024)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
por: Li, Jiaang, et al.
Publicado: (2025)
por: Li, Jiaang, et al.
Publicado: (2025)
CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension
por: Liu, Lihao, et al.
Publicado: (2026)
por: Liu, Lihao, et al.
Publicado: (2026)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
por: Wang, Zhikai, et al.
Publicado: (2025)
por: Wang, Zhikai, et al.
Publicado: (2025)
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
por: Hao, Xiangzhao, et al.
Publicado: (2026)
por: Hao, Xiangzhao, et al.
Publicado: (2026)
See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering
por: Wang, Junjie, et al.
Publicado: (2025)
por: Wang, Junjie, et al.
Publicado: (2025)
DUDE: Diffusion-Based Unsupervised Cross-Domain Image Retrieval
por: Yang, Ruohong, et al.
Publicado: (2025)
por: Yang, Ruohong, et al.
Publicado: (2025)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
A Benchmark and Knowledge-Grounded Framework for Advanced Multimodal Personalization Study
por: Hu, Xia, et al.
Publicado: (2026)
por: Hu, Xia, et al.
Publicado: (2026)
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
por: Zhang, Xintong, et al.
Publicado: (2026)
por: Zhang, Xintong, et al.
Publicado: (2026)
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
por: Xu, Zhaopan, et al.
Publicado: (2025)
por: Xu, Zhaopan, et al.
Publicado: (2025)
SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval
por: Yang, Wenjie, et al.
Publicado: (2026)
por: Yang, Wenjie, et al.
Publicado: (2026)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
por: Ji, Yuheng, et al.
Publicado: (2025)
por: Ji, Yuheng, et al.
Publicado: (2025)
Multimodal Fusion SLAM with Fourier Attention
por: Zhou, Youjie, et al.
Publicado: (2025)
por: Zhou, Youjie, et al.
Publicado: (2025)
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
por: Zhou, Yue, et al.
Publicado: (2025)
por: Zhou, Yue, et al.
Publicado: (2025)
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
por: Kim, Jeonghwan, et al.
Publicado: (2026)
por: Kim, Jeonghwan, et al.
Publicado: (2026)
Ejemplares similares
-
Reliable Thinking with Images
por: Li, Haobin, et al.
Publicado: (2026) -
LLaVA-ReID: Selective Multi-image Questioner for Interactive Person Re-Identification
por: Lu, Yiding, et al.
Publicado: (2025) -
Decoupled Contrastive Multi-View Clustering with High-Order Random Walks
por: Lu, Yiding, et al.
Publicado: (2023) -
A Survey on Deep Clustering: From the Prior Perspective
por: Lu, Yiding, et al.
Publicado: (2024) -
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
por: Tian, Yuxin, et al.
Publicado: (2024)