mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Tao, Zhang, Ziqi, Ma, Zongyang, Chen, Yuxin, Qi, Zhongang, Yuan, Chunfeng, Li, Bing, Pu, Junfu, Zhao, Yuxuan, Xie, Zehua, Ma, Jin, Shan, Ying, Hu, Weiming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
EA-VTR: Event-Aware Video-Text Retrieval
di: Ma, Zongyang, et al.
Pubblicazione: (2024)
di: Ma, Zongyang, et al.
Pubblicazione: (2024)
MMhops-R1: Multimodal Multi-hop Reasoning
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
DetailFusion: A Dual-branch Framework with Detail Enhancement for Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2025)
di: Yang, Yuxin, et al.
Pubblicazione: (2025)
Taming Rectified Flow for Inversion and Editing
di: Wang, Jiangshan, et al.
Pubblicazione: (2024)
di: Wang, Jiangshan, et al.
Pubblicazione: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
di: Pu, Junfu, et al.
Pubblicazione: (2026)
di: Pu, Junfu, et al.
Pubblicazione: (2026)
mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA
di: Yuan, Xu, et al.
Pubblicazione: (2025)
di: Yuan, Xu, et al.
Pubblicazione: (2025)
E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
di: Anugraha, David, et al.
Pubblicazione: (2025)
di: Anugraha, David, et al.
Pubblicazione: (2025)
R^2AG: Incorporating Retrieval Information into Retrieval Augmented Generation
di: Ye, Fuda, et al.
Pubblicazione: (2024)
di: Ye, Fuda, et al.
Pubblicazione: (2024)
Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
R^3AG: First Workshop on Refined and Reliable Retrieval Augmented Generation
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
R$^3$AG: Retriever Routing for Retrieval-Augmented Generation
di: Zhao, Tong, et al.
Pubblicazione: (2026)
di: Zhao, Tong, et al.
Pubblicazione: (2026)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
di: Ning, Shan, et al.
Pubblicazione: (2026)
di: Ning, Shan, et al.
Pubblicazione: (2026)
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025)
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025)
I2VWM: Robust Watermarking for Image to Video Generation
di: Wang, Guanjie, et al.
Pubblicazione: (2025)
di: Wang, Guanjie, et al.
Pubblicazione: (2025)
SPSW: Database Watermarking Based on Fake Tuples and Sparse Priority Strategy
di: Ren, Zhiwen, et al.
Pubblicazione: (2024)
di: Ren, Zhiwen, et al.
Pubblicazione: (2024)
How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
di: Chen, Yuzhuo, et al.
Pubblicazione: (2025)
di: Chen, Yuzhuo, et al.
Pubblicazione: (2025)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
di: Lu, Yifan, et al.
Pubblicazione: (2023)
di: Lu, Yifan, et al.
Pubblicazione: (2023)
Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent
di: Li, Yangning, et al.
Pubblicazione: (2024)
di: Li, Yangning, et al.
Pubblicazione: (2024)
Entanglement Entropy of Massive Scalar Fields: Mass Suppression, Violation of Universal mR Scaling, and Implications for Black Hole Thermodynamics
di: Bellucci, S., et al.
Pubblicazione: (2026)
di: Bellucci, S., et al.
Pubblicazione: (2026)
KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA
di: Yang, Fan, et al.
Pubblicazione: (2026)
di: Yang, Fan, et al.
Pubblicazione: (2026)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
di: Lu, Yifan, et al.
Pubblicazione: (2025)
di: Lu, Yifan, et al.
Pubblicazione: (2025)
SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs
di: Su, Xin, et al.
Pubblicazione: (2024)
di: Su, Xin, et al.
Pubblicazione: (2024)
Natural Language Processing with Commonsense Knowledge: A Survey
di: Xie, Yubo, et al.
Pubblicazione: (2021)
di: Xie, Yubo, et al.
Pubblicazione: (2021)
RAGTrace: Understanding and Refining Retrieval-Generation Dynamics in Retrieval-Augmented Generation
di: Cheng, Sizhe, et al.
Pubblicazione: (2025)
di: Cheng, Sizhe, et al.
Pubblicazione: (2025)
SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
di: Tan, Chaolei, et al.
Pubblicazione: (2024)
di: Tan, Chaolei, et al.
Pubblicazione: (2024)
TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity
di: Chen, Yuzhuo, et al.
Pubblicazione: (2025)
di: Chen, Yuzhuo, et al.
Pubblicazione: (2025)
SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models
di: Yang, Yang, et al.
Pubblicazione: (2026)
di: Yang, Yang, et al.
Pubblicazione: (2026)
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
di: Pu, Junfu, et al.
Pubblicazione: (2025)
di: Pu, Junfu, et al.
Pubblicazione: (2025)
Enhancing Document VQA Models via Retrieval-Augmented Generation
di: López, Eric, et al.
Pubblicazione: (2025)
di: López, Eric, et al.
Pubblicazione: (2025)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
Seeing through the Conflict: Transparent Knowledge Conflict Handling in Retrieval-Augmented Generation
di: Ye, Hua, et al.
Pubblicazione: (2026)
di: Ye, Hua, et al.
Pubblicazione: (2026)
DOGR: Towards Versatile Visual Document Grounding and Referring
di: Zhou, Yinan, et al.
Pubblicazione: (2024)
di: Zhou, Yinan, et al.
Pubblicazione: (2024)
Large Language Models Meet Text-Centric Multimodal Sentiment Analysis: A Survey
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
di: Chen, Yuxin, et al.
Pubblicazione: (2024) -
EA-VTR: Event-Aware Video-Text Retrieval
di: Ma, Zongyang, et al.
Pubblicazione: (2024) -
MMhops-R1: Multimodal Multi-hop Reasoning
di: Zhang, Tao, et al.
Pubblicazione: (2025) -
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2026) -
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)