AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, Kang, Zhong, Guojin, Cheng, Jintao, Yuan, Jin, Li, Zhiyong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)
por: Zeng, Xingchen, et al.
Publicado: (2024)
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
por: Li, Zongmin, et al.
Publicado: (2026)
por: Li, Zongmin, et al.
Publicado: (2026)
MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
por: Xu, Quanxing, et al.
Publicado: (2026)
por: Xu, Quanxing, et al.
Publicado: (2026)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
por: Lee, Jusung, et al.
Publicado: (2024)
por: Lee, Jusung, et al.
Publicado: (2024)
Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering
por: Li, Peize, et al.
Publicado: (2024)
por: Li, Peize, et al.
Publicado: (2024)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
por: Xu, Pusheng, et al.
Publicado: (2025)
por: Xu, Pusheng, et al.
Publicado: (2025)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
por: Xu, Quanxing, et al.
Publicado: (2026)
por: Xu, Quanxing, et al.
Publicado: (2026)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
por: Lim, Qi Zhi, et al.
Publicado: (2025)
por: Lim, Qi Zhi, et al.
Publicado: (2025)
Visually Interpretable Subtask Reasoning for Visual Question Answering
por: Cheng, Yu, et al.
Publicado: (2025)
por: Cheng, Yu, et al.
Publicado: (2025)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)
por: Lee, Dosung, et al.
Publicado: (2025)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
por: Su, Tongkun, et al.
Publicado: (2024)
por: Su, Tongkun, et al.
Publicado: (2024)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
por: Chen, Peiyuan, et al.
Publicado: (2024)
por: Chen, Peiyuan, et al.
Publicado: (2024)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
por: Xue, Junxiao, et al.
Publicado: (2024)
por: Xue, Junxiao, et al.
Publicado: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
por: Siripong, Surasakdi, et al.
Publicado: (2024)
por: Siripong, Surasakdi, et al.
Publicado: (2024)
Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism
por: Kang, Lei, et al.
Publicado: (2024)
por: Kang, Lei, et al.
Publicado: (2024)
SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
por: Patel, Alkesh, et al.
Publicado: (2025)
por: Patel, Alkesh, et al.
Publicado: (2025)
Multimodal Integration of Human-Like Attention in Visual Question Answering
por: Sood, Ekta, et al.
Publicado: (2021)
por: Sood, Ekta, et al.
Publicado: (2021)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
por: Kil, Jihyung, et al.
Publicado: (2024)
por: Kil, Jihyung, et al.
Publicado: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
por: Ma, Jiatong, et al.
Publicado: (2026)
por: Ma, Jiatong, et al.
Publicado: (2026)
Questioning the Stability of Visual Question Answering
por: Rosenfeld, Amir, et al.
Publicado: (2025)
por: Rosenfeld, Amir, et al.
Publicado: (2025)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
por: Peng, Jingwei, et al.
Publicado: (2025)
por: Peng, Jingwei, et al.
Publicado: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
por: Li, Chuanhao, et al.
Publicado: (2025)
por: Li, Chuanhao, et al.
Publicado: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
por: Choi, Changin, et al.
Publicado: (2025)
por: Choi, Changin, et al.
Publicado: (2025)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
por: Wang, Yuduo, et al.
Publicado: (2023)
por: Wang, Yuduo, et al.
Publicado: (2023)
CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering
por: Huai, Tianyu, et al.
Publicado: (2025)
por: Huai, Tianyu, et al.
Publicado: (2025)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
por: Xu, Quanxing, et al.
Publicado: (2025)
por: Xu, Quanxing, et al.
Publicado: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
por: Movva, Prahitha, et al.
Publicado: (2025)
por: Movva, Prahitha, et al.
Publicado: (2025)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
por: Srivastava, Varun, et al.
Publicado: (2025)
por: Srivastava, Varun, et al.
Publicado: (2025)
A Visual Question Answering Method for SAR Ship: Breaking the Requirement for Multimodal Dataset Construction and Model Fine-Tuning
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
por: Shah, Monika, et al.
Publicado: (2025)
por: Shah, Monika, et al.
Publicado: (2025)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
Visual Question Decomposition on Multimodal Large Language Models
por: Zhang, Haowei, et al.
Publicado: (2024)
por: Zhang, Haowei, et al.
Publicado: (2024)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
por: Meng, Yiran, et al.
Publicado: (2025)
por: Meng, Yiran, et al.
Publicado: (2025)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
por: An, Wenbin, et al.
Publicado: (2024)
por: An, Wenbin, et al.
Publicado: (2024)
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
por: Ukai, Mahiro, et al.
Publicado: (2024)
por: Ukai, Mahiro, et al.
Publicado: (2024)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
por: Kuang, Jiayi, et al.
Publicado: (2024)
por: Kuang, Jiayi, et al.
Publicado: (2024)
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
por: Van-Dinh, Tue-Thu, et al.
Publicado: (2025)
por: Van-Dinh, Tue-Thu, et al.
Publicado: (2025)
Ejemplares similares
-
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024) -
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
por: Li, Zongmin, et al.
Publicado: (2026) -
MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
por: Xu, Quanxing, et al.
Publicado: (2026) -
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
por: Lee, Jusung, et al.
Publicado: (2024) -
Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering
por: Li, Peize, et al.
Publicado: (2024)