Efficient Multimodal Planning Agent for Visual Question-Answering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Zhuo, Geng, Xinyu, Wang, Xinyu, Jiang, Yong, Zhang, Zhen, Xie, Pengjun, Tu, Kewei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Improving Retrieval Augmented Open-Domain Question-Answering with Vectorized Contexts
von: Chen, Zhuo, et al.
Veröffentlicht: (2024)
von: Chen, Zhuo, et al.
Veröffentlicht: (2024)
Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference
von: Chen, Zhuo, et al.
Veröffentlicht: (2025)
von: Chen, Zhuo, et al.
Veröffentlicht: (2025)
Let LLMs Take on the Latest Challenges! A Chinese Dynamic Question Answering Benchmark
von: Xu, Zhikun, et al.
Veröffentlicht: (2024)
von: Xu, Zhikun, et al.
Veröffentlicht: (2024)
Learning Robust Named Entity Recognizers From Noisy Data With Retrieval Augmentation
von: Ai, Chaoyi, et al.
Veröffentlicht: (2024)
von: Ai, Chaoyi, et al.
Veröffentlicht: (2024)
Repurposing Synthetic Data for Fine-grained Search Agent Supervision
von: Zhao, Yida, et al.
Veröffentlicht: (2025)
von: Zhao, Yida, et al.
Veröffentlicht: (2025)
AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
von: Chen, Xuanzhong, et al.
Veröffentlicht: (2025)
von: Chen, Xuanzhong, et al.
Veröffentlicht: (2025)
An Entity Linking Agent for Question Answering
von: Luo, Yajie, et al.
Veröffentlicht: (2025)
von: Luo, Yajie, et al.
Veröffentlicht: (2025)
Using Interpretation Methods for Model Enhancement
von: Chen, Zhuo, et al.
Veröffentlicht: (2024)
von: Chen, Zhuo, et al.
Veröffentlicht: (2024)
KBM: Delineating Knowledge Boundary for Adaptive Retrieval in Large Language Models
von: Zhang, Zhen, et al.
Veröffentlicht: (2024)
von: Zhang, Zhen, et al.
Veröffentlicht: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
EvolveSearch: An Iterative Self-Evolving Search Agent
von: Zhang, Dingchu, et al.
Veröffentlicht: (2025)
von: Zhang, Dingchu, et al.
Veröffentlicht: (2025)
Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent
von: Li, Yangning, et al.
Veröffentlicht: (2024)
von: Li, Yangning, et al.
Veröffentlicht: (2024)
Text to Query Plans for Question Answering on Large Tables
von: Zhang, Yipeng, et al.
Veröffentlicht: (2025)
von: Zhang, Yipeng, et al.
Veröffentlicht: (2025)
ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
von: Kaur, Rachneet, et al.
Veröffentlicht: (2025)
von: Kaur, Rachneet, et al.
Veröffentlicht: (2025)
WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning
von: Yu, Xinmiao, et al.
Veröffentlicht: (2026)
von: Yu, Xinmiao, et al.
Veröffentlicht: (2026)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
von: Su, Tongkun, et al.
Veröffentlicht: (2024)
von: Su, Tongkun, et al.
Veröffentlicht: (2024)
OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering
von: Zhu, Yifan, et al.
Veröffentlicht: (2026)
von: Zhu, Yifan, et al.
Veröffentlicht: (2026)
LIVE: Learnable In-Context Vector for Visual Question Answering
von: Peng, Yingzhe, et al.
Veröffentlicht: (2024)
von: Peng, Yingzhe, et al.
Veröffentlicht: (2024)
ProductAgent: Benchmarking Conversational Product Search Agent with Asking Clarification Questions
von: Ye, Jingheng, et al.
Veröffentlicht: (2024)
von: Ye, Jingheng, et al.
Veröffentlicht: (2024)
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
von: Huang, Shijue, et al.
Veröffentlicht: (2026)
von: Huang, Shijue, et al.
Veröffentlicht: (2026)
Unfolding the Headline: Iterative Self-Questioning for News Retrieval and Timeline Summarization
von: Wu, Weiqi, et al.
Veröffentlicht: (2025)
von: Wu, Weiqi, et al.
Veröffentlicht: (2025)
Layer-Condensed KV Cache for Efficient Inference of Large Language Models
von: Wu, Haoyi, et al.
Veröffentlicht: (2024)
von: Wu, Haoyi, et al.
Veröffentlicht: (2024)
Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question Answering
von: Zhou, Wei, et al.
Veröffentlicht: (2024)
von: Zhou, Wei, et al.
Veröffentlicht: (2024)
Multimodal Reranking for Knowledge-Intensive Visual Question Answering
von: Wen, Haoyang, et al.
Veröffentlicht: (2024)
von: Wen, Haoyang, et al.
Veröffentlicht: (2024)
Multimodal Commonsense Knowledge Distillation for Visual Question Answering
von: Yang, Shuo, et al.
Veröffentlicht: (2024)
von: Yang, Shuo, et al.
Veröffentlicht: (2024)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
von: Zhou, Ao, et al.
Veröffentlicht: (2025)
von: Zhou, Ao, et al.
Veröffentlicht: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
von: Chen, Peiyuan, et al.
Veröffentlicht: (2024)
von: Chen, Peiyuan, et al.
Veröffentlicht: (2024)
Understanding Multimodal LLMs: the Mechanistic Interpretability of Llava in Visual Question Answering
von: Yu, Zeping, et al.
Veröffentlicht: (2024)
von: Yu, Zeping, et al.
Veröffentlicht: (2024)
DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards
von: Kartha, Aaryaman, et al.
Veröffentlicht: (2025)
von: Kartha, Aaryaman, et al.
Veröffentlicht: (2025)
Multimodal Integration of Human-Like Attention in Visual Question Answering
von: Sood, Ekta, et al.
Veröffentlicht: (2021)
von: Sood, Ekta, et al.
Veröffentlicht: (2021)
PASemiQA: Plan-Assisted Agent for Question Answering on Semi-Structured Data with Text and Relational Information
von: Yang, Hansi, et al.
Veröffentlicht: (2025)
von: Yang, Hansi, et al.
Veröffentlicht: (2025)
WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents
von: Qiao, Zile, et al.
Veröffentlicht: (2025)
von: Qiao, Zile, et al.
Veröffentlicht: (2025)
DRESSing Up LLM: Efficient Stylized Question-Answering via Style Subspace Editing
von: Ma, Xinyu, et al.
Veröffentlicht: (2025)
von: Ma, Xinyu, et al.
Veröffentlicht: (2025)
Agent Planning with World Knowledge Model
von: Qiao, Shuofei, et al.
Veröffentlicht: (2024)
von: Qiao, Shuofei, et al.
Veröffentlicht: (2024)
O$^2$-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
von: Mei, Jianbiao, et al.
Veröffentlicht: (2025)
von: Mei, Jianbiao, et al.
Veröffentlicht: (2025)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
von: Zhang, Jiarui, et al.
Veröffentlicht: (2023)
von: Zhang, Jiarui, et al.
Veröffentlicht: (2023)
Self-Improvement Programming for Temporal Knowledge Graph Question Answering
von: Chen, Zhuo, et al.
Veröffentlicht: (2024)
von: Chen, Zhuo, et al.
Veröffentlicht: (2024)
Exploring Diverse Methods in Visual Question Answering
von: Li, Panfeng, et al.
Veröffentlicht: (2024)
von: Li, Panfeng, et al.
Veröffentlicht: (2024)
MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering
von: Yang, Shuo, et al.
Veröffentlicht: (2025)
von: Yang, Shuo, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Improving Retrieval Augmented Open-Domain Question-Answering with Vectorized Contexts
von: Chen, Zhuo, et al.
Veröffentlicht: (2024) -
Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference
von: Chen, Zhuo, et al.
Veröffentlicht: (2025) -
Let LLMs Take on the Latest Challenges! A Chinese Dynamic Question Answering Benchmark
von: Xu, Zhikun, et al.
Veröffentlicht: (2024) -
Learning Robust Named Entity Recognizers From Noisy Data With Retrieval Augmentation
von: Ai, Chaoyi, et al.
Veröffentlicht: (2024) -
Repurposing Synthetic Data for Fine-grained Search Agent Supervision
von: Zhao, Yida, et al.
Veröffentlicht: (2025)