Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Xingchen, Lin, Haichuan, Ye, Yilin, Zeng, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
di: Xie, Tianchi, et al.
Pubblicazione: (2025)
di: Xie, Tianchi, et al.
Pubblicazione: (2025)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
di: Wu, Yifan, et al.
Pubblicazione: (2024)
di: Wu, Yifan, et al.
Pubblicazione: (2024)
ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
di: Kaur, Rachneet, et al.
Pubblicazione: (2025)
di: Kaur, Rachneet, et al.
Pubblicazione: (2025)
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
di: Zeng, Kang, et al.
Pubblicazione: (2025)
di: Zeng, Kang, et al.
Pubblicazione: (2025)
ModalChorus: Visual Probing and Alignment of Multi-modal Embeddings via Modal Fusion Map
di: Ye, Yilin, et al.
Pubblicazione: (2024)
di: Ye, Yilin, et al.
Pubblicazione: (2024)
AKRMap: Adaptive Kernel Regression for Trustworthy Visualization of Cross-Modal Embeddings
di: Ye, Yilin, et al.
Pubblicazione: (2025)
di: Ye, Yilin, et al.
Pubblicazione: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025)
di: Xu, Yichen, et al.
Pubblicazione: (2025)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
di: Patel, Alkesh, et al.
Pubblicazione: (2025)
di: Patel, Alkesh, et al.
Pubblicazione: (2025)
Benchmarking Multimodal RAG through a Chart-based Document Question-Answering Generation Framework
di: Yang, Yuming, et al.
Pubblicazione: (2025)
di: Yang, Yuming, et al.
Pubblicazione: (2025)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
di: Zhang, Yan, et al.
Pubblicazione: (2025)
di: Zhang, Yan, et al.
Pubblicazione: (2025)
Speculative Decoding Reimagined for Multimodal Large Language Models
di: Lin, Luxi, et al.
Pubblicazione: (2025)
di: Lin, Luxi, et al.
Pubblicazione: (2025)
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
di: Chen, Lei, et al.
Pubblicazione: (2025)
di: Chen, Lei, et al.
Pubblicazione: (2025)
ChartM$^3$: Benchmarking Chart Editing with Multimodal Instructions
di: Yang, Donglu, et al.
Pubblicazione: (2025)
di: Yang, Donglu, et al.
Pubblicazione: (2025)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question Answering
di: Zeng, Xiyin, et al.
Pubblicazione: (2026)
di: Zeng, Xiyin, et al.
Pubblicazione: (2026)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
di: Shourya, Aditya, et al.
Pubblicazione: (2025)
di: Shourya, Aditya, et al.
Pubblicazione: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
Object Attribute Matters in Visual Question Answering
di: Li, Peize, et al.
Pubblicazione: (2023)
di: Li, Peize, et al.
Pubblicazione: (2023)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
di: Choi, Changin, et al.
Pubblicazione: (2025)
di: Choi, Changin, et al.
Pubblicazione: (2025)
JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models
di: Sasaki, Hiroshi
Pubblicazione: (2026)
di: Sasaki, Hiroshi
Pubblicazione: (2026)
MCITlib: Multimodal Continual Instruction Tuning Library and Benchmark
di: Guo, Haiyang, et al.
Pubblicazione: (2025)
di: Guo, Haiyang, et al.
Pubblicazione: (2025)
ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild
di: Masry, Ahmed, et al.
Pubblicazione: (2024)
di: Masry, Ahmed, et al.
Pubblicazione: (2024)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation
di: Chen, Lei, et al.
Pubblicazione: (2025)
di: Chen, Lei, et al.
Pubblicazione: (2025)
Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering
di: Felizzi, Federico, et al.
Pubblicazione: (2025)
di: Felizzi, Federico, et al.
Pubblicazione: (2025)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
di: Zhang, Jingrui, et al.
Pubblicazione: (2026)
di: Zhang, Jingrui, et al.
Pubblicazione: (2026)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
di: Srivastava, Varun, et al.
Pubblicazione: (2025)
di: Srivastava, Varun, et al.
Pubblicazione: (2025)
Visual Question Decomposition on Multimodal Large Language Models
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
di: Zhang, Yanjie, et al.
Pubblicazione: (2026)
di: Zhang, Yanjie, et al.
Pubblicazione: (2026)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
PathInsight: Instruction Tuning of Multimodal Datasets and Models for Intelligence Assisted Diagnosis in Histopathology
di: Wu, Xiaomin, et al.
Pubblicazione: (2024)
di: Wu, Xiaomin, et al.
Pubblicazione: (2024)
VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning
di: Dong, Mingkang, et al.
Pubblicazione: (2026)
di: Dong, Mingkang, et al.
Pubblicazione: (2026)
CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
di: Han, Hongyong, et al.
Pubblicazione: (2025)
di: Han, Hongyong, et al.
Pubblicazione: (2025)
VoQA: Visual-only Question Answering
di: An, Jianing, et al.
Pubblicazione: (2025)
di: An, Jianing, et al.
Pubblicazione: (2025)
Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning
di: Jung, Ji Hyeok, et al.
Pubblicazione: (2024)
di: Jung, Ji Hyeok, et al.
Pubblicazione: (2024)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
di: Xie, Tianchi, et al.
Pubblicazione: (2025) -
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
di: Wu, Yifan, et al.
Pubblicazione: (2024) -
ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
di: Kaur, Rachneet, et al.
Pubblicazione: (2025) -
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
di: Zeng, Kang, et al.
Pubblicazione: (2025) -
ModalChorus: Visual Probing and Alignment of Multi-modal Embeddings via Modal Fusion Map
di: Ye, Yilin, et al.
Pubblicazione: (2024)