JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models
Fuente:
arXiv
Salvato in:
| Autore principale: | Sasaki, Hiroshi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding
di: Pan, Huitong, et al.
Pubblicazione: (2024)
di: Pan, Huitong, et al.
Pubblicazione: (2024)
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2024)
di: Zhang, Enming, et al.
Pubblicazione: (2024)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
di: Zeng, Xingchen, et al.
Pubblicazione: (2024)
di: Zeng, Xingchen, et al.
Pubblicazione: (2024)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
di: Zhang, Yan, et al.
Pubblicazione: (2025)
di: Zhang, Yan, et al.
Pubblicazione: (2025)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
di: Shourya, Aditya, et al.
Pubblicazione: (2025)
di: Shourya, Aditya, et al.
Pubblicazione: (2025)
D3: Data Diversity Design for Systematic Generalization in Visual Question Answering
di: Rahimi, Amir, et al.
Pubblicazione: (2023)
di: Rahimi, Amir, et al.
Pubblicazione: (2023)
AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering
di: Tuong, Nguyen Anh, et al.
Pubblicazione: (2026)
di: Tuong, Nguyen Anh, et al.
Pubblicazione: (2026)
FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026)
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026)
CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
di: Han, Hongyong, et al.
Pubblicazione: (2025)
di: Han, Hongyong, et al.
Pubblicazione: (2025)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering
di: Felizzi, Federico, et al.
Pubblicazione: (2025)
di: Felizzi, Federico, et al.
Pubblicazione: (2025)
Pseudo Contrastive Learning for Diagram Comprehension in Multimodal Models
di: Sasaki, Hiroshi
Pubblicazione: (2026)
di: Sasaki, Hiroshi
Pubblicazione: (2026)
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
di: Zeng, Kang, et al.
Pubblicazione: (2025)
di: Zeng, Kang, et al.
Pubblicazione: (2025)
VoQA: Visual-only Question Answering
di: An, Jianing, et al.
Pubblicazione: (2025)
di: An, Jianing, et al.
Pubblicazione: (2025)
Object Attribute Matters in Visual Question Answering
di: Li, Peize, et al.
Pubblicazione: (2023)
di: Li, Peize, et al.
Pubblicazione: (2023)
Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention
di: Liu, Ying, et al.
Pubblicazione: (2024)
di: Liu, Ying, et al.
Pubblicazione: (2024)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
di: Ahir, Param, et al.
Pubblicazione: (2023)
di: Ahir, Param, et al.
Pubblicazione: (2023)
RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
di: Butsanets, Léo, et al.
Pubblicazione: (2025)
di: Butsanets, Léo, et al.
Pubblicazione: (2025)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
di: Zhang, Junkai, et al.
Pubblicazione: (2025)
di: Zhang, Junkai, et al.
Pubblicazione: (2025)
PlantVillageVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science
di: Sakib, Syed Nazmus, et al.
Pubblicazione: (2025)
di: Sakib, Syed Nazmus, et al.
Pubblicazione: (2025)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
di: Guo, Danfeng, et al.
Pubblicazione: (2024)
di: Guo, Danfeng, et al.
Pubblicazione: (2024)
Free Form Medical Visual Question Answering in Radiology
di: Narayanan, Abhishek, et al.
Pubblicazione: (2024)
di: Narayanan, Abhishek, et al.
Pubblicazione: (2024)
Saliency Guided Longitudinal Medical Visual Question Answering
di: Wu, Jialin, et al.
Pubblicazione: (2025)
di: Wu, Jialin, et al.
Pubblicazione: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
di: Özdemir, Övgü, et al.
Pubblicazione: (2024)
di: Özdemir, Övgü, et al.
Pubblicazione: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
di: Rajkhowa, Tonmoy, et al.
Pubblicazione: (2024)
di: Rajkhowa, Tonmoy, et al.
Pubblicazione: (2024)
Cause-Effect Driven Optimization for Robust Medical Visual Question Answering with Language Biases
di: Zhu, Huanjia, et al.
Pubblicazione: (2025)
di: Zhu, Huanjia, et al.
Pubblicazione: (2025)
Research on Vision-Language Question Answering Models for Industrial Robots
di: Li, Ping, et al.
Pubblicazione: (2026)
di: Li, Ping, et al.
Pubblicazione: (2026)
WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
di: Yu, Seungjun, et al.
Pubblicazione: (2025)
di: Yu, Seungjun, et al.
Pubblicazione: (2025)
Robust Visual Question Answering: Datasets, Methods, and Future Challenges
di: Ma, Jie, et al.
Pubblicazione: (2023)
di: Ma, Jie, et al.
Pubblicazione: (2023)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering
di: Marouf, Imad Eddine, et al.
Pubblicazione: (2025)
di: Marouf, Imad Eddine, et al.
Pubblicazione: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
di: Xi, Suyang, et al.
Pubblicazione: (2026)
di: Xi, Suyang, et al.
Pubblicazione: (2026)
Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering
di: Hagen, Luca, et al.
Pubblicazione: (2026)
di: Hagen, Luca, et al.
Pubblicazione: (2026)
Location-Aware Pretraining for Medical Difference Visual Question Answering
di: Musinguzi, Denis, et al.
Pubblicazione: (2026)
di: Musinguzi, Denis, et al.
Pubblicazione: (2026)
Variational Visual Question Answering for Uncertainty-Aware Selective Prediction
di: Wieczorek, Tobias Jan, et al.
Pubblicazione: (2025)
di: Wieczorek, Tobias Jan, et al.
Pubblicazione: (2025)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
di: Yilmaz, Abdurrahim, et al.
Pubblicazione: (2026)
di: Yilmaz, Abdurrahim, et al.
Pubblicazione: (2026)
Documenti analoghi
-
FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding
di: Pan, Huitong, et al.
Pubblicazione: (2024) -
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2024) -
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
di: Zeng, Xingchen, et al.
Pubblicazione: (2024) -
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
di: Zhang, Yan, et al.
Pubblicazione: (2025) -
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
di: Shourya, Aditya, et al.
Pubblicazione: (2025)