FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Huitong, Zhang, Qi, Caragea, Cornelia, Dragut, Eduard, Latecki, Longin Jan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SciDMT: A Large-Scale Corpus for Detecting Scientific Mentions
di: Pan, Huitong, et al.
Pubblicazione: (2024)
di: Pan, Huitong, et al.
Pubblicazione: (2024)
SciER: An Entity and Relation Extraction Dataset for Datasets, Methods, and Tasks in Scientific Documents
di: Zhang, Qi, et al.
Pubblicazione: (2024)
di: Zhang, Qi, et al.
Pubblicazione: (2024)
DynClean: Training Dynamics-based Label Cleaning for Distantly-Supervised Named Entity Recognition
di: Zhang, Qi, et al.
Pubblicazione: (2025)
di: Zhang, Qi, et al.
Pubblicazione: (2025)
Enhancing Renal Tumor Malignancy Prediction: Deep Learning with Automatic 3D CT Organ Focused Attention
di: Fan, Zhengkang, et al.
Pubblicazione: (2026)
di: Fan, Zhengkang, et al.
Pubblicazione: (2026)
Layout Stroke Imitation: A Layout Guided Handwriting Stroke Generation for Style Imitation with Diffusion Model
di: Hanif, Sidra, et al.
Pubblicazione: (2025)
di: Hanif, Sidra, et al.
Pubblicazione: (2025)
Preserving Localized Patch Semantics in VLMs
di: Esmaeilkhani, Parsa, et al.
Pubblicazione: (2026)
di: Esmaeilkhani, Parsa, et al.
Pubblicazione: (2026)
Direct Visual Grounding by Directing Attention of Visual Tokens
di: Esmaeilkhani, Parsa, et al.
Pubblicazione: (2025)
di: Esmaeilkhani, Parsa, et al.
Pubblicazione: (2025)
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2024)
di: Zhang, Enming, et al.
Pubblicazione: (2024)
Learning Object Focused Attention
di: Trivedy, Vivek, et al.
Pubblicazione: (2025)
di: Trivedy, Vivek, et al.
Pubblicazione: (2025)
JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models
di: Sasaki, Hiroshi
Pubblicazione: (2026)
di: Sasaki, Hiroshi
Pubblicazione: (2026)
CalibrateMix: Guided-Mixup Calibration of Image Semi-Supervised Models
di: Rahman, Mehrab Mustafy, et al.
Pubblicazione: (2025)
di: Rahman, Mehrab Mustafy, et al.
Pubblicazione: (2025)
FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026)
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026)
Querying Climate Knowledge: Semantic Retrieval for Scientific Discovery
di: Adamu, Mustapha, et al.
Pubblicazione: (2025)
di: Adamu, Mustapha, et al.
Pubblicazione: (2025)
VAPO: Visibility-Aware Keypoint Localization for Efficient 6DoF Object Pose Estimation
di: Lian, Ruyi, et al.
Pubblicazione: (2024)
di: Lian, Ruyi, et al.
Pubblicazione: (2024)
Understanding Counting Mechanisms in Large Language and Vision-Language Models
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
Review of Hallucination Understanding in Large Language and Vision Models
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding
di: Omasa, Takamitsu, et al.
Pubblicazione: (2025)
di: Omasa, Takamitsu, et al.
Pubblicazione: (2025)
FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts
di: Zhang, Ziyi, et al.
Pubblicazione: (2025)
di: Zhang, Ziyi, et al.
Pubblicazione: (2025)
An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation
di: Nguyen, Giang Son, et al.
Pubblicazione: (2026)
di: Nguyen, Giang Son, et al.
Pubblicazione: (2026)
In-Context Learning Improves Compositional Understanding of Vision-Language Models
di: Nulli, Matteo, et al.
Pubblicazione: (2024)
di: Nulli, Matteo, et al.
Pubblicazione: (2024)
EdgeFlow: Edge-Map Augmented VLM-Based Flowchart Processing for Industrial Requirements Engineering
di: Dou, Zhifei, et al.
Pubblicazione: (2026)
di: Dou, Zhifei, et al.
Pubblicazione: (2026)
Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries
di: Pranav, Tushar, et al.
Pubblicazione: (2025)
di: Pranav, Tushar, et al.
Pubblicazione: (2025)
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
di: Fu, Teng, et al.
Pubblicazione: (2025)
di: Fu, Teng, et al.
Pubblicazione: (2025)
Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence
di: Rau, Anita, et al.
Pubblicazione: (2025)
di: Rau, Anita, et al.
Pubblicazione: (2025)
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
LL-ICM: Image Compression for Low-level Machine Vision via Large Vision-Language Model
di: Xue, Yuan, et al.
Pubblicazione: (2024)
di: Xue, Yuan, et al.
Pubblicazione: (2024)
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
di: Jin, Juseong, et al.
Pubblicazione: (2024)
di: Jin, Juseong, et al.
Pubblicazione: (2024)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
di: Chen, Shimin, et al.
Pubblicazione: (2024)
di: Chen, Shimin, et al.
Pubblicazione: (2024)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
di: Ji, Yatai, et al.
Pubblicazione: (2024)
di: Ji, Yatai, et al.
Pubblicazione: (2024)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
di: Yan, Bei, et al.
Pubblicazione: (2024)
di: Yan, Bei, et al.
Pubblicazione: (2024)
Environmental Understanding Vision-Language Model for Embodied Agent
di: Bang, Jinsik, et al.
Pubblicazione: (2026)
di: Bang, Jinsik, et al.
Pubblicazione: (2026)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
di: Zhao, Jianfei, et al.
Pubblicazione: (2025)
di: Zhao, Jianfei, et al.
Pubblicazione: (2025)
Medical Large Vision Language Models with Multi-Image Visual Ability
di: Yang, Xikai, et al.
Pubblicazione: (2025)
di: Yang, Xikai, et al.
Pubblicazione: (2025)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
di: Liang, Shuang, et al.
Pubblicazione: (2025)
di: Liang, Shuang, et al.
Pubblicazione: (2025)
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
di: Wang, Sibo, et al.
Pubblicazione: (2024)
di: Wang, Sibo, et al.
Pubblicazione: (2024)
Adapting Vision-Language Models for E-commerce Understanding at Scale
di: Nulli, Matteo, et al.
Pubblicazione: (2026)
di: Nulli, Matteo, et al.
Pubblicazione: (2026)
RAU: Reference-based Anatomical Understanding with Vision Language Models
di: Li, Yiwei, et al.
Pubblicazione: (2025)
di: Li, Yiwei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SciDMT: A Large-Scale Corpus for Detecting Scientific Mentions
di: Pan, Huitong, et al.
Pubblicazione: (2024) -
SciER: An Entity and Relation Extraction Dataset for Datasets, Methods, and Tasks in Scientific Documents
di: Zhang, Qi, et al.
Pubblicazione: (2024) -
DynClean: Training Dynamics-based Label Cleaning for Distantly-Supervised Named Entity Recognition
di: Zhang, Qi, et al.
Pubblicazione: (2025) -
Enhancing Renal Tumor Malignancy Prediction: Deep Learning with Automatic 3D CT Organ Focused Attention
di: Fan, Zhengkang, et al.
Pubblicazione: (2026) -
Layout Stroke Imitation: A Layout Guided Handwriting Stroke Generation for Style Imitation with Diffusion Model
di: Hanif, Sidra, et al.
Pubblicazione: (2025)