First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Enming, Yao, Ruobing, Liu, Huanyong, Yu, Junhui, Wang, Jiale |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding
di: Pan, Huitong, et al.
Pubblicazione: (2024)
di: Pan, Huitong, et al.
Pubblicazione: (2024)
FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts
di: Zhang, Ziyi, et al.
Pubblicazione: (2025)
di: Zhang, Ziyi, et al.
Pubblicazione: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)
di: Li, Jingyao, et al.
Pubblicazione: (2025)
JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models
di: Sasaki, Hiroshi
Pubblicazione: (2026)
di: Sasaki, Hiroshi
Pubblicazione: (2026)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
di: Zhou, Baichuan, et al.
Pubblicazione: (2024)
di: Zhou, Baichuan, et al.
Pubblicazione: (2024)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
di: Zhang, Enming, et al.
Pubblicazione: (2025)
di: Zhang, Enming, et al.
Pubblicazione: (2025)
Evolving Prompt Adaptation for Vision-Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2026)
di: Zhang, Enming, et al.
Pubblicazione: (2026)
PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection
di: Jiang, Xi, et al.
Pubblicazione: (2024)
di: Jiang, Xi, et al.
Pubblicazione: (2024)
Zero-Training Task-Specific Model Synthesis for Few-Shot Medical Image Classification
di: Qin, Yao, et al.
Pubblicazione: (2025)
di: Qin, Yao, et al.
Pubblicazione: (2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
Is Contrastive Distillation Enough for Learning Comprehensive 3D Representations?
di: Zhang, Yifan, et al.
Pubblicazione: (2024)
di: Zhang, Yifan, et al.
Pubblicazione: (2024)
An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation
di: Nguyen, Giang Son, et al.
Pubblicazione: (2026)
di: Nguyen, Giang Son, et al.
Pubblicazione: (2026)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
di: Cui, Yiming, et al.
Pubblicazione: (2025)
di: Cui, Yiming, et al.
Pubblicazione: (2025)
FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026)
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
di: Wang, Sibo, et al.
Pubblicazione: (2024)
di: Wang, Sibo, et al.
Pubblicazione: (2024)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
di: Song, Shezheng, et al.
Pubblicazione: (2024)
di: Song, Shezheng, et al.
Pubblicazione: (2024)
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
di: Yao, Xincheng, et al.
Pubblicazione: (2026)
di: Yao, Xincheng, et al.
Pubblicazione: (2026)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
di: Zou, Heqing, et al.
Pubblicazione: (2024)
di: Zou, Heqing, et al.
Pubblicazione: (2024)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
di: Zhang, Fan, et al.
Pubblicazione: (2025)
di: Zhang, Fan, et al.
Pubblicazione: (2025)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
A Survey on Evaluation of Multimodal Large Language Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models
di: Wang, Jiale, et al.
Pubblicazione: (2026)
di: Wang, Jiale, et al.
Pubblicazione: (2026)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
di: Wen, Zichen, et al.
Pubblicazione: (2026)
di: Wen, Zichen, et al.
Pubblicazione: (2026)
A Survey on Agentic Multimodal Large Language Models
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
Efficient Multimodal Large Language Models: A Survey
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
di: Li, Yinghui, et al.
Pubblicazione: (2026)
di: Li, Yinghui, et al.
Pubblicazione: (2026)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
di: Ai, Wei, et al.
Pubblicazione: (2026)
di: Ai, Wei, et al.
Pubblicazione: (2026)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
di: Zou, Junbo, et al.
Pubblicazione: (2025)
di: Zou, Junbo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding
di: Pan, Huitong, et al.
Pubblicazione: (2024) -
FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts
di: Zhang, Ziyi, et al.
Pubblicazione: (2025) -
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025) -
JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models
di: Sasaki, Hiroshi
Pubblicazione: (2026) -
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
di: Chen, Qian, et al.
Pubblicazione: (2026)