VLM-SlideEval: Evaluating VLMs on Structured Comprehension and Perturbation Sensitivity in PPT
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kang, Hyeonsu, Bao, Emily, Goswami, Anjan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis
par: Li, Frank, et autres
Publié: (2025)
par: Li, Frank, et autres
Publié: (2025)
Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
par: Pani, Anupam, et autres
Publié: (2025)
par: Pani, Anupam, et autres
Publié: (2025)
BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant Learning
par: Wang, Shengao, et autres
Publié: (2025)
par: Wang, Shengao, et autres
Publié: (2025)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging
par: Kang, Inha, et autres
Publié: (2025)
par: Kang, Inha, et autres
Publié: (2025)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
par: Pan, Jiazhen, et autres
Publié: (2025)
par: Pan, Jiazhen, et autres
Publié: (2025)
Evaluating Compositional Generalisation in VLMs and Diffusion Models
par: Pearson, Beth, et autres
Publié: (2025)
par: Pearson, Beth, et autres
Publié: (2025)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
par: He, Zheqi, et autres
Publié: (2025)
par: He, Zheqi, et autres
Publié: (2025)
Replace-then-Perturb: Targeted Adversarial Attacks With Visual Reasoning for Vision-Language Models
par: Jang, Jonggyu, et autres
Publié: (2024)
par: Jang, Jonggyu, et autres
Publié: (2024)
An Empirical Analysis of VLM-based OOD Detection: Mechanisms, Advantages, and Sensitivity
par: Lee, Yuxiao, et autres
Publié: (2025)
par: Lee, Yuxiao, et autres
Publié: (2025)
Trust but Verify: Programmatic VLM Evaluation in the Wild
par: Prabhu, Viraj, et autres
Publié: (2024)
par: Prabhu, Viraj, et autres
Publié: (2024)
RoboEval: Where Robotic Manipulation Meets Structured and Scalable Evaluation
par: Wang, Yi Ru, et autres
Publié: (2025)
par: Wang, Yi Ru, et autres
Publié: (2025)
VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?
par: Kim, Minkyu, et autres
Publié: (2026)
par: Kim, Minkyu, et autres
Publié: (2026)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
par: Saxena, Rohit, et autres
Publié: (2026)
par: Saxena, Rohit, et autres
Publié: (2026)
EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation
par: Han, Shuhao, et autres
Publié: (2024)
par: Han, Shuhao, et autres
Publié: (2024)
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
par: Jian, Ai, et autres
Publié: (2025)
par: Jian, Ai, et autres
Publié: (2025)
DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice
par: Meng, Zijie, et autres
Publié: (2025)
par: Meng, Zijie, et autres
Publié: (2025)
Sim2Radar: Toward Bridging the Radar Sim-to-Real Gap with VLM-Guided Scene Reconstruction
par: Bejerano, Emily, et autres
Publié: (2026)
par: Bejerano, Emily, et autres
Publié: (2026)
GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
par: Kamath, Amita, et autres
Publié: (2025)
par: Kamath, Amita, et autres
Publié: (2025)
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
par: Peng, Tianhao, et autres
Publié: (2025)
par: Peng, Tianhao, et autres
Publié: (2025)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
par: Faraz, Ali, et autres
Publié: (2025)
par: Faraz, Ali, et autres
Publié: (2025)
Drive-KD: Multi-Teacher Distillation for VLMs in Autonomous Driving
par: Lian, Weitong, et autres
Publié: (2026)
par: Lian, Weitong, et autres
Publié: (2026)
Value-Guided Iterative Refinement and the DIQ-H Benchmark for Evaluating VLM Robustness
par: Wan, Hanwen, et autres
Publié: (2025)
par: Wan, Hanwen, et autres
Publié: (2025)
Beyond the Pixels: VLM-based Evaluation of Identity Preservation in Reference-Guided Synthesis
par: Singhania, Aditi, et autres
Publié: (2025)
par: Singhania, Aditi, et autres
Publié: (2025)
Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs
par: Zaazou, Youssef, et autres
Publié: (2026)
par: Zaazou, Youssef, et autres
Publié: (2026)
Caption This, Reason That: VLMs Caught in the Middle
par: Weng, Zihan, et autres
Publié: (2025)
par: Weng, Zihan, et autres
Publié: (2025)
Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models
par: Jiang, Yifan, et autres
Publié: (2025)
par: Jiang, Yifan, et autres
Publié: (2025)
edgeVLM: Cloud-edge Collaborative Real-time VLM based on Context Transfer
par: Qian, Chen, et autres
Publié: (2025)
par: Qian, Chen, et autres
Publié: (2025)
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
par: Singh, Aditya Kumar, et autres
Publié: (2026)
par: Singh, Aditya Kumar, et autres
Publié: (2026)
Empowering Semantic-Sensitive Underwater Image Enhancement with VLM
par: Fan, Guodong, et autres
Publié: (2026)
par: Fan, Guodong, et autres
Publié: (2026)
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis
par: Kang, Donggoo, et autres
Publié: (2024)
par: Kang, Donggoo, et autres
Publié: (2024)
VACoT: Rethinking Visual Data Augmentation with VLMs
par: Xu, Zhengzhuo, et autres
Publié: (2025)
par: Xu, Zhengzhuo, et autres
Publié: (2025)
Listener-Rewarded Thinking in VLMs for Image Preferences
par: Gambashidze, Alexander, et autres
Publié: (2025)
par: Gambashidze, Alexander, et autres
Publié: (2025)
ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery
par: Shrivastava, Ayush, et autres
Publié: (2026)
par: Shrivastava, Ayush, et autres
Publié: (2026)
VLM6D: VLM based 6Dof Pose Estimation based on RGB-D Images
par: Sarowar, Md Selim, et autres
Publié: (2025)
par: Sarowar, Md Selim, et autres
Publié: (2025)
AI-Generated Lecture Slides for Improving Slide Element Detection and Retrieval
par: Maniyar, Suyash, et autres
Publié: (2025)
par: Maniyar, Suyash, et autres
Publié: (2025)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
par: Zhang, Yiman, et autres
Publié: (2025)
par: Zhang, Yiman, et autres
Publié: (2025)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
par: Ge, Yuyao, et autres
Publié: (2025)
par: Ge, Yuyao, et autres
Publié: (2025)
Towards Lossless Ultimate Vision Token Compression for VLMs
par: Zheng, Dehua, et autres
Publié: (2025)
par: Zheng, Dehua, et autres
Publié: (2025)
Documents similaires
-
Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis
par: Li, Frank, et autres
Publié: (2025) -
Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
par: Pani, Anupam, et autres
Publié: (2025) -
BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant Learning
par: Wang, Shengao, et autres
Publié: (2025) -
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025) -
What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging
par: Kang, Inha, et autres
Publié: (2025)