The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors
Fuente:
arXiv
Salvato in:
| Autori principali: | Lucy, Li, Zhang, Albert, Anderson, Nathan, Knight, Ryan, Lo, Kyle |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
di: Baral, Sami, et al.
Pubblicazione: (2025)
di: Baral, Sami, et al.
Pubblicazione: (2025)
EduPersona: Benchmarking Subjective Ability Boundaries of Virtual Student Agents
di: Zhu, Buyuan, et al.
Pubblicazione: (2025)
di: Zhu, Buyuan, et al.
Pubblicazione: (2025)
Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025)
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025)
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models
di: Sathe, Ashutosh, et al.
Pubblicazione: (2024)
di: Sathe, Ashutosh, et al.
Pubblicazione: (2024)
Can Vision-Language Models Evaluate Handwritten Math?
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images
di: Fraser, Kathleen C., et al.
Pubblicazione: (2024)
di: Fraser, Kathleen C., et al.
Pubblicazione: (2024)
Identifying Implicit Social Biases in Vision-Language Models
di: Hamidieh, Kimia, et al.
Pubblicazione: (2024)
di: Hamidieh, Kimia, et al.
Pubblicazione: (2024)
Vision-Language Models under Cultural and Inclusive Considerations
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2024)
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2024)
Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models
di: Zhao, Yuming, et al.
Pubblicazione: (2026)
di: Zhao, Yuming, et al.
Pubblicazione: (2026)
Cultural Awareness in Vision-Language Models: A Cross-Country Exploration
di: Madasu, Avinash, et al.
Pubblicazione: (2025)
di: Madasu, Avinash, et al.
Pubblicazione: (2025)
CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
Debiasing Methods for Fairer Neural Models in Vision and Language Research: A Survey
di: Parraga, Otávio, et al.
Pubblicazione: (2022)
di: Parraga, Otávio, et al.
Pubblicazione: (2022)
VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
di: Kamoi, Ryo, et al.
Pubblicazione: (2024)
di: Kamoi, Ryo, et al.
Pubblicazione: (2024)
Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering
di: Si, Chenglei, et al.
Pubblicazione: (2024)
di: Si, Chenglei, et al.
Pubblicazione: (2024)
Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions
di: Sert, Egemen, et al.
Pubblicazione: (2025)
di: Sert, Egemen, et al.
Pubblicazione: (2025)
Can Vision-Language Models Solve Visual Math Equations?
di: Choudhury, Monjoy Narayan, et al.
Pubblicazione: (2025)
di: Choudhury, Monjoy Narayan, et al.
Pubblicazione: (2025)
Stable Signer: Hierarchical Sign Language Generative Model
di: Fang, Sen, et al.
Pubblicazione: (2025)
di: Fang, Sen, et al.
Pubblicazione: (2025)
EduVerse: A User-Defined Multi-Agent Simulation Space for Education Scenario
di: Ma, Yiping, et al.
Pubblicazione: (2025)
di: Ma, Yiping, et al.
Pubblicazione: (2025)
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
di: Deng, Ken, et al.
Pubblicazione: (2026)
di: Deng, Ken, et al.
Pubblicazione: (2026)
MM-Soc: Benchmarking Multimodal Large Language Models in Social Media Platforms
di: Jin, Yiqiao, et al.
Pubblicazione: (2024)
di: Jin, Yiqiao, et al.
Pubblicazione: (2024)
Large Language Models and Provenance Metadata for Determining the Relevance of Images and Videos in News Stories
di: Peterka, Tomas, et al.
Pubblicazione: (2025)
di: Peterka, Tomas, et al.
Pubblicazione: (2025)
The Use of Multimodal Large Language Models to Detect Objects from Thermal Images: Transportation Applications
di: Ashqar, Huthaifa I., et al.
Pubblicazione: (2024)
di: Ashqar, Huthaifa I., et al.
Pubblicazione: (2024)
FigSIM: A Dataset for Fine-grained Suicide Severity and Figurative Language in Suicide Memes
di: Chen, Liuliu, et al.
Pubblicazione: (2026)
di: Chen, Liuliu, et al.
Pubblicazione: (2026)
Vision Language Models in Medicine
di: Kalpelbe, Beria Chingnabe, et al.
Pubblicazione: (2025)
di: Kalpelbe, Beria Chingnabe, et al.
Pubblicazione: (2025)
olmOCR 2: Unit Test Rewards for Document OCR
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
NegVQA: Can Vision Language Models Understand Negation?
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
LADDER: Language-Driven Slice Discovery and Error Rectification in Vision Classifiers
di: Ghosh, Shantanu, et al.
Pubblicazione: (2024)
di: Ghosh, Shantanu, et al.
Pubblicazione: (2024)
Vision-Language Models Suppress Female Representations Under Ambiguous Input
di: Marin-Llobet, Arnau, et al.
Pubblicazione: (2026)
di: Marin-Llobet, Arnau, et al.
Pubblicazione: (2026)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
AI Sandbagging: Language Models can Strategically Underperform on Evaluations
di: van der Weij, Teun, et al.
Pubblicazione: (2024)
di: van der Weij, Teun, et al.
Pubblicazione: (2024)
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
Dataset Scale and Societal Consistency Mediate Facial Impression Bias in Vision-Language AI
di: Wolfe, Robert, et al.
Pubblicazione: (2024)
di: Wolfe, Robert, et al.
Pubblicazione: (2024)
GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models
di: Wu, Zixuan, et al.
Pubblicazione: (2024)
di: Wu, Zixuan, et al.
Pubblicazione: (2024)
Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models
di: Liu, Zhining, et al.
Pubblicazione: (2026)
di: Liu, Zhining, et al.
Pubblicazione: (2026)
Automated LaTeX Code Generation from Handwritten Math Expressions Using Vision Transformer
di: Sundararaj, Jayaprakash, et al.
Pubblicazione: (2024)
di: Sundararaj, Jayaprakash, et al.
Pubblicazione: (2024)
Describing Differences in Image Sets with Natural Language
di: Dunlap, Lisa, et al.
Pubblicazione: (2023)
di: Dunlap, Lisa, et al.
Pubblicazione: (2023)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
di: Zou, Chengke, et al.
Pubblicazione: (2024)
di: Zou, Chengke, et al.
Pubblicazione: (2024)
Semantic and Expressive Variation in Image Captions Across Languages
di: Ye, Andre, et al.
Pubblicazione: (2023)
di: Ye, Andre, et al.
Pubblicazione: (2023)
ViSAGe: A Global-Scale Analysis of Visual Stereotypes in Text-to-Image Generation
di: Jha, Akshita, et al.
Pubblicazione: (2024)
di: Jha, Akshita, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
di: Baral, Sami, et al.
Pubblicazione: (2025) -
EduPersona: Benchmarking Subjective Ability Boundaries of Virtual Student Agents
di: Zhu, Buyuan, et al.
Pubblicazione: (2025) -
Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025) -
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models
di: Sathe, Ashutosh, et al.
Pubblicazione: (2024) -
Can Vision-Language Models Evaluate Handwritten Math?
di: Nath, Oikantik, et al.
Pubblicazione: (2025)