PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Haller, Patrick, Barth, Fabio, Golde, Jonas, Rehm, Georg, Akbik, Alan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sample-Efficient Language Modeling with Linear Attention and Lightweight Enhancements
di: Haller, Patrick, et al.
Pubblicazione: (2025)
di: Haller, Patrick, et al.
Pubblicazione: (2025)
What Matters in Linearizing Language Models? A Comparative Study of Architecture, Scale, and Task Adaptation
di: Haller, Patrick, et al.
Pubblicazione: (2025)
di: Haller, Patrick, et al.
Pubblicazione: (2025)
PECC: Problem Extraction and Coding Challenges
di: Haller, Patrick, et al.
Pubblicazione: (2024)
di: Haller, Patrick, et al.
Pubblicazione: (2024)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2025)
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2025)
What Matters When Building Universal Multilingual Named Entity Recognition Models?
di: Golde, Jonas, et al.
Pubblicazione: (2026)
di: Golde, Jonas, et al.
Pubblicazione: (2026)
FiNERweb: Datasets and Artifacts for Scalable Multilingual Named Entity Recognition
di: Golde, Jonas, et al.
Pubblicazione: (2025)
di: Golde, Jonas, et al.
Pubblicazione: (2025)
MastermindEval: A Simple But Scalable Reasoning Benchmark
di: Golde, Jonas, et al.
Pubblicazione: (2025)
di: Golde, Jonas, et al.
Pubblicazione: (2025)
Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMs
di: Golde, Jonas, et al.
Pubblicazione: (2023)
di: Golde, Jonas, et al.
Pubblicazione: (2023)
LocateBench: Evaluating the Locating Ability of Vision Language Models
di: Chiang, Ting-Rui, et al.
Pubblicazione: (2024)
di: Chiang, Ting-Rui, et al.
Pubblicazione: (2024)
BabyHGRN: Exploring RNNs for Sample-Efficient Training of Language Models
di: Haller, Patrick, et al.
Pubblicazione: (2024)
di: Haller, Patrick, et al.
Pubblicazione: (2024)
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
di: Wang, Sibo, et al.
Pubblicazione: (2024)
di: Wang, Sibo, et al.
Pubblicazione: (2024)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
di: Lim, Hyeonseok, et al.
Pubblicazione: (2024)
di: Lim, Hyeonseok, et al.
Pubblicazione: (2024)
VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance
di: Taesiri, Mohammad Reza, et al.
Pubblicazione: (2025)
di: Taesiri, Mohammad Reza, et al.
Pubblicazione: (2025)
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
di: Huang, Ruoxiang, et al.
Pubblicazione: (2026)
di: Huang, Ruoxiang, et al.
Pubblicazione: (2026)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
di: Yan, Bei, et al.
Pubblicazione: (2024)
di: Yan, Bei, et al.
Pubblicazione: (2024)
IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
di: Faraz, Ali, et al.
Pubblicazione: (2025)
di: Faraz, Ali, et al.
Pubblicazione: (2025)
DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks
di: Zhou, Haokun, et al.
Pubblicazione: (2024)
di: Zhou, Haokun, et al.
Pubblicazione: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
di: Yuan, Botai, et al.
Pubblicazione: (2025)
di: Yuan, Botai, et al.
Pubblicazione: (2025)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation
di: Raza, Shaina, et al.
Pubblicazione: (2025)
di: Raza, Shaina, et al.
Pubblicazione: (2025)
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
di: Niu, Tianyi, et al.
Pubblicazione: (2025)
di: Niu, Tianyi, et al.
Pubblicazione: (2025)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
di: Li, Hanzheng, et al.
Pubblicazione: (2025)
di: Li, Hanzheng, et al.
Pubblicazione: (2025)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
di: Cai, Jie, et al.
Pubblicazione: (2025)
di: Cai, Jie, et al.
Pubblicazione: (2025)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
di: Saxena, Rohit, et al.
Pubblicazione: (2026)
di: Saxena, Rohit, et al.
Pubblicazione: (2026)
DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models
di: Wang, JiYang, et al.
Pubblicazione: (2026)
di: Wang, JiYang, et al.
Pubblicazione: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024)
di: Bao, Han, et al.
Pubblicazione: (2024)
Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics
di: Roy, Subhadeep, et al.
Pubblicazione: (2026)
di: Roy, Subhadeep, et al.
Pubblicazione: (2026)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
di: Chen, Liang, et al.
Pubblicazione: (2024)
di: Chen, Liang, et al.
Pubblicazione: (2024)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
di: Li, Dingming, et al.
Pubblicazione: (2025)
di: Li, Dingming, et al.
Pubblicazione: (2025)
Jailbreaks on Vision Language Model via Multimodal Reasoning
di: Noheria, Aarush, et al.
Pubblicazione: (2026)
di: Noheria, Aarush, et al.
Pubblicazione: (2026)
PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
di: Guang, Jiahui, et al.
Pubblicazione: (2026)
di: Guang, Jiahui, et al.
Pubblicazione: (2026)
SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals
di: Lin, Zihang, et al.
Pubblicazione: (2026)
di: Lin, Zihang, et al.
Pubblicazione: (2026)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
Mitigating Multilingual Hallucination in Large Vision-Language Models
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Sample-Efficient Language Modeling with Linear Attention and Lightweight Enhancements
di: Haller, Patrick, et al.
Pubblicazione: (2025) -
What Matters in Linearizing Language Models? A Comparative Study of Architecture, Scale, and Task Adaptation
di: Haller, Patrick, et al.
Pubblicazione: (2025) -
PECC: Problem Extraction and Coding Challenges
di: Haller, Patrick, et al.
Pubblicazione: (2024) -
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2025) -
What Matters When Building Universal Multilingual Named Entity Recognition Models?
di: Golde, Jonas, et al.
Pubblicazione: (2026)