KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Yoonshik, Jung, Jaeyoon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
por: Choi, Byungjin, et al.
Publicado: (2026)
por: Choi, Byungjin, et al.
Publicado: (2026)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
por: Lee, Kang-il, et al.
Publicado: (2024)
por: Lee, Kang-il, et al.
Publicado: (2024)
Improving Automatic VQA Evaluation Using Large Language Models
por: Mañas, Oscar, et al.
Publicado: (2023)
por: Mañas, Oscar, et al.
Publicado: (2023)
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
por: Karim, A H M Rezaul, et al.
Publicado: (2025)
por: Karim, A H M Rezaul, et al.
Publicado: (2025)
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
por: Fan, Yue, et al.
Publicado: (2024)
por: Fan, Yue, et al.
Publicado: (2024)
Benchmarking Deflection and Hallucination in Large Vision-Language Models
por: Moratelli, Nicholas, et al.
Publicado: (2026)
por: Moratelli, Nicholas, et al.
Publicado: (2026)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
por: Song, Xiujie, et al.
Publicado: (2024)
por: Song, Xiujie, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
por: Min, Kyungmin, et al.
Publicado: (2024)
por: Min, Kyungmin, et al.
Publicado: (2024)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
por: Huang, Han, et al.
Publicado: (2024)
por: Huang, Han, et al.
Publicado: (2024)
Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity
por: Jung, Jaeyoon, et al.
Publicado: (2026)
por: Jung, Jaeyoon, et al.
Publicado: (2026)
D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI
por: Choi, Suhwan, et al.
Publicado: (2025)
por: Choi, Suhwan, et al.
Publicado: (2025)
CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design
por: Jeong, Daeheon, et al.
Publicado: (2025)
por: Jeong, Daeheon, et al.
Publicado: (2025)
Benchmarking Vision Language Models for Cultural Understanding
por: Nayak, Shravan, et al.
Publicado: (2024)
por: Nayak, Shravan, et al.
Publicado: (2024)
NegVQA: Can Vision Language Models Understand Negation?
por: Zhang, Yuhui, et al.
Publicado: (2025)
por: Zhang, Yuhui, et al.
Publicado: (2025)
Enhancing Financial VQA in Vision Language Models using Intermediate Structured Representations
por: Srivastava, Archita, et al.
Publicado: (2025)
por: Srivastava, Archita, et al.
Publicado: (2025)
LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression
por: Kundu, Souvik, et al.
Publicado: (2025)
por: Kundu, Souvik, et al.
Publicado: (2025)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images
por: Zhang, Yunfei, et al.
Publicado: (2025)
por: Zhang, Yunfei, et al.
Publicado: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
por: Xu, Yichen, et al.
Publicado: (2025)
por: Xu, Yichen, et al.
Publicado: (2025)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
por: Zou, Chengke, et al.
Publicado: (2024)
por: Zou, Chengke, et al.
Publicado: (2024)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
por: Chen, Kesheng, et al.
Publicado: (2026)
por: Chen, Kesheng, et al.
Publicado: (2026)
Evaluating Multimodal Generative AI with Korean Educational Standards
por: Park, Sanghee, et al.
Publicado: (2025)
por: Park, Sanghee, et al.
Publicado: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
por: Lu, Yujie, et al.
Publicado: (2024)
por: Lu, Yujie, et al.
Publicado: (2024)
Benchmarking Multimodal Large Language Models for Face Recognition
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2025)
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2025)
A Survey on Benchmarks of Multimodal Large Language Models
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
Are Large Vision Language Models Good Game Players?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
An Examination of the Compositionality of Large Generative Vision-Language Models
por: Ma, Teli, et al.
Publicado: (2023)
por: Ma, Teli, et al.
Publicado: (2023)
Mitigating Multilingual Hallucination in Large Vision-Language Models
por: Qu, Xiaoye, et al.
Publicado: (2024)
por: Qu, Xiaoye, et al.
Publicado: (2024)
Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation
por: Gao, Qiyue, et al.
Publicado: (2025)
por: Gao, Qiyue, et al.
Publicado: (2025)
MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding
por: Baek, Jeonghun, et al.
Publicado: (2025)
por: Baek, Jeonghun, et al.
Publicado: (2025)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
por: Lim, Hyeonseok, et al.
Publicado: (2024)
por: Lim, Hyeonseok, et al.
Publicado: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
por: Jia, Mengdi, et al.
Publicado: (2025)
por: Jia, Mengdi, et al.
Publicado: (2025)
Cross-Cultural Value Awareness in Large Vision-Language Models
por: Howard, Phillip, et al.
Publicado: (2026)
por: Howard, Phillip, et al.
Publicado: (2026)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
por: Du, Mengfei, et al.
Publicado: (2024)
por: Du, Mengfei, et al.
Publicado: (2024)
Bayesian Principles Improve Prompt Learning In Vision-Language Models
por: Kim, Mingyu, et al.
Publicado: (2025)
por: Kim, Mingyu, et al.
Publicado: (2025)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
por: Cherian, Anoop, et al.
Publicado: (2024)
por: Cherian, Anoop, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models (LVLMs) via Language-Contrastive Decoding (LCD)
por: Manevich, Avshalom, et al.
Publicado: (2024)
por: Manevich, Avshalom, et al.
Publicado: (2024)
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
por: Wang, Xingqi, et al.
Publicado: (2025)
por: Wang, Xingqi, et al.
Publicado: (2025)
Ejemplares similares
-
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
por: Choi, Byungjin, et al.
Publicado: (2026) -
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
por: Lee, Kang-il, et al.
Publicado: (2024) -
Improving Automatic VQA Evaluation Using Large Language Models
por: Mañas, Oscar, et al.
Publicado: (2023) -
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
por: Karim, A H M Rezaul, et al.
Publicado: (2025) -
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
por: Fan, Yue, et al.
Publicado: (2024)