DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Haokun, Hong, Yipeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
di: Guang, Jiahui, et al.
Pubblicazione: (2026)
di: Guang, Jiahui, et al.
Pubblicazione: (2026)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
di: Wang, Sibo, et al.
Pubblicazione: (2024)
di: Wang, Sibo, et al.
Pubblicazione: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
di: Yuan, Botai, et al.
Pubblicazione: (2025)
di: Yuan, Botai, et al.
Pubblicazione: (2025)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024)
di: Bao, Han, et al.
Pubblicazione: (2024)
SynBench: A Synthetic Benchmark for Non-rigid 3D Point Cloud Registration
di: Monji-Azad, Sara, et al.
Pubblicazione: (2024)
di: Monji-Azad, Sara, et al.
Pubblicazione: (2024)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
di: Qiu, Lu, et al.
Pubblicazione: (2024)
di: Qiu, Lu, et al.
Pubblicazione: (2024)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
di: Chen, Kesheng, et al.
Pubblicazione: (2026)
di: Chen, Kesheng, et al.
Pubblicazione: (2026)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
di: Yan, Bei, et al.
Pubblicazione: (2024)
di: Yan, Bei, et al.
Pubblicazione: (2024)
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2025)
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2025)
LocateBench: Evaluating the Locating Ability of Vision Language Models
di: Chiang, Ting-Rui, et al.
Pubblicazione: (2024)
di: Chiang, Ting-Rui, et al.
Pubblicazione: (2024)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
di: Cai, Jie, et al.
Pubblicazione: (2025)
di: Cai, Jie, et al.
Pubblicazione: (2025)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
di: Saxena, Rohit, et al.
Pubblicazione: (2026)
di: Saxena, Rohit, et al.
Pubblicazione: (2026)
DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models
di: Wang, JiYang, et al.
Pubblicazione: (2026)
di: Wang, JiYang, et al.
Pubblicazione: (2026)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
μ-Bench: A Vision-Language Benchmark for Microscopy Understanding
di: Lozano, Alejandro, et al.
Pubblicazione: (2024)
di: Lozano, Alejandro, et al.
Pubblicazione: (2024)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
di: Yang, Luyu, et al.
Pubblicazione: (2026)
di: Yang, Luyu, et al.
Pubblicazione: (2026)
SynDroneVision: A Synthetic Dataset for Image-Based Drone Detection
di: Lenhard, Tamara R., et al.
Pubblicazione: (2024)
di: Lenhard, Tamara R., et al.
Pubblicazione: (2024)
SynCDR : Training Cross Domain Retrieval Models with Synthetic Data
di: Mishra, Samarth, et al.
Pubblicazione: (2023)
di: Mishra, Samarth, et al.
Pubblicazione: (2023)
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
di: Fang, Jianjie, et al.
Pubblicazione: (2026)
di: Fang, Jianjie, et al.
Pubblicazione: (2026)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2025)
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2025)
SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals
di: Lin, Zihang, et al.
Pubblicazione: (2026)
di: Lin, Zihang, et al.
Pubblicazione: (2026)
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
di: Wang, Zhecan, et al.
Pubblicazione: (2024)
di: Wang, Zhecan, et al.
Pubblicazione: (2024)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
di: Lim, Hyeonseok, et al.
Pubblicazione: (2024)
di: Lim, Hyeonseok, et al.
Pubblicazione: (2024)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
di: Luo, Zhiming, et al.
Pubblicazione: (2026)
di: Luo, Zhiming, et al.
Pubblicazione: (2026)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation
di: Sajib, Rakib Hossain, et al.
Pubblicazione: (2026)
di: Sajib, Rakib Hossain, et al.
Pubblicazione: (2026)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
di: Lin, Fenfen, et al.
Pubblicazione: (2025)
di: Lin, Fenfen, et al.
Pubblicazione: (2025)
WorldModelBench: Judging Video Generation Models As World Models
di: Li, Dacheng, et al.
Pubblicazione: (2025)
di: Li, Dacheng, et al.
Pubblicazione: (2025)
"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
di: Gu, Jing, et al.
Pubblicazione: (2025)
di: Gu, Jing, et al.
Pubblicazione: (2025)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
di: Chow, Wei, et al.
Pubblicazione: (2025)
di: Chow, Wei, et al.
Pubblicazione: (2025)
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
di: Gao, Hong, et al.
Pubblicazione: (2025)
di: Gao, Hong, et al.
Pubblicazione: (2025)
WorldScore: A Unified Evaluation Benchmark for World Generation
di: Duan, Haoyi, et al.
Pubblicazione: (2025)
di: Duan, Haoyi, et al.
Pubblicazione: (2025)
Diffusion Curriculum: Synthetic-to-Real Data Curriculum via Image-Guided Diffusion
di: Liang, Yijun, et al.
Pubblicazione: (2024)
di: Liang, Yijun, et al.
Pubblicazione: (2024)
VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation
di: Jiang, Longteng, et al.
Pubblicazione: (2026)
di: Jiang, Longteng, et al.
Pubblicazione: (2026)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
GeoWorld-VLM: Geometry from World Models for Vision-Language Models
di: Gu, Renjie, et al.
Pubblicazione: (2026)
di: Gu, Renjie, et al.
Pubblicazione: (2026)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
di: Radwan, Ahmed Y., et al.
Pubblicazione: (2026)
di: Radwan, Ahmed Y., et al.
Pubblicazione: (2026)
LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression
di: Kundu, Souvik, et al.
Pubblicazione: (2025)
di: Kundu, Souvik, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
di: Guang, Jiahui, et al.
Pubblicazione: (2026) -
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
di: Wang, Sibo, et al.
Pubblicazione: (2024) -
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
di: Yuan, Botai, et al.
Pubblicazione: (2025) -
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024) -
SynBench: A Synthetic Benchmark for Non-rigid 3D Point Cloud Registration
di: Monji-Azad, Sara, et al.
Pubblicazione: (2024)