Information Density Principle for MLLM Benchmarks
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Chunyi, Li, Xiaozhe, Zhang, Zicheng, Tian, Yuan, Jia, Ziheng, Liu, Xiaohong, Min, Xiongkuo, Wang, Jia, Duan, Haodong, Chen, Kai, Zhai, Guangtao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Redundancy Principles for MLLMs Benchmarks
di: Zhang, Zicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zicheng, et al.
Pubblicazione: (2025)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
Image Quality Assessment: From Human to Machine Preference
di: Li, Chunyi, et al.
Pubblicazione: (2025)
di: Li, Chunyi, et al.
Pubblicazione: (2025)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
di: Zhu, Xiaorong, et al.
Pubblicazione: (2025)
di: Zhu, Xiaorong, et al.
Pubblicazione: (2025)
MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)
Affordance Benchmark for MLLMs
di: Wang, Junying, et al.
Pubblicazione: (2025)
di: Wang, Junying, et al.
Pubblicazione: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
Improve MLLM Benchmark Efficiency through Interview
di: Wen, Farong, et al.
Pubblicazione: (2025)
di: Wen, Farong, et al.
Pubblicazione: (2025)
HazeCLIP: Towards Language Guided Real-World Image Dehazing
di: Wang, Ruiyi, et al.
Pubblicazione: (2024)
di: Wang, Ruiyi, et al.
Pubblicazione: (2024)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
di: Shen, Ye, et al.
Pubblicazione: (2025)
di: Shen, Ye, et al.
Pubblicazione: (2025)
SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
di: Zhu, Xiangyang, et al.
Pubblicazione: (2025)
di: Zhu, Xiangyang, et al.
Pubblicazione: (2025)
Towards Explainable Partial-AIGC Image Quality Assessment
di: Qian, Jiaying, et al.
Pubblicazione: (2025)
di: Qian, Jiaying, et al.
Pubblicazione: (2025)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
di: Fu, Kang, et al.
Pubblicazione: (2025)
di: Fu, Kang, et al.
Pubblicazione: (2025)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition
di: Zheng, Yushuo, et al.
Pubblicazione: (2025)
di: Zheng, Yushuo, et al.
Pubblicazione: (2025)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
di: Kou, Tengchuan, et al.
Pubblicazione: (2024)
di: Kou, Tengchuan, et al.
Pubblicazione: (2024)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
di: Wu, Sijing, et al.
Pubblicazione: (2026)
di: Wu, Sijing, et al.
Pubblicazione: (2026)
Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs
di: Zhu, Xiangyang, et al.
Pubblicazione: (2026)
di: Zhu, Xiangyang, et al.
Pubblicazione: (2026)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
di: Li, Yunhao, et al.
Pubblicazione: (2026)
di: Li, Yunhao, et al.
Pubblicazione: (2026)
Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
di: Wang, Juntong, et al.
Pubblicazione: (2025)
di: Wang, Juntong, et al.
Pubblicazione: (2025)
NeedleBench: Evaluating LLM Retrieval and Reasoning Across Varying Information Densities
di: Li, Mo, et al.
Pubblicazione: (2024)
di: Li, Mo, et al.
Pubblicazione: (2024)
GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
di: Zheng, Yushuo, et al.
Pubblicazione: (2025)
di: Zheng, Yushuo, et al.
Pubblicazione: (2025)
R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation
di: Qian, Jiaying, et al.
Pubblicazione: (2026)
di: Qian, Jiaying, et al.
Pubblicazione: (2026)
Using GUI Agent for Electronic Design Automation
di: Li, Chunyi, et al.
Pubblicazione: (2025)
di: Li, Chunyi, et al.
Pubblicazione: (2025)
3DGCQA: A Quality Assessment Database for 3D AI-Generated Contents
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)
Human-Centric Evaluation for Foundation Models
di: Guo, Yijin, et al.
Pubblicazione: (2025)
di: Guo, Yijin, et al.
Pubblicazione: (2025)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
di: Zhang, Kaiwei, et al.
Pubblicazione: (2025)
di: Zhang, Kaiwei, et al.
Pubblicazione: (2025)
Quality Assessment in the Era of Large Models: A Survey
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model
di: Zhang, Zhichao, et al.
Pubblicazione: (2024)
di: Zhang, Zhichao, et al.
Pubblicazione: (2024)
ASCIIEval: Benchmarking Models' Visual Perception in Text Strings via ASCII Art
di: Jia, Qi, et al.
Pubblicazione: (2024)
di: Jia, Qi, et al.
Pubblicazione: (2024)
User-centric Subjective Leaderboard by Customizable Reward Modeling
di: Jia, Qi, et al.
Pubblicazione: (2025)
di: Jia, Qi, et al.
Pubblicazione: (2025)
Q-Refine: A Perceptual Quality Refiner for AI-Generated Image
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
Judge Before Answer: Can MLLM Discern the False Premise in Question?
di: Li, Jidong, et al.
Pubblicazione: (2025)
di: Li, Jidong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Redundancy Principles for MLLMs Benchmarks
di: Zhang, Zicheng, et al.
Pubblicazione: (2025) -
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
di: Zhang, Zeyu, et al.
Pubblicazione: (2025) -
Image Quality Assessment: From Human to Machine Preference
di: Li, Chunyi, et al.
Pubblicazione: (2025) -
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
di: Zhu, Xiaorong, et al.
Pubblicazione: (2025) -
MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)