Creation-MMBench: Assessing Context-Aware Creative Intelligence in MLLM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Xinyu, Chen, Zhijian, Lan, Kai, Ma, Lixin, Ding, Shengyuan, Liang, Yingji, Zhao, Xiangyu, Wen, Farong, Zhang, Zicheng, Zhang, Guofeng, Duan, Haodong, Chen, Kai, Lin, Dahua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
MMBench: Is Your Multi-modal Model an All-around Player?
par: Liu, Yuan, et autres
Publié: (2023)
par: Liu, Yuan, et autres
Publié: (2023)
ProSA: Assessing and Understanding the Prompt Sensitivity of LLMs
par: Zhuo, Jingming, et autres
Publié: (2024)
par: Zhuo, Jingming, et autres
Publié: (2024)
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs
par: Qiao, Yuxuan, et autres
Publié: (2024)
par: Qiao, Yuxuan, et autres
Publié: (2024)
Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
par: Li, Xiaozhe, et autres
Publié: (2026)
par: Li, Xiaozhe, et autres
Publié: (2026)
OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
par: Li, Xiaozhe, et autres
Publié: (2025)
par: Li, Xiaozhe, et autres
Publié: (2025)
OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces
par: Li, Xiaozhe, et autres
Publié: (2026)
par: Li, Xiaozhe, et autres
Publié: (2026)
Ada-LEval: Evaluating long-context LLMs with length-adaptable benchmarks
par: Wang, Chonghua, et autres
Publié: (2024)
par: Wang, Chonghua, et autres
Publié: (2024)
Information Density Principle for MLLM Benchmarks
par: Li, Chunyi, et autres
Publié: (2025)
par: Li, Chunyi, et autres
Publié: (2025)
NP-Engine: Empowering Optimization Reasoning in Large Language Models with Verifiable Synthetic NP Problems
par: Li, Xiaozhe, et autres
Publié: (2025)
par: Li, Xiaozhe, et autres
Publié: (2025)
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
par: Shen, Ye, et autres
Publié: (2025)
par: Shen, Ye, et autres
Publié: (2025)
Redundancy Principles for MLLMs Benchmarks
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
par: Wang, Xuehui, et autres
Publié: (2025)
par: Wang, Xuehui, et autres
Publié: (2025)
Improve MLLM Benchmark Efficiency through Interview
par: Wen, Farong, et autres
Publié: (2025)
par: Wen, Farong, et autres
Publié: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
par: Zang, Yuhang, et autres
Publié: (2025)
par: Zang, Yuhang, et autres
Publié: (2025)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI
par: Chen, Pengcheng, et autres
Publié: (2024)
par: Chen, Pengcheng, et autres
Publié: (2024)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
Metaphor Creation: A Measure of Creativity or Intelligence?
par: Débora Pereira de Barros
Publié: (2010)
par: Débora Pereira de Barros
Publié: (2010)
GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing
par: Xiao, Aoran, et autres
Publié: (2026)
par: Xiao, Aoran, et autres
Publié: (2026)
Affordance Benchmark for MLLMs
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
Visual-ERM: Reward Modeling for Visual Equivalence
par: Liu, Ziyu, et autres
Publié: (2026)
par: Liu, Ziyu, et autres
Publié: (2026)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
par: Ding, Shuangrui, et autres
Publié: (2026)
par: Ding, Shuangrui, et autres
Publié: (2026)
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
par: Wu, Diankun, et autres
Publié: (2025)
par: Wu, Diankun, et autres
Publié: (2025)
Formal Semantic Control over Language Models
par: Zhang, Yingji
Publié: (2026)
par: Zhang, Yingji
Publié: (2026)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
par: Wu, Yuhang, et autres
Publié: (2024)
par: Wu, Yuhang, et autres
Publié: (2024)
From Perceived School Climate to Creativity Performance: The Serial Multiple Mediation of Creative Self‐Efficacy and Creativity Motivation
par: Wu‐jing He, et autres
Publié: (2025)
par: Wu‐jing He, et autres
Publié: (2025)
MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark
par: Liu, Hongwei, et autres
Publié: (2024)
par: Liu, Hongwei, et autres
Publié: (2024)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
par: Zhang, Xintong, et autres
Publié: (2026)
par: Zhang, Xintong, et autres
Publié: (2026)
NeedleBench: Evaluating LLM Retrieval and Reasoning Across Varying Information Densities
par: Li, Mo, et autres
Publié: (2024)
par: Li, Mo, et autres
Publié: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
par: Zhao, Xiangyu, et autres
Publié: (2024)
par: Zhao, Xiangyu, et autres
Publié: (2024)
Judge Before Answer: Can MLLM Discern the False Premise in Question?
par: Li, Jidong, et autres
Publié: (2025)
par: Li, Jidong, et autres
Publié: (2025)
The Ever-Evolving Science Exam
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution
par: Cao, Maosong, et autres
Publié: (2024)
par: Cao, Maosong, et autres
Publié: (2024)
Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence
par: Zheng, Yufei, et autres
Publié: (2026)
par: Zheng, Yufei, et autres
Publié: (2026)
CriticEval: Evaluating Large Language Model as Critic
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
Creativity, Innovation, and Knowledge Creation in the Era of Generative Artificial Intelligence: Challenging Human Intelligence
par: Namita Jain, et autres
Publié: (2025)
par: Namita Jain, et autres
Publié: (2025)
Documents similaires
-
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024) -
MMBench: Is Your Multi-modal Model an All-around Player?
par: Liu, Yuan, et autres
Publié: (2023) -
ProSA: Assessing and Understanding the Prompt Sensitivity of LLMs
par: Zhuo, Jingming, et autres
Publié: (2024) -
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs
par: Qiao, Yuxuan, et autres
Publié: (2024) -
Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
par: Li, Xiaozhe, et autres
Publié: (2026)