MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yi-Fan, Zhang, Huanyu, Tian, Haochen, Fu, Chaoyou, Zhang, Shuangqing, Wu, Junfei, Li, Feng, Wang, Kun, Wen, Qingsong, Zhang, Zhang, Wang, Liang, Jin, Rong, Tan, Tieniu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
by: Xie, Wulin, et al.
Published: (2025)
by: Xie, Wulin, et al.
Published: (2025)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
by: Zhang, Yi-Fan, et al.
Published: (2024)
by: Zhang, Yi-Fan, et al.
Published: (2024)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
by: Shi, Yang, et al.
Published: (2025)
by: Shi, Yang, et al.
Published: (2025)
SimScale: Learning to Drive via Real-World Simulation at Scale
by: Tian, Haochen, et al.
Published: (2025)
by: Tian, Haochen, et al.
Published: (2025)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
Aligning Multimodal LLM with Human Preference: A Survey
by: Yu, Tao, et al.
Published: (2025)
by: Yu, Tao, et al.
Published: (2025)
VICR: Visual In-Context Restoration for Real-World Image Super-Resolution
by: Zhang, Qichang, et al.
Published: (2026)
by: Zhang, Qichang, et al.
Published: (2026)
Your Super Resolution Model is not Enough for Tackling Real-World Scenarios
by: Yoon, Dongsik, et al.
Published: (2025)
by: Yoon, Dongsik, et al.
Published: (2025)
Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios
by: Qu, Jingen, et al.
Published: (2025)
by: Qu, Jingen, et al.
Published: (2025)
RealViformer: Investigating Attention for Real-World Video Super-Resolution
by: Zhang, Yuehan, et al.
Published: (2024)
by: Zhang, Yuehan, et al.
Published: (2024)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation
by: Ma, Zeyao, et al.
Published: (2024)
by: Ma, Zeyao, et al.
Published: (2024)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
by: Gao, Zeyu, et al.
Published: (2025)
by: Gao, Zeyu, et al.
Published: (2025)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
by: Gan, Ziliang, et al.
Published: (2024)
by: Gan, Ziliang, et al.
Published: (2024)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
by: Meng, Jinxiang, et al.
Published: (2026)
by: Meng, Jinxiang, et al.
Published: (2026)
Tool-Assisted Agent on SQL Inspection and Refinement in Real-World Scenarios
by: Wang, Zhongyuan, et al.
Published: (2024)
by: Wang, Zhongyuan, et al.
Published: (2024)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
by: Li, Zhang, et al.
Published: (2026)
by: Li, Zhang, et al.
Published: (2026)
Adversarial Diffusion Compression for Real-World Image Super-Resolution
by: Chen, Bin, et al.
Published: (2024)
by: Chen, Bin, et al.
Published: (2024)
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
by: Wei, Qianshan, et al.
Published: (2026)
by: Wei, Qianshan, et al.
Published: (2026)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
by: Zhao, Haochen, et al.
Published: (2025)
by: Zhao, Haochen, et al.
Published: (2025)
High-Resolution Be Aware! Improving the Self-Supervised Real-World Super-Resolution
by: Zhang, Yuehan, et al.
Published: (2024)
by: Zhang, Yuehan, et al.
Published: (2024)
Self-Supervised Learning for Real-World Super-Resolution from Dual and Multiple Zoomed Observations
by: Zhang, Zhilu, et al.
Published: (2024)
by: Zhang, Zhilu, et al.
Published: (2024)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
by: Wei, Shaohang, et al.
Published: (2025)
by: Wei, Shaohang, et al.
Published: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
by: Jiang, Dongzhi, et al.
Published: (2025)
by: Jiang, Dongzhi, et al.
Published: (2025)
Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution
by: Chen, Bin, et al.
Published: (2026)
by: Chen, Bin, et al.
Published: (2026)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
by: Zhang, Yibo, et al.
Published: (2026)
by: Zhang, Yibo, et al.
Published: (2026)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
by: Hou, Yutao, et al.
Published: (2026)
by: Hou, Yutao, et al.
Published: (2026)
MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity
by: Zhang, Kaiyuan, et al.
Published: (2025)
by: Zhang, Kaiyuan, et al.
Published: (2025)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
by: Yuan, Jiakang, et al.
Published: (2025)
by: Yuan, Jiakang, et al.
Published: (2025)
Joint Geometric and Trajectory Consistency Learning for One-Step Real-World Super-Resolution
by: Deng, Chengyan, et al.
Published: (2026)
by: Deng, Chengyan, et al.
Published: (2026)
OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution
by: Zhao, Shijie, et al.
Published: (2026)
by: Zhao, Shijie, et al.
Published: (2026)
APISR: Anime Production Inspired Real-World Anime Super-Resolution
by: Wang, Boyang, et al.
Published: (2024)
by: Wang, Boyang, et al.
Published: (2024)
Perceive, Understand and Restore: Real-World Image Super-Resolution with Autoregressive Multimodal Generative Models
by: Wei, Hongyang, et al.
Published: (2025)
by: Wei, Hongyang, et al.
Published: (2025)
Semantic Segmentation Prior for Diffusion-Based Real-World Super-Resolution
by: Xiao, Jiahua, et al.
Published: (2024)
by: Xiao, Jiahua, et al.
Published: (2024)
One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
by: Fang, Yushun, et al.
Published: (2025)
by: Fang, Yushun, et al.
Published: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
by: Fu, Chaoyou, et al.
Published: (2023)
by: Fu, Chaoyou, et al.
Published: (2023)
TimeRAF: Retrieval-Augmented Foundation model for Zero-shot Time Series Forecasting
by: Zhang, Huanyu, et al.
Published: (2024)
by: Zhang, Huanyu, et al.
Published: (2024)
Boosting Diffusion-Based Text Image Super-Resolution Model Towards Generalized Real-World Scenarios
by: Pan, Chenglu, et al.
Published: (2025)
by: Pan, Chenglu, et al.
Published: (2025)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
by: Chen, Xinlong, et al.
Published: (2025)
by: Chen, Xinlong, et al.
Published: (2025)
Pairwise Distance Distillation for Unsupervised Real-World Image Super-Resolution
by: Zhang, Yuehan, et al.
Published: (2024)
by: Zhang, Yuehan, et al.
Published: (2024)
Similar Items
-
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
by: Xie, Wulin, et al.
Published: (2025) -
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
by: Zhang, Yi-Fan, et al.
Published: (2024) -
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
by: Shi, Yang, et al.
Published: (2025) -
SimScale: Learning to Drive via Real-World Simulation at Scale
by: Tian, Haochen, et al.
Published: (2025) -
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
by: Zhang, Yi-Fan, et al.
Published: (2025)