MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Yi, Dongyi, Zhu, Guibo, Ding, Chenglin, Li, Zongshu, Yi, Dong, Wang, Jinqiao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity
by: Zhang, Kaiyuan, et al.
Published: (2025)
by: Zhang, Kaiyuan, et al.
Published: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
by: Gan, Ziliang, et al.
Published: (2024)
by: Gan, Ziliang, et al.
Published: (2024)
Design, Results and Industry Implications of the World's First Insurance Large Language Model Evaluation Benchmark
by: Zhou, Hua, et al.
Published: (2025)
by: Zhou, Hua, et al.
Published: (2025)
Improving Generalization in LLM Structured Pruning via Function-Aware Neuron Grouping
by: Yu, Tao, et al.
Published: (2025)
by: Yu, Tao, et al.
Published: (2025)
Recurrent Context Compression: Efficiently Expanding the Context Window of LLM
by: Huang, Chensen, et al.
Published: (2024)
by: Huang, Chensen, et al.
Published: (2024)
IndustryCode: A Benchmark for Industry Code Generation
by: Zeng, Puyu, et al.
Published: (2026)
by: Zeng, Puyu, et al.
Published: (2026)
FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation
by: Luo, Junyu, et al.
Published: (2025)
by: Luo, Junyu, et al.
Published: (2025)
A Benchmark for Crime Surveillance Video Analysis with Large Models
by: Chen, Haoran, et al.
Published: (2025)
by: Chen, Haoran, et al.
Published: (2025)
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
by: Ruan, Jiacheng, et al.
Published: (2025)
by: Ruan, Jiacheng, et al.
Published: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
by: Jiang, Dongzhi, et al.
Published: (2025)
by: Jiang, Dongzhi, et al.
Published: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization
by: Tao, Meiling, et al.
Published: (2025)
by: Tao, Meiling, et al.
Published: (2025)
Exploring Novelty Differences between Industry and Academia: A Knowledge Entity-centric Perspective
by: Zhao, Hongye, et al.
Published: (2026)
by: Zhao, Hongye, et al.
Published: (2026)
A Comprehensive Survey on Evaluating Large Language Model Applications in the Medical Industry
by: Huang, Yining, et al.
Published: (2024)
by: Huang, Yining, et al.
Published: (2024)
Quantifying the Knowledge Proximity Between Academic and Industry Research: An Entity and Semantic Perspective
by: Zhao, Hongye, et al.
Published: (2026)
by: Zhao, Hongye, et al.
Published: (2026)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
by: Zong, Yi, et al.
Published: (2024)
by: Zong, Yi, et al.
Published: (2024)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
by: Zhang, Fan, et al.
Published: (2025)
by: Zhang, Fan, et al.
Published: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
by: Guo, Ziyu, et al.
Published: (2025)
by: Guo, Ziyu, et al.
Published: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
by: Fu, Chaoyou, et al.
Published: (2023)
by: Fu, Chaoyou, et al.
Published: (2023)
JaccDiv: A Metric and Benchmark for Quantifying Diversity of Generated Marketing Text in the Music Industry
by: Afzal, Anum, et al.
Published: (2025)
by: Afzal, Anum, et al.
Published: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
by: Xie, Wulin, et al.
Published: (2025)
by: Xie, Wulin, et al.
Published: (2025)
Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents
by: Tang, Yihong, et al.
Published: (2025)
by: Tang, Yihong, et al.
Published: (2025)
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization
by: Liu, Yinhong, et al.
Published: (2025)
by: Liu, Yinhong, et al.
Published: (2025)
SemiKong: Curating, Training, and Evaluating A Semiconductor Industry-Specific Large Language Model
by: Nguyen, Christopher, et al.
Published: (2024)
by: Nguyen, Christopher, et al.
Published: (2024)
Industry Risk Assessment via Hierarchical Financial Data Using Stock Market Sentiment Indicators
by: Zhu, Hongyin
Published: (2023)
by: Zhu, Hongyin
Published: (2023)
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
by: Zhao, Yi, et al.
Published: (2026)
by: Zhao, Yi, et al.
Published: (2026)
CFBenchmark-MM: Chinese Financial Assistant Benchmark for Multimodal Large Language Model
by: Li, Jiangtong, et al.
Published: (2025)
by: Li, Jiangtong, et al.
Published: (2025)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
by: Liu, Yuansen, et al.
Published: (2025)
by: Liu, Yuansen, et al.
Published: (2025)
SeLaR: Selective Latent Reasoning in Large Language Models
by: Fu, Renyu, et al.
Published: (2026)
by: Fu, Renyu, et al.
Published: (2026)
MiCoTA: Bridging the Learnability Gap with Intermediate CoT and Teacher Assistants
by: Ding, Dongyi, et al.
Published: (2025)
by: Ding, Dongyi, et al.
Published: (2025)
Matching Tasks with Industry Groups for Augmenting Commonsense Knowledge
by: Singh, Rituraj, et al.
Published: (2025)
by: Singh, Rituraj, et al.
Published: (2025)
Are Large Language Models Economically Viable for Industry Deployment?
by: Mohammad, Abdullah, et al.
Published: (2026)
by: Mohammad, Abdullah, et al.
Published: (2026)
A Parallel Cross-Lingual Benchmark for Multimodal Idiomaticity Understanding
by: Torunoğlu-Selamet, Dilara, et al.
Published: (2026)
by: Torunoğlu-Selamet, Dilara, et al.
Published: (2026)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
by: Patil, Vaidehi, et al.
Published: (2025)
by: Patil, Vaidehi, et al.
Published: (2025)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
by: Zhang, Jiaxin, et al.
Published: (2024)
by: Zhang, Jiaxin, et al.
Published: (2024)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
by: Chen, Yi, et al.
Published: (2023)
by: Chen, Yi, et al.
Published: (2023)
Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation
by: Zhou, Li, et al.
Published: (2025)
by: Zhou, Li, et al.
Published: (2025)
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
by: Jiang, Botian, et al.
Published: (2024)
by: Jiang, Botian, et al.
Published: (2024)
Link Prediction for Event Logs in the Process Industry
by: Zhukova, Anastasia, et al.
Published: (2025)
by: Zhukova, Anastasia, et al.
Published: (2025)
Similar Items
-
MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity
by: Zhang, Kaiyuan, et al.
Published: (2025) -
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
by: Fu, Chaoyou, et al.
Published: (2024) -
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
by: Gan, Ziliang, et al.
Published: (2024) -
Design, Results and Industry Implications of the World's First Insurance Large Language Model Evaluation Benchmark
by: Zhou, Hua, et al.
Published: (2025) -
Improving Generalization in LLM Structured Pruning via Function-Aware Neuron Grouping
by: Yu, Tao, et al.
Published: (2025)