MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ying, Kaining, Meng, Fanqing, Wang, Jin, Li, Zhiqian, Lin, Han, Yang, Yue, Zhang, Hao, Zhang, Wenbo, Lin, Yuqi, Liu, Shuo, Lei, Jiayi, Lu, Quanfeng, Chen, Runjian, Xu, Peng, Zhang, Renrui, Zhang, Haozhe, Gao, Peng, Wang, Yali, Qiao, Yu, Luo, Ping, Zhang, Kaipeng, Shao, Wenqi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2024)
par: Liu, Shuo, et autres
Publié: (2024)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
par: Lu, Quanfeng, et autres
Publié: (2024)
par: Lu, Quanfeng, et autres
Publié: (2024)
Position: Towards Implicit Prompt For Text-To-Image Models
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
par: Meng, Fanqing, et autres
Publié: (2025)
par: Meng, Fanqing, et autres
Publié: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
par: Xu, Peng, et autres
Publié: (2024)
par: Xu, Peng, et autres
Publié: (2024)
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
JiSAM: Alleviate Labeling Burden and Corner Case Problems in Autonomous Driving via Minimal Real-World Data
par: Chen, Runjian, et autres
Publié: (2025)
par: Chen, Runjian, et autres
Publié: (2025)
TREND: Unsupervised 3D Representation Learning via Temporal Forecasting for LiDAR Perception
par: Chen, Runjian, et autres
Publié: (2024)
par: Chen, Runjian, et autres
Publié: (2024)
SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
par: Lin, Yuqi, et autres
Publié: (2025)
par: Lin, Yuqi, et autres
Publié: (2025)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD
par: Zhang, Haozhe, et autres
Publié: (2026)
par: Zhang, Haozhe, et autres
Publié: (2026)
DHG-Bench: A Comprehensive Benchmark for Deep Hypergraph Learning
par: Li, Fan, et autres
Publié: (2025)
par: Li, Fan, et autres
Publié: (2025)
OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation
par: Zhou, Pengfei, et autres
Publié: (2024)
par: Zhou, Pengfei, et autres
Publié: (2024)
T3M: Text Guided 3D Human Motion Synthesis from Speech
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
Motif Counting in Complex Networks: A Comprehensive Survey
par: Yin, Haozhe, et autres
Publié: (2025)
par: Yin, Haozhe, et autres
Publié: (2025)
Quantum Visual Word Sense Disambiguation: Unraveling Ambiguities Through Quantum Inference Model
par: Qiao, Wenbo, et autres
Publié: (2025)
par: Qiao, Wenbo, et autres
Publié: (2025)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
par: Hu, Yutao, et autres
Publié: (2024)
par: Hu, Yutao, et autres
Publié: (2024)
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
par: Xu, Zhaopan, et autres
Publié: (2025)
par: Xu, Zhaopan, et autres
Publié: (2025)
Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
CLAP: Unsupervised 3D Representation Learning for Fusion 3D Perception via Curvature Sampling and Prototype Learning
par: Chen, Runjian, et autres
Publié: (2024)
par: Chen, Runjian, et autres
Publié: (2024)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
par: Zhao, Lirui, et autres
Publié: (2024)
par: Zhao, Lirui, et autres
Publié: (2024)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model
par: Zhao, Lirui, et autres
Publié: (2024)
par: Zhao, Lirui, et autres
Publié: (2024)
Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching
par: Zhang, Hao, et autres
Publié: (2023)
par: Zhang, Hao, et autres
Publié: (2023)
OneLLM: One Framework to Align All Modalities with Language
par: Han, Jiaming, et autres
Publié: (2023)
par: Han, Jiaming, et autres
Publié: (2023)
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
par: Li, Chuanhao, et autres
Publié: (2024)
par: Li, Chuanhao, et autres
Publié: (2024)
MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
par: Zhou, Pengfei, et autres
Publié: (2025)
par: Zhou, Pengfei, et autres
Publié: (2025)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
par: Xie, Yuxuan, et autres
Publié: (2024)
par: Xie, Yuxuan, et autres
Publié: (2024)
3DGen-Bench: Comprehensive Benchmark Suite for 3D Generative Models
par: Zhang, Yuhan, et autres
Publié: (2025)
par: Zhang, Yuhan, et autres
Publié: (2025)
Unleashing the Potentials of Likelihood Composition for Multi-modal Language Models
par: Zhao, Shitian, et autres
Publié: (2024)
par: Zhao, Shitian, et autres
Publié: (2024)
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
par: Du, Lingxiao, et autres
Publié: (2025)
par: Du, Lingxiao, et autres
Publié: (2025)
SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
par: Liu, Dongyang, et autres
Publié: (2024)
par: Liu, Dongyang, et autres
Publié: (2024)
Documents similaires
-
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
par: Meng, Fanqing, et autres
Publié: (2024) -
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2024) -
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
par: Meng, Fanqing, et autres
Publié: (2024) -
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
par: Lu, Quanfeng, et autres
Publié: (2024) -
Position: Towards Implicit Prompt For Text-To-Image Models
par: Yang, Yue, et autres
Publié: (2024)