MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Fanqing, Wang, Jin, Li, Chuanhao, Lu, Quanfeng, Tian, Hao, Liao, Jiaqi, Zhu, Xizhou, Dai, Jifeng, Qiao, Yu, Luo, Ping, Zhang, Kaipeng, Shao, Wenqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
di: Li, Teng, et al.
Pubblicazione: (2025)
di: Li, Teng, et al.
Pubblicazione: (2025)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
di: Ying, Kaining, et al.
Pubblicazione: (2024)
di: Ying, Kaining, et al.
Pubblicazione: (2024)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
di: Liu, Shuo, et al.
Pubblicazione: (2024)
di: Liu, Shuo, et al.
Pubblicazione: (2024)
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
di: Lu, Quanfeng, et al.
Pubblicazione: (2024)
di: Lu, Quanfeng, et al.
Pubblicazione: (2024)
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
di: Li, Chuanhao, et al.
Pubblicazione: (2024)
di: Li, Chuanhao, et al.
Pubblicazione: (2024)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
di: Yang, Yue, et al.
Pubblicazione: (2024)
di: Yang, Yue, et al.
Pubblicazione: (2024)
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
di: Meng, Fanqing, et al.
Pubblicazione: (2025)
di: Meng, Fanqing, et al.
Pubblicazione: (2025)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
di: Hu, Yutao, et al.
Pubblicazione: (2024)
di: Hu, Yutao, et al.
Pubblicazione: (2024)
LangBridge: Interpreting Image as a Combination of Language Embeddings
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
Needle In A Multimodal Haystack
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
di: Luo, Gen, et al.
Pubblicazione: (2024)
di: Luo, Gen, et al.
Pubblicazione: (2024)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2025)
di: Luo, Gen, et al.
Pubblicazione: (2025)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
di: Ge, Junqi, et al.
Pubblicazione: (2024)
di: Ge, Junqi, et al.
Pubblicazione: (2024)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
di: Sun, Jianwen, et al.
Pubblicazione: (2025)
di: Sun, Jianwen, et al.
Pubblicazione: (2025)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
di: Xu, Peng, et al.
Pubblicazione: (2024)
di: Xu, Peng, et al.
Pubblicazione: (2024)
Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching
di: Zhang, Hao, et al.
Pubblicazione: (2023)
di: Zhang, Hao, et al.
Pubblicazione: (2023)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
di: Tian, Changyao, et al.
Pubblicazione: (2025)
di: Tian, Changyao, et al.
Pubblicazione: (2025)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
MLLMs-Augmented Visual-Language Representation Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2023)
di: Liu, Yanqing, et al.
Pubblicazione: (2023)
CoMemo: LVLMs Need Image Context with Image Memory
di: Liu, Shi, et al.
Pubblicazione: (2025)
di: Liu, Shi, et al.
Pubblicazione: (2025)
Adapting LLaMA Decoder to Vision Transformer
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
di: Meng, Fanqing, et al.
Pubblicazione: (2024) -
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
di: Meng, Fanqing, et al.
Pubblicazione: (2024) -
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024) -
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023) -
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
di: Li, Teng, et al.
Pubblicazione: (2025)