Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Villa, Andrés, Alcázar, Juan Carlos León, Soto, Alvaro, Ghanem, Bernard |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation
par: Messina, Pablo, et autres
Publié: (2026)
par: Messina, Pablo, et autres
Publié: (2026)
EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models
par: Villa, Andrés, et autres
Publié: (2025)
par: Villa, Andrés, et autres
Publié: (2025)
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues
par: Hinojosa, Carlos, et autres
Publié: (2026)
par: Hinojosa, Carlos, et autres
Publié: (2026)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
par: Li, You, et autres
Publié: (2025)
par: Li, You, et autres
Publié: (2025)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
par: Liu, Jie, et autres
Publié: (2024)
par: Liu, Jie, et autres
Publié: (2024)
GeoGPT4V: Towards Geometric Multi-modal Large Language Models with Geometric Image Generation
par: Cai, Shihao, et autres
Publié: (2024)
par: Cai, Shihao, et autres
Publié: (2024)
Compressed-Language Models for Understanding Compressed File Formats: a JPEG Exploration
par: Pérez, Juan C., et autres
Publié: (2024)
par: Pérez, Juan C., et autres
Publié: (2024)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
par: Liang, Qiao, et autres
Publié: (2025)
par: Liang, Qiao, et autres
Publié: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
par: Barrios, Wayner, et autres
Publié: (2025)
par: Barrios, Wayner, et autres
Publié: (2025)
4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding
par: Zhu, Wenxuan, et autres
Publié: (2025)
par: Zhu, Wenxuan, et autres
Publié: (2025)
Benchmarking Large Language Models for Image Classification of Marine Mammals
par: Qi, Yijiashun, et autres
Publié: (2024)
par: Qi, Yijiashun, et autres
Publié: (2024)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
par: Ohi, Masanari, et autres
Publié: (2024)
par: Ohi, Masanari, et autres
Publié: (2024)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
Behind Maya: Building a Multilingual Vision Language Model
par: Alam, Nahid, et autres
Publié: (2025)
par: Alam, Nahid, et autres
Publié: (2025)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
par: Song, Xiujie, et autres
Publié: (2024)
par: Song, Xiujie, et autres
Publié: (2024)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
par: Jiang, Dongzhi, et autres
Publié: (2024)
par: Jiang, Dongzhi, et autres
Publié: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
par: Miao, Yongzhu, et autres
Publié: (2023)
par: Miao, Yongzhu, et autres
Publié: (2023)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
par: Chen, Qiguang, et autres
Publié: (2026)
par: Chen, Qiguang, et autres
Publié: (2026)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
par: Zhao, Fei, et autres
Publié: (2024)
par: Zhao, Fei, et autres
Publié: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
par: Huang, Yipo, et autres
Publié: (2024)
par: Huang, Yipo, et autres
Publié: (2024)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
par: Li, Zhang, et autres
Publié: (2023)
par: Li, Zhang, et autres
Publié: (2023)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
par: Ye, Weihao, et autres
Publié: (2024)
par: Ye, Weihao, et autres
Publié: (2024)
MoCA-Video: Motion-Aware Concept Alignment for Consistent Video Editing
par: Zhang, Tong, et autres
Publié: (2025)
par: Zhang, Tong, et autres
Publié: (2025)
Customizing Visual-Language Foundation Models for Multi-modal Anomaly Detection and Reasoning
par: Xu, Xiaohao, et autres
Publié: (2024)
par: Xu, Xiaohao, et autres
Publié: (2024)
Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation
par: Uehara, Kohei, et autres
Publié: (2024)
par: Uehara, Kohei, et autres
Publié: (2024)
Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models
par: Nguyen, Pha, et autres
Publié: (2025)
par: Nguyen, Pha, et autres
Publié: (2025)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
par: Liu, Zhihang, et autres
Publié: (2025)
par: Liu, Zhihang, et autres
Publié: (2025)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
par: Gao, Junyuan, et autres
Publié: (2025)
par: Gao, Junyuan, et autres
Publié: (2025)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
par: Tian, Changyao, et autres
Publié: (2024)
par: Tian, Changyao, et autres
Publié: (2024)
EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models
par: Das, Rocktim Jyoti, et autres
Publié: (2024)
par: Das, Rocktim Jyoti, et autres
Publié: (2024)
Documents similaires
-
CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation
par: Messina, Pablo, et autres
Publié: (2026) -
EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models
par: Villa, Andrés, et autres
Publié: (2025) -
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
par: Wu, Chengyue, et autres
Publié: (2024) -
SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues
par: Hinojosa, Carlos, et autres
Publié: (2026) -
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
par: Zhang, Kaichen, et autres
Publié: (2024)