MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qian, Yusu, Ye, Hanrong, Fauconnier, Jean-Philippe, Grasch, Peter, Yang, Yinfei, Gan, Zhe |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024)
par: Amirloo, Elmira, et autres
Publié: (2024)
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
par: Feng, Di, et autres
Publié: (2025)
par: Feng, Di, et autres
Publié: (2025)
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs
par: Daxberger, Erik, et autres
Publié: (2025)
par: Daxberger, Erik, et autres
Publié: (2025)
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
par: You, Keen, et autres
Publié: (2024)
par: You, Keen, et autres
Publié: (2024)
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
par: Zhang, Haotian, et autres
Publié: (2024)
par: Zhang, Haotian, et autres
Publié: (2024)
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
par: Narayan, Kartik, et autres
Publié: (2025)
par: Narayan, Kartik, et autres
Publié: (2025)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
par: Li, Xiujun, et autres
Publié: (2023)
par: Li, Xiujun, et autres
Publié: (2023)
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
par: Fu, Tsu-Jui, et autres
Publié: (2025)
par: Fu, Tsu-Jui, et autres
Publié: (2025)
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training
par: McKinzie, Brandon, et autres
Publié: (2024)
par: McKinzie, Brandon, et autres
Publié: (2024)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
par: Guo, Zichun, et autres
Publié: (2026)
par: Guo, Zichun, et autres
Publié: (2026)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
par: Fu, Tsu-Jui, et autres
Publié: (2023)
par: Fu, Tsu-Jui, et autres
Publié: (2023)
Instruction-Following Evaluation of Large Vision-Language Models
par: Shiono, Daiki, et autres
Publié: (2025)
par: Shiono, Daiki, et autres
Publié: (2025)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs
par: Toschi, Federico, et autres
Publié: (2026)
par: Toschi, Federico, et autres
Publié: (2026)
Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following Models
par: Huang, Yupan, et autres
Publié: (2023)
par: Huang, Yupan, et autres
Publié: (2023)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
Towards Better Instruction Following Retrieval Models
par: Zhuang, Yuchen, et autres
Publié: (2025)
par: Zhuang, Yuchen, et autres
Publié: (2025)
Talk Less, Interact Better: Evaluating In-context Conversational Adaptation in Multimodal LLMs
par: Hua, Yilun, et autres
Publié: (2024)
par: Hua, Yilun, et autres
Publié: (2024)
Compressing LLMs: The Truth is Rarely Pure and Never Simple
par: Jaiswal, Ajay, et autres
Publié: (2023)
par: Jaiswal, Ajay, et autres
Publié: (2023)
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs
par: Ye, Wenqian, et autres
Publié: (2024)
par: Ye, Wenqian, et autres
Publié: (2024)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2025)
par: Cheng, Zhili, et autres
Publié: (2025)
Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
par: Wen, Bosi, et autres
Publié: (2026)
par: Wen, Bosi, et autres
Publié: (2026)
MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks
par: Papi, Sara, et autres
Publié: (2025)
par: Papi, Sara, et autres
Publié: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web
par: Guo, Hongcheng, et autres
Publié: (2024)
par: Guo, Hongcheng, et autres
Publié: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
par: Xu, Mengya, et autres
Publié: (2025)
par: Xu, Mengya, et autres
Publié: (2025)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
par: Wang, Shengkang, et autres
Publié: (2024)
par: Wang, Shengkang, et autres
Publié: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
par: Zhao, Yiming, et autres
Publié: (2025)
par: Zhao, Yiming, et autres
Publié: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
par: Hu, Yushi, et autres
Publié: (2025)
par: Hu, Yushi, et autres
Publié: (2025)
UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action
par: Yang, Yuhao, et autres
Publié: (2025)
par: Yang, Yuhao, et autres
Publié: (2025)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
par: Dai, Ziqi, et autres
Publié: (2025)
par: Dai, Ziqi, et autres
Publié: (2025)
OmniGen2: Towards Instruction-Aligned Multimodal Generation
par: Wu, Chenyuan, et autres
Publié: (2025)
par: Wu, Chenyuan, et autres
Publié: (2025)
Documents similaires
-
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024) -
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
par: Qian, Yusu, et autres
Publié: (2024) -
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
par: Feng, Di, et autres
Publié: (2025) -
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
par: Qian, Yusu, et autres
Publié: (2025) -
PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
par: Qian, Yusu, et autres
Publié: (2025)