MLLM-Bench: Evaluating Multimodal LLMs with Per-sample Criteria
Fuente:
arXiv
Guardado en:
| Autores principales: | Ge, Wentao, Chen, Shunian, Chen, Guiming Hardy, Chen, Junying, Chen, Zhihong, Chen, Nuo, Xie, Wenya, Yan, Shuo, Zhu, Chenghao, Lin, Ziyue, Dingjie, Song, Wang, Xidong, Gao, Anningzhe, Zhiyi, Zhang, Li, Jianquan, Wan, Xiang, Wang, Benyou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MileBench: Benchmarking MLLMs in Long Context
por: Song, Dingjie, et al.
Publicado: (2024)
por: Song, Dingjie, et al.
Publicado: (2024)
ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
por: Chen, Guiming Hardy, et al.
Publicado: (2024)
por: Chen, Guiming Hardy, et al.
Publicado: (2024)
CMB: A Comprehensive Medical Benchmark in Chinese
por: Wang, Xidong, et al.
Publicado: (2023)
por: Wang, Xidong, et al.
Publicado: (2023)
HuatuoGPT-II, One-stage Training for Medical Adaption of LLMs
por: Chen, Junying, et al.
Publicado: (2023)
por: Chen, Junying, et al.
Publicado: (2023)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
por: Chen, Junying, et al.
Publicado: (2024)
por: Chen, Junying, et al.
Publicado: (2024)
Humans or LLMs as the Judge? A Study on Judgement Biases
por: Chen, Guiming Hardy, et al.
Publicado: (2024)
por: Chen, Guiming Hardy, et al.
Publicado: (2024)
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
por: Song, Dingjie, et al.
Publicado: (2024)
por: Song, Dingjie, et al.
Publicado: (2024)
LLMs Could Autonomously Learn Without External Supervision
por: Ji, Ke, et al.
Publicado: (2024)
por: Ji, Ke, et al.
Publicado: (2024)
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
por: Wang, Xidong, et al.
Publicado: (2024)
por: Wang, Xidong, et al.
Publicado: (2024)
CoD, Towards an Interpretable Medical Agent using Chain of Diagnosis
por: Chen, Junying, et al.
Publicado: (2024)
por: Chen, Junying, et al.
Publicado: (2024)
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
por: Chen, Junying, et al.
Publicado: (2025)
por: Chen, Junying, et al.
Publicado: (2025)
LLMs for Doctors: Leveraging Medical LLMs to Assist Doctors, Not Replace Them
por: Xie, Wenya, et al.
Publicado: (2024)
por: Xie, Wenya, et al.
Publicado: (2024)
Enabling Doctor-Centric Medical AI with LLMs through Workflow-Aligned Tasks and Benchmarks
por: Xie, Wenya, et al.
Publicado: (2025)
por: Xie, Wenya, et al.
Publicado: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
por: Song, Dingjie, et al.
Publicado: (2024)
por: Song, Dingjie, et al.
Publicado: (2024)
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
por: Wang, Rongsheng, et al.
Publicado: (2025)
por: Wang, Rongsheng, et al.
Publicado: (2025)
Apollo: A Lightweight Multilingual Medical LLM towards Democratizing Medical AI to 6B People
por: Wang, Xidong, et al.
Publicado: (2024)
por: Wang, Xidong, et al.
Publicado: (2024)
Efficiently Democratizing Medical LLMs for 50 Languages via a Mixture of Language Family Experts
por: Zheng, Guorui, et al.
Publicado: (2024)
por: Zheng, Guorui, et al.
Publicado: (2024)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
por: Cai, Zhenyang, et al.
Publicado: (2024)
por: Cai, Zhenyang, et al.
Publicado: (2024)
BlenderLLM: Training Large Language Models for Computer-Aided Design with Self-improvement
por: Du, Yuhao, et al.
Publicado: (2024)
por: Du, Yuhao, et al.
Publicado: (2024)
From Lossy to Verified: A Provenance-Aware Tiered Memory for Agents
por: Zhu, Qiming, et al.
Publicado: (2026)
por: Zhu, Qiming, et al.
Publicado: (2026)
OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning
por: Yu, Fei, et al.
Publicado: (2023)
por: Yu, Fei, et al.
Publicado: (2023)
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
Is Your LLM Outdated? A Deep Look at Temporal Generalization
por: Zhu, Chenghao, et al.
Publicado: (2024)
por: Zhu, Chenghao, et al.
Publicado: (2024)
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
por: Chen, Junying, et al.
Publicado: (2024)
por: Chen, Junying, et al.
Publicado: (2024)
AceGPT, Localizing Large Language Models in Arabic
por: Huang, Huang, et al.
Publicado: (2023)
por: Huang, Huang, et al.
Publicado: (2023)
RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructions
por: Liu, Wanlong, et al.
Publicado: (2024)
por: Liu, Wanlong, et al.
Publicado: (2024)
LiveClin: A Live Clinical Benchmark without Leakage
por: Wang, Xidong, et al.
Publicado: (2026)
por: Wang, Xidong, et al.
Publicado: (2026)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice
por: Wang, Rongyang, et al.
Publicado: (2026)
por: Wang, Rongyang, et al.
Publicado: (2026)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
por: Du, Yuhao, et al.
Publicado: (2025)
por: Du, Yuhao, et al.
Publicado: (2025)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
por: Xie, Xinyuan, et al.
Publicado: (2026)
por: Xie, Xinyuan, et al.
Publicado: (2026)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
por: Du, Yuhao, et al.
Publicado: (2025)
por: Du, Yuhao, et al.
Publicado: (2025)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
por: Jing, Liqiang, et al.
Publicado: (2025)
por: Jing, Liqiang, et al.
Publicado: (2025)
LLMs for Mathematical Modeling: Towards Bridging the Gap between Natural and Mathematical Languages
por: Huang, Xuhan, et al.
Publicado: (2024)
por: Huang, Xuhan, et al.
Publicado: (2024)
Online Training of Large Language Models: Learn while chatting
por: Liang, Juhao, et al.
Publicado: (2024)
por: Liang, Juhao, et al.
Publicado: (2024)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
WaveMind: Towards a Conversational EEG Foundation Model Aligned to Textual and Visual Modalities
por: Zeng, Ziyi, et al.
Publicado: (2025)
por: Zeng, Ziyi, et al.
Publicado: (2025)
Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers
por: Chen, Xin, et al.
Publicado: (2026)
por: Chen, Xin, et al.
Publicado: (2026)
MicroVerse: A Preliminary Exploration Toward a Micro-World Simulation
por: Wang, Rongsheng, et al.
Publicado: (2026)
por: Wang, Rongsheng, et al.
Publicado: (2026)
Heterogeneity-Aware Knowledge Sharing for Graph Federated Learning
por: Yu, Wentao, et al.
Publicado: (2026)
por: Yu, Wentao, et al.
Publicado: (2026)
Ejemplares similares
-
MileBench: Benchmarking MLLMs in Long Context
por: Song, Dingjie, et al.
Publicado: (2024) -
ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
por: Chen, Guiming Hardy, et al.
Publicado: (2024) -
CMB: A Comprehensive Medical Benchmark in Chinese
por: Wang, Xidong, et al.
Publicado: (2023) -
HuatuoGPT-II, One-stage Training for Medical Adaption of LLMs
por: Chen, Junying, et al.
Publicado: (2023) -
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
por: Chen, Junying, et al.
Publicado: (2024)