MULTI: Multimodal Understanding Leaderboard with Text and Images
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Zichen, Xu, Yang, Chen, Lu, Yang, Jingkai, Ma, Yichuan, Sun, Yiming, Wen, Hailin, Liu, Jiaqi, Cai, Jinyu, Ma, Yingzi, Zhang, Situo, Zhao, Zihan, Sun, Liangtai, Yu, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
di: Xu, Hongshen, et al.
Pubblicazione: (2024)
di: Xu, Hongshen, et al.
Pubblicazione: (2024)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
di: Sun, Liangtai, et al.
Pubblicazione: (2023)
di: Sun, Liangtai, et al.
Pubblicazione: (2023)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback
di: Xu, Hongshen, et al.
Pubblicazione: (2024)
di: Xu, Hongshen, et al.
Pubblicazione: (2024)
ProgRM: Build Better GUI Agents with Progress Rewards
di: Zhang, Danyang, et al.
Pubblicazione: (2025)
di: Zhang, Danyang, et al.
Pubblicazione: (2025)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
di: Zhang, Situo, et al.
Pubblicazione: (2024)
di: Zhang, Situo, et al.
Pubblicazione: (2024)
MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task Automation
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation
di: Ma, Yingzi, et al.
Pubblicazione: (2026)
di: Ma, Yingzi, et al.
Pubblicazione: (2026)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
di: Zhang, Situo, et al.
Pubblicazione: (2026)
di: Zhang, Situo, et al.
Pubblicazione: (2026)
SciDFM: A Large Language Model with Mixture-of-Experts for Science
di: Sun, Liangtai, et al.
Pubblicazione: (2024)
di: Sun, Liangtai, et al.
Pubblicazione: (2024)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
di: Fu, Pei, et al.
Pubblicazione: (2025)
di: Fu, Pei, et al.
Pubblicazione: (2025)
Identifying Models Behind Text-to-Image Leaderboards
di: Naseh, Ali, et al.
Pubblicazione: (2026)
di: Naseh, Ali, et al.
Pubblicazione: (2026)
Developing ChemDFM as a large language foundation model for chemistry
di: Zhao, Zihan, et al.
Pubblicazione: (2024)
di: Zhao, Zihan, et al.
Pubblicazione: (2024)
Sparsity-Accelerated Training for Large Language Models
di: Ma, Da, et al.
Pubblicazione: (2024)
di: Ma, Da, et al.
Pubblicazione: (2024)
Reasoning-Driven Retrosynthesis Prediction with Large Language Models via Reinforcement Learning
di: Zhang, Situo, et al.
Pubblicazione: (2025)
di: Zhang, Situo, et al.
Pubblicazione: (2025)
Pluralistic Leaderboards
di: Haghtalab, Nika, et al.
Pubblicazione: (2026)
di: Haghtalab, Nika, et al.
Pubblicazione: (2026)
League: Leaderboard Generation on Demand
di: Wu, Jian, et al.
Pubblicazione: (2025)
di: Wu, Jian, et al.
Pubblicazione: (2025)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
di: Chen, Wei, et al.
Pubblicazione: (2024)
di: Chen, Wei, et al.
Pubblicazione: (2024)
UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration
di: Cheng, Zihan, et al.
Pubblicazione: (2025)
di: Cheng, Zihan, et al.
Pubblicazione: (2025)
An LLM-LVLM Driven Agent for Iterative and Fine-Grained Image Editing
di: Liang, Zihan, et al.
Pubblicazione: (2025)
di: Liang, Zihan, et al.
Pubblicazione: (2025)
Diffusion Once and Done: Degradation-Aware LoRA for Efficient All-in-One Image Restoration
di: Tang, Ni, et al.
Pubblicazione: (2025)
di: Tang, Ni, et al.
Pubblicazione: (2025)
OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding
di: Xie, Jiancong, et al.
Pubblicazione: (2025)
di: Xie, Jiancong, et al.
Pubblicazione: (2025)
Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare
di: Shi, Zhengliang, et al.
Pubblicazione: (2025)
di: Shi, Zhengliang, et al.
Pubblicazione: (2025)
Robust Multimodal Sentiment Analysis of Image-Text Pairs by Distribution-Based Feature Recovery and Fusion
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
di: Sun, Tao, et al.
Pubblicazione: (2025)
di: Sun, Tao, et al.
Pubblicazione: (2025)
Detect-and-Guide: Self-regulation of Diffusion Models for Safe Text-to-Image Generation via Guideline Token Optimization
di: Li, Feifei, et al.
Pubblicazione: (2025)
di: Li, Feifei, et al.
Pubblicazione: (2025)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
di: Ma, Lichen, et al.
Pubblicazione: (2026)
di: Ma, Lichen, et al.
Pubblicazione: (2026)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
di: Zhang, Situo, et al.
Pubblicazione: (2026)
di: Zhang, Situo, et al.
Pubblicazione: (2026)
DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment
di: Yu, Li, et al.
Pubblicazione: (2025)
di: Yu, Li, et al.
Pubblicazione: (2025)
ChemDFM-R: A Chemical Reasoning LLM Enhanced with Atomized Chemical Knowledge
di: Zhao, Zihan, et al.
Pubblicazione: (2025)
di: Zhao, Zihan, et al.
Pubblicazione: (2025)
Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability
di: Li, Haonan, et al.
Pubblicazione: (2024)
di: Li, Haonan, et al.
Pubblicazione: (2024)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
Prompt-to-Leaderboard
di: Frick, Evan, et al.
Pubblicazione: (2025)
di: Frick, Evan, et al.
Pubblicazione: (2025)
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
di: Meng, Chutian, et al.
Pubblicazione: (2024)
di: Meng, Chutian, et al.
Pubblicazione: (2024)
LLMs Meet Finance: Fine-Tuning Foundation Models for the Open FinLLM Leaderboard
di: Rao, Varun, et al.
Pubblicazione: (2025)
di: Rao, Varun, et al.
Pubblicazione: (2025)
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
di: Hirota, Yusuke, et al.
Pubblicazione: (2025)
di: Hirota, Yusuke, et al.
Pubblicazione: (2025)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
di: Yang, Yue, et al.
Pubblicazione: (2025)
di: Yang, Yue, et al.
Pubblicazione: (2025)
A Token-level Text Image Foundation Model for Document Understanding
di: Guan, Tongkun, et al.
Pubblicazione: (2025)
di: Guan, Tongkun, et al.
Pubblicazione: (2025)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
di: Li, Zhang, et al.
Pubblicazione: (2023)
di: Li, Zhang, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
di: Xu, Hongshen, et al.
Pubblicazione: (2024) -
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
di: Sun, Liangtai, et al.
Pubblicazione: (2023) -
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
di: Sun, Liangtai, et al.
Pubblicazione: (2022) -
Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback
di: Xu, Hongshen, et al.
Pubblicazione: (2024) -
ProgRM: Build Better GUI Agents with Progress Rewards
di: Zhang, Danyang, et al.
Pubblicazione: (2025)