MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Siwei, Zhu, Kang, Bai, Yu, Liang, Yiming, Li, Yizhi, Wu, Haoning, Liu, J. H., Liu, Ruibo, Qu, Xingwei, Cheng, Xuxin, Zhang, Ge, Huang, Wenhao, Lin, Chenghua |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
par: Qu, Xingwei, et autres
Publié: (2024)
par: Qu, Xingwei, et autres
Publié: (2024)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
par: Zhang, Ge, et autres
Publié: (2024)
par: Zhang, Ge, et autres
Publié: (2024)
Count Anything at Any Granularity
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
LongEval: A Comprehensive Analysis of Long-Text Generation Through a Plan-based Paradigm
par: Wu, Siwei, et autres
Publié: (2025)
par: Wu, Siwei, et autres
Publié: (2025)
Multi-Relational Algebra for Multi-Granular Data Analytics
par: Wu, Xi, et autres
Publié: (2023)
par: Wu, Xi, et autres
Publié: (2023)
I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm
par: Liang, Yiming, et autres
Publié: (2024)
par: Liang, Yiming, et autres
Publié: (2024)
LIME: Less Is More for MLLM Evaluation
par: Zhu, King, et autres
Publié: (2024)
par: Zhu, King, et autres
Publié: (2024)
OmniBench: Towards The Future of Universal Omni-Language Models
par: Li, Yizhi, et autres
Publié: (2024)
par: Li, Yizhi, et autres
Publié: (2024)
PhysLab: A Benchmark Dataset for Multi-Granularity Visual Parsing of Physics Experiments
par: Zou, Minghao, et autres
Publié: (2025)
par: Zou, Minghao, et autres
Publié: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
par: Guo, Jiawei, et autres
Publié: (2024)
par: Guo, Jiawei, et autres
Publié: (2024)
EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models
par: Su, Jiamin, et autres
Publié: (2025)
par: Su, Jiamin, et autres
Publié: (2025)
A Survey on Multi-Turn Interaction Capabilities of Large Language Models
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
Overview of the NLPCC 2025 Shared Task: Gender Bias Mitigation Challenge
par: Li, Yizhi, et autres
Publié: (2025)
par: Li, Yizhi, et autres
Publié: (2025)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis
par: Yang, Chen, et autres
Publié: (2024)
par: Yang, Chen, et autres
Publié: (2024)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
Kun: Answer Polishment for Chinese Self-Alignment with Instruction Back-Translation
par: Zheng, Tianyu, et autres
Publié: (2024)
par: Zheng, Tianyu, et autres
Publié: (2024)
MMTE: Corpus and Metrics for Evaluating Machine Translation Quality of Metaphorical Language
par: Wang, Shun, et autres
Publié: (2024)
par: Wang, Shun, et autres
Publié: (2024)
A Comparative Study on Reasoning Patterns of OpenAI's o1 Model
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Can MLLMs Understand the Deep Implication Behind Chinese Images?
par: Zhang, Chenhao, et autres
Publié: (2024)
par: Zhang, Chenhao, et autres
Publié: (2024)
MultiBind: A Benchmark for Attribute Misbinding in Multi-Subject Generation
par: Tian, Wenqing, et autres
Publié: (2026)
par: Tian, Wenqing, et autres
Publié: (2026)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
par: Bai, Purui, et autres
Publié: (2026)
par: Bai, Purui, et autres
Publié: (2026)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
par: Ye, Weihao, et autres
Publié: (2024)
par: Ye, Weihao, et autres
Publié: (2024)
Event-Centric Human Value Understanding in News-Domain Texts: An Actor-Conditioned, Multi-Granularity Benchmark
par: Wang, Yao, et autres
Publié: (2026)
par: Wang, Yao, et autres
Publié: (2026)
Next Visual Granularity Generation
par: Wang, Yikai, et autres
Publié: (2025)
par: Wang, Yikai, et autres
Publié: (2025)
Observing Micromotives and Macrobehavior of Large Language Models
par: Cheng, Yuyang, et autres
Publié: (2024)
par: Cheng, Yuyang, et autres
Publié: (2024)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
par: Chen, Yingfa, et autres
Publié: (2024)
par: Chen, Yingfa, et autres
Publié: (2024)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
par: Wu, Haoning, et autres
Publié: (2024)
par: Wu, Haoning, et autres
Publié: (2024)
A Self-Evolving Framework for Efficient Terminal Agents via Observational Context Compression
par: Ren, Jincheng, et autres
Publié: (2026)
par: Ren, Jincheng, et autres
Publié: (2026)
HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution
par: Hong, Hanhua, et autres
Publié: (2026)
par: Hong, Hanhua, et autres
Publié: (2026)
SRFUND: A Multi-Granularity Hierarchical Structure Reconstruction Benchmark in Form Understanding
par: Ma, Jiefeng, et autres
Publié: (2024)
par: Ma, Jiefeng, et autres
Publié: (2024)
ToolPlanner: A Tool Augmented LLM for Multi Granularity Instructions with Path Planning and Feedback
par: Wu, Qinzhuo, et autres
Publié: (2024)
par: Wu, Qinzhuo, et autres
Publié: (2024)
How Social is It? A Benchmark for LLMs' Capabilities in Multi-user Multi-turn Social Agent Tasks
par: Wu, Yusen, et autres
Publié: (2025)
par: Wu, Yusen, et autres
Publié: (2025)
RAGAT-Mind: A Multi-Granular Modeling Approach for Rumor Detection Based on MindSpore
par: Qin, Zhenkai, et autres
Publié: (2025)
par: Qin, Zhenkai, et autres
Publié: (2025)
ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasks
par: Yang, Yan, et autres
Publié: (2025)
par: Yang, Yan, et autres
Publié: (2025)
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling
par: Li, Yizhi, et autres
Publié: (2025)
par: Li, Yizhi, et autres
Publié: (2025)
DocMMIR: A Framework for Document Multi-modal Information Retrieval
par: Li, Zirui, et autres
Publié: (2025)
par: Li, Zirui, et autres
Publié: (2025)
MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series
par: Zhang, Ge, et autres
Publié: (2024)
par: Zhang, Ge, et autres
Publié: (2024)
Documents similaires
-
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
par: Qu, Xingwei, et autres
Publié: (2024) -
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
par: Wu, Siwei, et autres
Publié: (2024) -
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
par: Zhang, Ge, et autres
Publié: (2024) -
Count Anything at Any Granularity
par: Liu, Chang, et autres
Publié: (2026) -
LongEval: A Comprehensive Analysis of Long-Text Generation Through a Plan-based Paradigm
par: Wu, Siwei, et autres
Publié: (2025)