Salvato in:
| Autori principali: | Gan, Ziliang, Lu, Yu, Zhang, Dong, Li, Haohan, Liu, Che, Liu, Jian, Liu, Ji, Wu, Haipang, Fu, Chaoyou, Xu, Zenglin, Zhang, Rongjunchen, Dai, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2411.03314 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation
di: Zhang, Chenxi, et al.
Pubblicazione: (2026)
di: Zhang, Chenxi, et al.
Pubblicazione: (2026)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
di: Xie, Wulin, et al.
Pubblicazione: (2025)
di: Xie, Wulin, et al.
Pubblicazione: (2025)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
di: Lu, Guilong, et al.
Pubblicazione: (2025)
di: Lu, Guilong, et al.
Pubblicazione: (2025)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
di: Fu, Chaoyou, et al.
Pubblicazione: (2026)
di: Fu, Chaoyou, et al.
Pubblicazione: (2026)
CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning
di: Zhu, Wenqiao, et al.
Pubblicazione: (2025)
di: Zhu, Wenqiao, et al.
Pubblicazione: (2025)
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation
di: Luo, Junyu, et al.
Pubblicazione: (2025)
di: Luo, Junyu, et al.
Pubblicazione: (2025)
FinanceReasoning: Benchmarking Financial Numerical Reasoning More Credible, Comprehensive and Challenging
di: Tang, Zichen, et al.
Pubblicazione: (2025)
di: Tang, Zichen, et al.
Pubblicazione: (2025)
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark
di: Yi, Dongyi, et al.
Pubblicazione: (2025)
di: Yi, Dongyi, et al.
Pubblicazione: (2025)
MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
A Survey on Benchmarks of Multimodal Large Language Models
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
Baichuan4-Finance Technical Report
di: Zhang, Hanyu, et al.
Pubblicazione: (2024)
di: Zhang, Hanyu, et al.
Pubblicazione: (2024)
Understanding LLM Reasoning for Abstractive Summarization
di: Yuan, Haohan, et al.
Pubblicazione: (2025)
di: Yuan, Haohan, et al.
Pubblicazione: (2025)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
di: Yue, Xiang, et al.
Pubblicazione: (2023)
di: Yue, Xiang, et al.
Pubblicazione: (2023)
BizFinBench.v2: A Unified Dual-Mode Bilingual Benchmark for Expert-Level Financial Capability Alignment
di: Guo, Xin, et al.
Pubblicazione: (2026)
di: Guo, Xin, et al.
Pubblicazione: (2026)
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
di: Hui, Zheng, et al.
Pubblicazione: (2025)
di: Hui, Zheng, et al.
Pubblicazione: (2025)
Does Table Source Matter? Benchmarking and Improving Multimodal Scientific Table Understanding and Reasoning
di: Yang, Bohao, et al.
Pubblicazione: (2025)
di: Yang, Bohao, et al.
Pubblicazione: (2025)
BizBench: A Quantitative Reasoning Benchmark for Business and Finance
di: Koncel-Kedziorski, Rik, et al.
Pubblicazione: (2023)
di: Koncel-Kedziorski, Rik, et al.
Pubblicazione: (2023)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
Revolutionizing Finance with LLMs: An Overview of Applications and Insights
di: Zhao, Huaqin, et al.
Pubblicazione: (2024)
di: Zhao, Huaqin, et al.
Pubblicazione: (2024)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
di: Zhang, Fan, et al.
Pubblicazione: (2025)
di: Zhang, Fan, et al.
Pubblicazione: (2025)
Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
di: Dong, Haoyu, et al.
Pubblicazione: (2025)
di: Dong, Haoyu, et al.
Pubblicazione: (2025)
PersonaVLM: Long-Term Personalized Multimodal LLMs
di: Nie, Chang, et al.
Pubblicazione: (2026)
di: Nie, Chang, et al.
Pubblicazione: (2026)
Ebisu: Benchmarking Large Language Models in Japanese Finance
di: Peng, Xueqing, et al.
Pubblicazione: (2026)
di: Peng, Xueqing, et al.
Pubblicazione: (2026)
PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
MME-RAG: Multi-Manager-Expert Retrieval-Augmented Generation for Fine-Grained Entity Recognition in Task-Oriented Dialogues
di: Xue, Liang, et al.
Pubblicazione: (2025)
di: Xue, Liang, et al.
Pubblicazione: (2025)
Understanding and Mitigating Network Latency Effect on Teleoperated-Robot with Extended Reality
di: Zhang, Ziliang, et al.
Pubblicazione: (2025)
di: Zhang, Ziliang, et al.
Pubblicazione: (2025)
PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data
di: Xiong, Kai, et al.
Pubblicazione: (2025)
di: Xiong, Kai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation
di: Zhang, Chenxi, et al.
Pubblicazione: (2026) -
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
di: Xie, Wulin, et al.
Pubblicazione: (2025) -
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025) -
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025) -
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
di: Liu, Che, et al.
Pubblicazione: (2025)