CFBenchmark-MM: Chinese Financial Assistant Benchmark for Multimodal Large Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Jiangtong, Zhu, Yiyun, Cheng, Dawei, Ding, Zhijun, Jiang, Changjun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CFBenchmark: Chinese Financial Assistant Benchmark for Large Language Model
by: Lei, Yang, et al.
Published: (2023)
by: Lei, Yang, et al.
Published: (2023)
FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design
by: Lan, Kai, et al.
Published: (2025)
by: Lan, Kai, et al.
Published: (2025)
FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting
by: Zhu, Yiyun, et al.
Published: (2026)
by: Zhu, Yiyun, et al.
Published: (2026)
InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-Guided Reasoning and Optimization for Debating
by: Wang, Fuyu, et al.
Published: (2025)
by: Wang, Fuyu, et al.
Published: (2025)
FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation
by: Zhu, Jiayong, et al.
Published: (2026)
by: Zhu, Jiayong, et al.
Published: (2026)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
by: Zhu, Jie, et al.
Published: (2024)
by: Zhu, Jie, et al.
Published: (2024)
MM-Soc: Benchmarking Multimodal Large Language Models in Social Media Platforms
by: Jin, Yiqiao, et al.
Published: (2024)
by: Jin, Yiqiao, et al.
Published: (2024)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
by: Nie, Ying, et al.
Published: (2024)
by: Nie, Ying, et al.
Published: (2024)
PediatricsGPT: Large Language Models as Chinese Medical Assistants for Pediatric Applications
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation
by: Liang, Xun, et al.
Published: (2023)
by: Liang, Xun, et al.
Published: (2023)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
by: Zong, Yi, et al.
Published: (2024)
by: Zong, Yi, et al.
Published: (2024)
FlowMM: Cross-Modal Information Flow Guided KV Cache Merging for Efficient Multimodal Context Inference
by: Li, Kunxi, et al.
Published: (2025)
by: Li, Kunxi, et al.
Published: (2025)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
by: Guo, Xin, et al.
Published: (2023)
by: Guo, Xin, et al.
Published: (2023)
MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
by: Peng, Xueqing, et al.
Published: (2025)
by: Peng, Xueqing, et al.
Published: (2025)
MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception
by: Wang, Yuhao, et al.
Published: (2024)
by: Wang, Yuhao, et al.
Published: (2024)
No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks
by: Hu, Gang, et al.
Published: (2024)
by: Hu, Gang, et al.
Published: (2024)
EEG-FM-Bench: A Comprehensive Benchmark for the Systematic Evaluation of EEG Foundation Models
by: Xiong, Wei, et al.
Published: (2025)
by: Xiong, Wei, et al.
Published: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
by: Wu, Yuhang, et al.
Published: (2024)
by: Wu, Yuhang, et al.
Published: (2024)
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models
by: Kang, Zhaolu, et al.
Published: (2026)
by: Kang, Zhaolu, et al.
Published: (2026)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
by: Lin, Junyan, et al.
Published: (2024)
by: Lin, Junyan, et al.
Published: (2024)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
by: Ding, Jinru, et al.
Published: (2025)
by: Ding, Jinru, et al.
Published: (2025)
MM-CRITIC: A Holistic Evaluation of Large Multimodal Models as Multimodal Critique
by: Zeng, Gailun, et al.
Published: (2025)
by: Zeng, Gailun, et al.
Published: (2025)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
by: Lan, Tian, et al.
Published: (2025)
by: Lan, Tian, et al.
Published: (2025)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
by: Chen, Shisong, et al.
Published: (2025)
by: Chen, Shisong, et al.
Published: (2025)
ALFEE: Adaptive Large Foundation Model for EEG Representation
by: Xiong, Wei, et al.
Published: (2025)
by: Xiong, Wei, et al.
Published: (2025)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
by: Zhang, Hengxiang, et al.
Published: (2024)
by: Zhang, Hengxiang, et al.
Published: (2024)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
by: Yu, Weihao, et al.
Published: (2024)
by: Yu, Weihao, et al.
Published: (2024)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
by: Zhang, Min, et al.
Published: (2025)
by: Zhang, Min, et al.
Published: (2025)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
by: Yan, Lian, et al.
Published: (2025)
by: Yan, Lian, et al.
Published: (2025)
Construction of a Japanese Financial Benchmark for Large Language Models
by: Hirano, Masanori
Published: (2024)
by: Hirano, Masanori
Published: (2024)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
by: Li, Shilong, et al.
Published: (2025)
by: Li, Shilong, et al.
Published: (2025)
InternLM-Law: An Open Source Chinese Legal Large Language Model
by: Fei, Zhiwei, et al.
Published: (2024)
by: Fei, Zhiwei, et al.
Published: (2024)
MM-LLMs: Recent Advances in MultiModal Large Language Models
by: Zhang, Duzhen, et al.
Published: (2024)
by: Zhang, Duzhen, et al.
Published: (2024)
Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models
by: Zhu, Minjie, et al.
Published: (2024)
by: Zhu, Minjie, et al.
Published: (2024)
Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models
by: Zhu, Bin, et al.
Published: (2025)
by: Zhu, Bin, et al.
Published: (2025)
SNFinLLM: Systematic and Nuanced Financial Domain Adaptation of Chinese Large Language Models
by: Zhao, Shujuan, et al.
Published: (2024)
by: Zhao, Shujuan, et al.
Published: (2024)
Towards Training A Chinese Large Language Model for Anesthesiology
by: Wang, Zhonghai, et al.
Published: (2024)
by: Wang, Zhonghai, et al.
Published: (2024)
A Survey on Benchmarks of Multimodal Large Language Models
by: Li, Jian, et al.
Published: (2024)
by: Li, Jian, et al.
Published: (2024)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
by: Wu, Mengyang, et al.
Published: (2024)
by: Wu, Mengyang, et al.
Published: (2024)
Similar Items
-
CFBenchmark: Chinese Financial Assistant Benchmark for Large Language Model
by: Lei, Yang, et al.
Published: (2023) -
FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design
by: Lan, Kai, et al.
Published: (2025) -
FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting
by: Zhu, Yiyun, et al.
Published: (2026) -
InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-Guided Reasoning and Optimization for Debating
by: Wang, Fuyu, et al.
Published: (2025) -
FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation
by: Zhu, Jiayong, et al.
Published: (2026)