CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nie, Ying, Yan, Binwei, Guo, Tianyu, Liu, Hao, Wang, Haoyu, He, Wei, Zheng, Binfan, Wang, Weihao, Li, Qiang, Sun, Weijian, Wang, Yunhe, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UFineBench: Towards Text-based Person Retrieval with Ultra-fine Granularity
par: Zuo, Jialong, et autres
Publié: (2023)
par: Zuo, Jialong, et autres
Publié: (2023)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
par: Zhou, Chengfeng, et autres
Publié: (2025)
par: Zhou, Chengfeng, et autres
Publié: (2025)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
par: Nie, Yiqi, et autres
Publié: (2026)
par: Nie, Yiqi, et autres
Publié: (2026)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
par: Zhang, Qian, et autres
Publié: (2024)
par: Zhang, Qian, et autres
Publié: (2024)
ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language Models
par: Liu, Xuxu, et autres
Publié: (2025)
par: Liu, Xuxu, et autres
Publié: (2025)
MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles
par: Han, Jing, et autres
Publié: (2025)
par: Han, Jing, et autres
Publié: (2025)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
par: Zhang, Min, et autres
Publié: (2025)
par: Zhang, Min, et autres
Publié: (2025)
High-Quality Facial Albedo Generation for 3D Face Reconstruction from a Single Image using a Coarse-to-Fine Approach
par: Dai, Jiashu, et autres
Publié: (2025)
par: Dai, Jiashu, et autres
Publié: (2025)
FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
par: Yuan, Botai, et autres
Publié: (2025)
par: Yuan, Botai, et autres
Publié: (2025)
Poly-FEVER: A Multilingual Fact Verification Benchmark for Hallucination Detection in Large Language Models
par: Zhang, Hanzhi, et autres
Publié: (2025)
par: Zhang, Hanzhi, et autres
Publié: (2025)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
par: Song, Xiaoshuai, et autres
Publié: (2024)
par: Song, Xiaoshuai, et autres
Publié: (2024)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
par: Chen, Michael K., et autres
Publié: (2025)
par: Chen, Michael K., et autres
Publié: (2025)
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
par: Chen, Yelin, et autres
Publié: (2026)
par: Chen, Yelin, et autres
Publié: (2026)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
par: Tang, Anke, et autres
Publié: (2024)
par: Tang, Anke, et autres
Publié: (2024)
Unshackling Context Length: An Efficient Selective Attention Approach through Query-Key Compression
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
par: Ouyang, Zetian, et autres
Publié: (2024)
par: Ouyang, Zetian, et autres
Publié: (2024)
DHG-Bench: A Comprehensive Benchmark for Deep Hypergraph Learning
par: Li, Fan, et autres
Publié: (2025)
par: Li, Fan, et autres
Publié: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
par: Wang, Lu, et autres
Publié: (2025)
par: Wang, Lu, et autres
Publié: (2025)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
par: Liu, Shuyi, et autres
Publié: (2025)
par: Liu, Shuyi, et autres
Publié: (2025)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
par: Zhang, Qiaohong, et autres
Publié: (2026)
par: Zhang, Qiaohong, et autres
Publié: (2026)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
par: Yue, Wenjing, et autres
Publié: (2024)
par: Yue, Wenjing, et autres
Publié: (2024)
SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
par: Chen, Jingxuan, et autres
Publié: (2024)
par: Chen, Jingxuan, et autres
Publié: (2024)
DenseMamba: State Space Models with Dense Hidden Connection for Efficient Large Language Models
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
PoseBench: Benchmarking the Robustness of Pose Estimation Models under Corruptions
par: Ma, Sihan, et autres
Publié: (2024)
par: Ma, Sihan, et autres
Publié: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
par: Wang, Sibo, et autres
Publié: (2024)
par: Wang, Sibo, et autres
Publié: (2024)
PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models
par: Wang, Yuwen, et autres
Publié: (2026)
par: Wang, Yuwen, et autres
Publié: (2026)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
par: Li, Yang, et autres
Publié: (2026)
par: Li, Yang, et autres
Publié: (2026)
C$^{3}$Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models
par: Cao, Jiahuan, et autres
Publié: (2024)
par: Cao, Jiahuan, et autres
Publié: (2024)
Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks
par: Zheng, Xu, et autres
Publié: (2023)
par: Zheng, Xu, et autres
Publié: (2023)
Gold-YOLO: Efficient Object Detector via Gather-and-Distribute Mechanism
par: Wang, Chengcheng, et autres
Publié: (2023)
par: Wang, Chengcheng, et autres
Publié: (2023)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
par: Guo, Xin, et autres
Publié: (2023)
par: Guo, Xin, et autres
Publié: (2023)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
par: Wu, Xiaojun, et autres
Publié: (2024)
par: Wu, Xiaojun, et autres
Publié: (2024)
The “Halo” of Financial Innovation: Financial Technology and Total Factor Productivity Growth in Chinese Energy Companies
par: Yafei Kang, et autres
Publié: (2026)
par: Yafei Kang, et autres
Publié: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
par: Gao, Zeyu, et autres
Publié: (2025)
par: Gao, Zeyu, et autres
Publié: (2025)
Nexus: Higher-Order Attention Mechanisms in Transformers
par: Chen, Hanting, et autres
Publié: (2025)
par: Chen, Hanting, et autres
Publié: (2025)
Documents similaires
-
UFineBench: Towards Text-based Person Retrieval with Ultra-fine Granularity
par: Zuo, Jialong, et autres
Publié: (2023) -
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
par: Zhou, Chengfeng, et autres
Publié: (2025) -
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
par: Nie, Yuxiang, et autres
Publié: (2025) -
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
par: Nie, Yiqi, et autres
Publié: (2026) -
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
par: Zhang, Qian, et autres
Publié: (2024)