Saved in:
| Main Authors: | Liu, Shu, Zhao, Shangqing, Jia, Chenghao, Zhuang, Xinlin, Long, Zhaoguang, Zhou, Jie, Zhou, Aimin, Lan, Man, Wu, Qingquan, Yang, Chong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2401.02982 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Fùxì: A Benchmark for Evaluating Language Models on Ancient Chinese Text Understanding and Generation
by: Zhao, Shangqing, et al.
Published: (2025)
by: Zhao, Shangqing, et al.
Published: (2025)
Cause-Aware Empathetic Response Generation via Chain-of-Thought Fine-Tuning
by: Chen, Xinhao, et al.
Published: (2024)
by: Chen, Xinhao, et al.
Published: (2024)
ConDABench: Interactive Evaluation of Language Models for Data Analysis
by: Dutta, Avik, et al.
Published: (2025)
by: Dutta, Avik, et al.
Published: (2025)
A Survey on Temporal Knowledge Graph: Representation Learning and Applications
by: Cai, Li, et al.
Published: (2024)
by: Cai, Li, et al.
Published: (2024)
CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry
by: Zhao, Shangqing, et al.
Published: (2026)
by: Zhao, Shangqing, et al.
Published: (2026)
InfiAgent-DABench: Evaluating Agents on Data Analysis Tasks
by: Hu, Xueyu, et al.
Published: (2024)
by: Hu, Xueyu, et al.
Published: (2024)
FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents
by: Kim, Eric Y., et al.
Published: (2026)
by: Kim, Eric Y., et al.
Published: (2026)
Towards Comprehensive Argument Analysis in Education: Dataset, Tasks, and Method
by: Ren, Yupei, et al.
Published: (2025)
by: Ren, Yupei, et al.
Published: (2025)
FinBen: A Holistic Financial Benchmark for Large Language Models
by: Xie, Qianqian, et al.
Published: (2024)
by: Xie, Qianqian, et al.
Published: (2024)
FinTruthQA: A Benchmark for AI-Driven Financial Disclosure Quality Assessment in Investor -- Firm Interactions
by: Zhou, Peilin, et al.
Published: (2024)
by: Zhou, Peilin, et al.
Published: (2024)
FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
by: Shu, Dong, et al.
Published: (2025)
by: Shu, Dong, et al.
Published: (2025)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
by: Cao, Yupeng, et al.
Published: (2025)
by: Cao, Yupeng, et al.
Published: (2025)
Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models
by: Zhu, Jie, et al.
Published: (2025)
by: Zhu, Jie, et al.
Published: (2025)
Zentrum und Peripherien in der chinesischen Geschichte
by: Zhaoguang, Ge
Published: (2024)
by: Zhaoguang, Ge
Published: (2024)
MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
by: Peng, Xueqing, et al.
Published: (2025)
by: Peng, Xueqing, et al.
Published: (2025)
Neuro-Symbolic Artificial Intelligence: Towards Improving the Reasoning Abilities of Large Language Models
by: Yang, Xiao-Wen, et al.
Published: (2025)
by: Yang, Xiao-Wen, et al.
Published: (2025)
DABench-LLM: Standardized and In-Depth Benchmarking of Post-Moore Dataflow AI Accelerators for LLMs
by: Hu, Ziyu, et al.
Published: (2025)
by: Hu, Ziyu, et al.
Published: (2025)
FinLLMs: A Framework for Financial Reasoning Dataset Generation with Large Language Models
by: Yuan, Ziqiang, et al.
Published: (2024)
by: Yuan, Ziqiang, et al.
Published: (2024)
FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification
by: Panda, Silu
Published: (2026)
by: Panda, Silu
Published: (2026)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
by: Guo, Xin, et al.
Published: (2023)
by: Guo, Xin, et al.
Published: (2023)
Fin-Fact: A Benchmark Dataset for Multimodal Financial Fact Checking and Explanation Generation
by: Rangapur, Aman, et al.
Published: (2023)
by: Rangapur, Aman, et al.
Published: (2023)
FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting
by: Zhu, Yiyun, et al.
Published: (2026)
by: Zhu, Yiyun, et al.
Published: (2026)
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
by: Wang, Zekun Moore, et al.
Published: (2023)
by: Wang, Zekun Moore, et al.
Published: (2023)
FinBloom: Knowledge Grounding Large Language Model with Real-time Financial Data
by: Sinha, Ankur, et al.
Published: (2025)
by: Sinha, Ankur, et al.
Published: (2025)
GrifFinNet: A Graph-Relation Integrated Transformer for Financial Predictions
by: Dai, Chenlanhui, et al.
Published: (2025)
by: Dai, Chenlanhui, et al.
Published: (2025)
Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA
by: Li, Zhanli, et al.
Published: (2026)
by: Li, Zhanli, et al.
Published: (2026)
Financial Sentiment Analysis on News and Reports Using Large Language Models and FinBERT
by: Shen, Yanxin, et al.
Published: (2024)
by: Shen, Yanxin, et al.
Published: (2024)
Beyond Benchmarking: A New Paradigm for Evaluation and Assessment of Large Language Models
by: Liu, Jin, et al.
Published: (2024)
by: Liu, Jin, et al.
Published: (2024)
FinGPT: Open-Source Financial Large Language Models
by: Yang, Hongyang, et al.
Published: (2023)
by: Yang, Hongyang, et al.
Published: (2023)
IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text
by: Pall, Rajveer Singh
Published: (2026)
by: Pall, Rajveer Singh
Published: (2026)
FinDPO: Financial Sentiment Analysis for Algorithmic Trading through Preference Optimization of LLMs
by: Iacovides, Giorgos, et al.
Published: (2025)
by: Iacovides, Giorgos, et al.
Published: (2025)
FinRL Contests: Benchmarking Data-driven Financial Reinforcement Learning Agents
by: Wang, Keyi, et al.
Published: (2025)
by: Wang, Keyi, et al.
Published: (2025)
FinTSB: A Comprehensive and Practical Benchmark for Financial Time Series Forecasting
by: Hu, Yifan, et al.
Published: (2025)
by: Hu, Yifan, et al.
Published: (2025)
Large Language Models as Surrogate Models in Evolutionary Algorithms: A Preliminary Study
by: Hao, Hao, et al.
Published: (2024)
by: Hao, Hao, et al.
Published: (2024)
AlphaFin: Benchmarking Financial Analysis with Retrieval-Augmented Stock-Chain Framework
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models
by: Li, Lingyao, et al.
Published: (2025)
by: Li, Lingyao, et al.
Published: (2025)
FinForge: Semi-Synthetic Financial Benchmark Generation
by: Matlin, Glenn, et al.
Published: (2026)
by: Matlin, Glenn, et al.
Published: (2026)
Temporal Knowledge Graph Completion with Time-sensitive Relations in Hypercomplex Space
by: Cai, Li, et al.
Published: (2024)
by: Cai, Li, et al.
Published: (2024)
FinDebate: Multi-Agent Collaborative Intelligence for Financial Analysis
by: Cai, Tianshi, et al.
Published: (2025)
by: Cai, Tianshi, et al.
Published: (2025)
BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese
by: Zhou, Peilin, et al.
Published: (2025)
by: Zhou, Peilin, et al.
Published: (2025)
Similar Items
-
Fùxì: A Benchmark for Evaluating Language Models on Ancient Chinese Text Understanding and Generation
by: Zhao, Shangqing, et al.
Published: (2025) -
Cause-Aware Empathetic Response Generation via Chain-of-Thought Fine-Tuning
by: Chen, Xinhao, et al.
Published: (2024) -
ConDABench: Interactive Evaluation of Language Models for Data Analysis
by: Dutta, Avik, et al.
Published: (2025) -
A Survey on Temporal Knowledge Graph: Representation Learning and Applications
by: Cai, Li, et al.
Published: (2024) -
CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry
by: Zhao, Shangqing, et al.
Published: (2026)