Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Xiaojun, Liu, Junxi, Su, Huanyi, Lin, Zhouchi, Qi, Yiyan, Xu, Chengjin, Su, Jiajun, Zhong, Jiajie, Wang, Fuwei, Wang, Saizhuo, Hua, Fengrui, Li, Jia, Guo, Jian |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
QuantBench: Benchmarking AI Methods for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2025)
by: Wang, Saizhuo, et al.
Published: (2025)
Guided Learning: Lubricating End-to-End Modeling for Multi-stage Decision-making
by: Guo, Jian, et al.
Published: (2024)
by: Guo, Jian, et al.
Published: (2024)
Financial Wind Tunnel: A Retrieval-Augmented Market Simulator
by: Cao, Bokai, et al.
Published: (2025)
by: Cao, Bokai, et al.
Published: (2025)
From Volatility to Variance: A Skew-Enhanced SABR Model and Its Empirical Study in the Chinese Financial Options Market
by: Zhang, Wenxuan, et al.
Published: (2026)
by: Zhang, Wenxuan, et al.
Published: (2026)
Unleashing Expert Opinion from Social Media for Stock Prediction
by: Zhou, Wanyun, et al.
Published: (2025)
by: Zhou, Wanyun, et al.
Published: (2025)
Alpha-GPT 2.0: Human-in-the-Loop AI for Quantitative Investment
by: Yuan, Hang, et al.
Published: (2024)
by: Yuan, Hang, et al.
Published: (2024)
Unveiling the Potential of Sentiment: Can Large Language Models Predict Chinese Stock Price Movements?
by: Zhang, Haohan, et al.
Published: (2023)
by: Zhang, Haohan, et al.
Published: (2023)
DeltaLag: Learning Dynamic Lead-Lag Patterns in Financial Markets
by: Zhou, Wanyun, et al.
Published: (2025)
by: Zhou, Wanyun, et al.
Published: (2025)
DSPO: An End-to-End Framework for Direct Sorted Portfolio Construction
by: Zhong, Jianyuan, et al.
Published: (2024)
by: Zhong, Jianyuan, et al.
Published: (2024)
QuantAgent: Seeking Holy Grail in Trading by Self-Improving Large Language Model
by: Wang, Saizhuo, et al.
Published: (2024)
by: Wang, Saizhuo, et al.
Published: (2024)
From Deep Learning to LLMs: A survey of AI in Quantitative Investment
by: Cao, Bokai, et al.
Published: (2025)
by: Cao, Bokai, et al.
Published: (2025)
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
by: Yang, Yuzhe, et al.
Published: (2024)
by: Yang, Yuzhe, et al.
Published: (2024)
Alpha-GPT: Human-AI Interactive Alpha Mining for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2023)
by: Wang, Saizhuo, et al.
Published: (2023)
AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial Markets
by: Fan, Tianyu, et al.
Published: (2025)
by: Fan, Tianyu, et al.
Published: (2025)
FinanceReasoning: Benchmarking Financial Numerical Reasoning More Credible, Comprehensive and Challenging
by: Tang, Zichen, et al.
Published: (2025)
by: Tang, Zichen, et al.
Published: (2025)
FinMultiTime: A Four-Modal Bilingual Dataset for Financial Time-Series Analysis
by: Xu, Wenyan, et al.
Published: (2025)
by: Xu, Wenyan, et al.
Published: (2025)
All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
by: Jiang, Yuechen, et al.
Published: (2026)
by: Jiang, Yuechen, et al.
Published: (2026)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
by: Li, Haohang, et al.
Published: (2024)
by: Li, Haohang, et al.
Published: (2024)
Construction of a Japanese Financial Benchmark for Large Language Models
by: Hirano, Masanori
Published: (2024)
by: Hirano, Masanori
Published: (2024)
MMFCTUB: Multi-Modal Financial Credit Table Understanding Benchmark
by: Yakun, Cui, et al.
Published: (2026)
by: Yakun, Cui, et al.
Published: (2026)
Evaluation and Benchmarking Suite for Financial Large Language Models and Agents
by: Lin, Shengyuan, et al.
Published: (2026)
by: Lin, Shengyuan, et al.
Published: (2026)
Modeling News Interactions and Influence for Financial Market Prediction
by: Wang, Mengyu, et al.
Published: (2024)
by: Wang, Mengyu, et al.
Published: (2024)
Modeling of Measurement Error in Financial Returns Data
by: Jasra, Ajay, et al.
Published: (2024)
by: Jasra, Ajay, et al.
Published: (2024)
FinTSB: A Comprehensive and Practical Benchmark for Financial Time Series Forecasting
by: Hu, Yifan, et al.
Published: (2025)
by: Hu, Yifan, et al.
Published: (2025)
Financial Knowledge Large Language Model
by: Yang, Cehao, et al.
Published: (2024)
by: Yang, Cehao, et al.
Published: (2024)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Actors, Frames and Arguments: A Multi-Decade Computational Analysis of Climate Discourse in Financial News using Large Language Models
by: Su, Ruiran, et al.
Published: (2026)
by: Su, Ruiran, et al.
Published: (2026)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
by: Huang, Jimin, et al.
Published: (2024)
by: Huang, Jimin, et al.
Published: (2024)
FinSight: Towards Real-World Financial Deep Research
by: Jin, Jiajie, et al.
Published: (2025)
by: Jin, Jiajie, et al.
Published: (2025)
FinRL Contests: Benchmarking Data-driven Financial Reinforcement Learning Agents
by: Wang, Keyi, et al.
Published: (2025)
by: Wang, Keyi, et al.
Published: (2025)
FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Identifying and Quantifying Financial Bubbles with the Hyped Log-Periodic Power Law Model
by: Cao, Zheng, et al.
Published: (2025)
by: Cao, Zheng, et al.
Published: (2025)
Collaborative Optimization in Financial Data Mining Through Deep Learning and ResNeXt
by: Feng, Pengbin, et al.
Published: (2024)
by: Feng, Pengbin, et al.
Published: (2024)
Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks
by: Bigeard, Antoine, et al.
Published: (2025)
by: Bigeard, Antoine, et al.
Published: (2025)
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
by: Kumar, Mahesh, et al.
Published: (2026)
by: Kumar, Mahesh, et al.
Published: (2026)
No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks
by: Hu, Gang, et al.
Published: (2024)
by: Hu, Gang, et al.
Published: (2024)
Machine Learning Methods for Pricing Financial Derivatives
by: Fan, Lei, et al.
Published: (2024)
by: Fan, Lei, et al.
Published: (2024)
Representation Learning of Limit Order Book: A Comprehensive Study and Benchmarking
by: Zhong, Muyao, et al.
Published: (2025)
by: Zhong, Muyao, et al.
Published: (2025)
On Quantum BSDE Solver for High-Dimensional Parabolic PDEs
by: Su, Howard, et al.
Published: (2025)
by: Su, Howard, et al.
Published: (2025)
The Statistical Significance of the Inclusion of Graph Neural Networks in the Financial Time Series Forecasting Problem
by: Gregnanin, Marco, et al.
Published: (2026)
by: Gregnanin, Marco, et al.
Published: (2026)
Similar Items
-
QuantBench: Benchmarking AI Methods for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2025) -
Guided Learning: Lubricating End-to-End Modeling for Multi-stage Decision-making
by: Guo, Jian, et al.
Published: (2024) -
Financial Wind Tunnel: A Retrieval-Augmented Market Simulator
by: Cao, Bokai, et al.
Published: (2025) -
From Volatility to Variance: A Skew-Enhanced SABR Model and Its Empirical Study in the Chinese Financial Options Market
by: Zhang, Wenxuan, et al.
Published: (2026) -
Unleashing Expert Opinion from Social Media for Stock Prediction
by: Zhou, Wanyun, et al.
Published: (2025)