FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yan, Wang, Keyi, Yang, Shanshan, Patel, Jaisal, Zhao, Jeff, Mo, Fengran, Peng, Xueqing, Qian, Lingfei, Chen, Yankai, Gutiérrez-Basulto, Víctor, Huang, Jimin, Xiong, Guojun, Liu, Xiao-Yang, Liu, Xue, Nie, Jian-Yun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation
by: Wang, Yan, et al.
Published: (2026)
by: Wang, Yan, et al.
Published: (2026)
FinLoRA: Benchmarking LoRA Methods for Fine-Tuning LLMs on Financial Datasets
by: Wang, Dannong, et al.
Published: (2025)
by: Wang, Dannong, et al.
Published: (2025)
FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
by: He, Yueru, et al.
Published: (2025)
by: He, Yueru, et al.
Published: (2025)
MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
by: Peng, Xueqing, et al.
Published: (2025)
by: Peng, Xueqing, et al.
Published: (2025)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
by: Huang, Jimin, et al.
Published: (2024)
by: Huang, Jimin, et al.
Published: (2024)
Open FinLLM Leaderboard: Towards Financial AI Readiness
by: Lin, Shengyuan Colin, et al.
Published: (2025)
by: Lin, Shengyuan Colin, et al.
Published: (2025)
zkFinGPT: Zero-Knowledge Proofs for Financial Generative Pre-trained Transformers
by: Liu, Xiao-Yang, et al.
Published: (2026)
by: Liu, Xiao-Yang, et al.
Published: (2026)
Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading
by: Giannouris, Polydoros, et al.
Published: (2026)
by: Giannouris, Polydoros, et al.
Published: (2026)
Reasoning Models Ace the CFA Exams
by: Patel, Jaisal, et al.
Published: (2025)
by: Patel, Jaisal, et al.
Published: (2025)
The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems
by: Xie, Zhuohan, et al.
Published: (2026)
by: Xie, Zhuohan, et al.
Published: (2026)
Boosting Biomedical Concept Extraction by Rule-Based Data Augmentation
by: Shao, Qiwei, et al.
Published: (2024)
by: Shao, Qiwei, et al.
Published: (2024)
A Report on Financial Regulations Challenge at COLING 2025
by: Wang, Keyi, et al.
Published: (2024)
by: Wang, Keyi, et al.
Published: (2024)
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
by: Cao, Yupeng, et al.
Published: (2026)
by: Cao, Yupeng, et al.
Published: (2026)
FLAG-Trader: Fusion LLM-Agent with Gradient-based Reinforcement Learning for Financial Trading
by: Xiong, Guojun, et al.
Published: (2025)
by: Xiong, Guojun, et al.
Published: (2025)
Evaluation and Benchmarking Suite for Financial Large Language Models and Agents
by: Lin, Shengyuan, et al.
Published: (2026)
by: Lin, Shengyuan, et al.
Published: (2026)
FinRL Contests: Benchmarking Data-driven Financial Reinforcement Learning Agents
by: Wang, Keyi, et al.
Published: (2025)
by: Wang, Keyi, et al.
Published: (2025)
FinReporting: An Agentic Workflow for Localized Reporting of Cross-Jurisdiction Financial Disclosures
by: Zhang, Fan, et al.
Published: (2026)
by: Zhang, Fan, et al.
Published: (2026)
FinBen: A Holistic Financial Benchmark for Large Language Models
by: Xie, Qianqian, et al.
Published: (2024)
by: Xie, Qianqian, et al.
Published: (2024)
Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
by: Zhang, Shuo, et al.
Published: (2025)
by: Zhang, Shuo, et al.
Published: (2025)
Conversational Search: From Fundamentals to Frontiers in the LLM Era
by: Mo, Fengran, et al.
Published: (2025)
by: Mo, Fengran, et al.
Published: (2025)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
by: Li, Haohang, et al.
Published: (2024)
by: Li, Haohang, et al.
Published: (2024)
FinGPT: Open-Source Financial Large Language Models
by: Yang, Hongyang, et al.
Published: (2023)
by: Yang, Hongyang, et al.
Published: (2023)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
by: Wang, Jiayin, et al.
Published: (2024)
by: Wang, Jiayin, et al.
Published: (2024)
FinCon: A Synthesized LLM Multi-Agent System with Conceptual Verbal Reinforcement for Enhanced Financial Decision Making
by: Yu, Yangyang, et al.
Published: (2024)
by: Yu, Yangyang, et al.
Published: (2024)
Fino1: On the Transferability of Reasoning-Enhanced LLMs and Reinforcement Learning to Finance
by: Qian, Lingfei, et al.
Published: (2025)
by: Qian, Lingfei, et al.
Published: (2025)
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
by: Xie, Zhuohan, et al.
Published: (2025)
by: Xie, Zhuohan, et al.
Published: (2025)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
by: Cao, Yupeng, et al.
Published: (2025)
by: Cao, Yupeng, et al.
Published: (2025)
ReAttn: Improving Attention-based Re-ranking via Attention Re-weighting
by: Tian, Yuxing, et al.
Published: (2026)
by: Tian, Yuxing, et al.
Published: (2026)
Revisiting Ensemble Methods for Stock Trading and Crypto Trading Tasks at ACM ICAIF FinRL Contest 2023-2024
by: Holzer, Nikolaus, et al.
Published: (2025)
by: Holzer, Nikolaus, et al.
Published: (2025)
AraFinNews: Arabic Financial Summarisation with Domain-Adapted LLMs
by: El-Haj, Mo, et al.
Published: (2025)
by: El-Haj, Mo, et al.
Published: (2025)
Learning to Route Queries to Heads for Attention-based Re-ranking with Large Language Models
by: Tian, Yuxing, et al.
Published: (2026)
by: Tian, Yuxing, et al.
Published: (2026)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
by: Guo, Xin, et al.
Published: (2023)
by: Guo, Xin, et al.
Published: (2023)
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
by: Liu, Zhiwei, et al.
Published: (2025)
by: Liu, Zhiwei, et al.
Published: (2025)
CSMD: Curated Multimodal Dataset for Chinese Stock Analysis
by: Liu, Yu, et al.
Published: (2025)
by: Liu, Yu, et al.
Published: (2025)
CHIQ: Contextual History Enhancement for Improving Query Rewriting in Conversational Search
by: Mo, Fengran, et al.
Published: (2024)
by: Mo, Fengran, et al.
Published: (2024)
When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents
by: Qian, Lingfei, et al.
Published: (2025)
by: Qian, Lingfei, et al.
Published: (2025)
FinGPT-HPC: Efficient Pretraining and Finetuning Large Language Models for Financial Applications with High-Performance Computing
by: Liu, Xiao-Yang, et al.
Published: (2024)
by: Liu, Xiao-Yang, et al.
Published: (2024)
CroSearch-R1: Better Leveraging Cross-lingual Knowledge for Retrieval-Augmented Generation
by: Qi, Rui, et al.
Published: (2026)
by: Qi, Rui, et al.
Published: (2026)
ConvSDG: Session Data Generation for Conversational Search
by: Mo, Fengran, et al.
Published: (2024)
by: Mo, Fengran, et al.
Published: (2024)
Similar Items
-
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
by: Wang, Yan, et al.
Published: (2025) -
Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation
by: Wang, Yan, et al.
Published: (2026) -
FinLoRA: Benchmarking LoRA Methods for Fine-Tuning LLMs on Financial Datasets
by: Wang, Dannong, et al.
Published: (2025) -
FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
by: He, Yueru, et al.
Published: (2025) -
MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
by: Peng, Xueqing, et al.
Published: (2025)