Enterprise Benchmarks for Large Language Model Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Bing, Takeuchi, Mikio, Kawahara, Ryo, Asthana, Shubhi, Hossain, Md. Maruf, Ren, Guang-Jie, Soule, Kate, Zhu, Yada |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluation and Benchmarking Suite for Financial Large Language Models and Agents
by: Lin, Shengyuan, et al.
Published: (2026)
by: Lin, Shengyuan, et al.
Published: (2026)
Evaluating Large Language Models (LLMs) in Financial NLP: A Comparative Study on Financial Report Analysis
by: Mohsin, Md Talha
Published: (2025)
by: Mohsin, Md Talha
Published: (2025)
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
by: Yang, Yuzhe, et al.
Published: (2024)
by: Yang, Yuzhe, et al.
Published: (2024)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
by: Wu, Xiaojun, et al.
Published: (2024)
by: Wu, Xiaojun, et al.
Published: (2024)
FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation
by: Zhu, Jiayong, et al.
Published: (2026)
by: Zhu, Jiayong, et al.
Published: (2026)
Benchmarking Large Language Models for Polymer Property Predictions
by: Gupta, Sonakshi, et al.
Published: (2025)
by: Gupta, Sonakshi, et al.
Published: (2025)
Smart Contracts, Smarter Payments: Innovating Cross Border Payments and Reporting Transactions
by: Mridul, Maruf Ahmed, et al.
Published: (2024)
by: Mridul, Maruf Ahmed, et al.
Published: (2024)
From Text to Returns: Using Large Language Models for Mutual Fund Portfolio Optimization and Risk-Adjusted Allocation
by: Hossain, Abrar, et al.
Published: (2025)
by: Hossain, Abrar, et al.
Published: (2025)
No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks
by: Hu, Gang, et al.
Published: (2024)
by: Hu, Gang, et al.
Published: (2024)
From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial Large Language Models
by: Kuang, Ziyan, et al.
Published: (2025)
by: Kuang, Ziyan, et al.
Published: (2025)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
by: Huang, Jimin, et al.
Published: (2024)
by: Huang, Jimin, et al.
Published: (2024)
BEMEval-Doc2Schema: Benchmarking Large Language Models for Structured Data Extraction in Building Energy Modeling
by: Jia, Yiyuan, et al.
Published: (2026)
by: Jia, Yiyuan, et al.
Published: (2026)
AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial Markets
by: Fan, Tianyu, et al.
Published: (2025)
by: Fan, Tianyu, et al.
Published: (2025)
LaMP-Val: Large Language Models Empower Personalized Valuation in Auction
by: Sun, Jie, et al.
Published: (2024)
by: Sun, Jie, et al.
Published: (2024)
BizCompass: Benchmarking the Reasoning Capabilities of LLMs in Business Knowledge and Applications
by: Hao, Jianing, et al.
Published: (2026)
by: Hao, Jianing, et al.
Published: (2026)
AFBench: A Large-scale Benchmark for Airfoil Design
by: Liu, Jian, et al.
Published: (2024)
by: Liu, Jian, et al.
Published: (2024)
StockGenChaR: A Study on the Evaluation of Large Vision-Language Models on Stock Chart Captioning
by: Qiu, Le, et al.
Published: (2024)
by: Qiu, Le, et al.
Published: (2024)
NumLLM: Numeric-Sensitive Large Language Model for Chinese Finance
by: Su, Huan-Yi, et al.
Published: (2024)
by: Su, Huan-Yi, et al.
Published: (2024)
MFMDQwen: Multilingual Financial Misinformation Detection Based on Large Language Model
by: Liu, Zhiwei, et al.
Published: (2026)
by: Liu, Zhiwei, et al.
Published: (2026)
MMFCTUB: Multi-Modal Financial Credit Table Understanding Benchmark
by: Yakun, Cui, et al.
Published: (2026)
by: Yakun, Cui, et al.
Published: (2026)
FinBen: A Holistic Financial Benchmark for Large Language Models
by: Xie, Qianqian, et al.
Published: (2024)
by: Xie, Qianqian, et al.
Published: (2024)
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
by: Guo, Sikun, et al.
Published: (2024)
by: Guo, Sikun, et al.
Published: (2024)
All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
by: Jiang, Yuechen, et al.
Published: (2026)
by: Jiang, Yuechen, et al.
Published: (2026)
Connectomics Informed by Large Language Models
by: Thompson, Elinor, et al.
Published: (2025)
by: Thompson, Elinor, et al.
Published: (2025)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
by: Li, Haohang, et al.
Published: (2024)
by: Li, Haohang, et al.
Published: (2024)
Design and Implementation of Fixtures for Milling,Shaping and Drilling Operations
by: Newaz, Abdullah Al Hossain, et al.
Published: (2025)
by: Newaz, Abdullah Al Hossain, et al.
Published: (2025)
DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering
by: Li, Yinsheng, et al.
Published: (2025)
by: Li, Yinsheng, et al.
Published: (2025)
RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding
by: Xiao, Xi, et al.
Published: (2025)
by: Xiao, Xi, et al.
Published: (2025)
QuantBench: Benchmarking AI Methods for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2025)
by: Wang, Saizhuo, et al.
Published: (2025)
Using Large Language Models for Solving Thermodynamic Problems
by: Loubet, Rebecca, et al.
Published: (2025)
by: Loubet, Rebecca, et al.
Published: (2025)
Finetuning Large Language Model as an Effective Symbolic Regressor
by: Hua, Yingfan, et al.
Published: (2025)
by: Hua, Yingfan, et al.
Published: (2025)
Tokenizing Stock Prices for Enhanced Multi-Step Forecast and Prediction
by: Zhu, Zhuohang, et al.
Published: (2025)
by: Zhu, Zhuohang, et al.
Published: (2025)
Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings
by: Jiang, Yidong, et al.
Published: (2026)
by: Jiang, Yidong, et al.
Published: (2026)
FLAME: Financial Large-Language Model Assessment and Metrics Evaluation
by: Guo, Jiayu, et al.
Published: (2025)
by: Guo, Jiayu, et al.
Published: (2025)
Constructing Mechanical Design Agent Based on Large Language Models
by: Lu, Jiaxing, et al.
Published: (2024)
by: Lu, Jiaxing, et al.
Published: (2024)
PINNsAgent: Automated PDE Surrogation with Large Language Models
by: Wuwu, Qingpo, et al.
Published: (2025)
by: Wuwu, Qingpo, et al.
Published: (2025)
TaxAI: A Dynamic Economic Simulator and Benchmark for Multi-Agent Reinforcement Learning
by: Mi, Qirui, et al.
Published: (2023)
by: Mi, Qirui, et al.
Published: (2023)
A Dutch Financial Large Language Model
by: Noels, Sander, et al.
Published: (2024)
by: Noels, Sander, et al.
Published: (2024)
Developing an ESG-Oriented Large Language Model through ESG Practices
by: Assis, Gabriel, et al.
Published: (2026)
by: Assis, Gabriel, et al.
Published: (2026)
Agent-Based Simulation of a Financial Market with Large Language Models
by: Hashimoto, Ryuji, et al.
Published: (2025)
by: Hashimoto, Ryuji, et al.
Published: (2025)
Similar Items
-
Evaluation and Benchmarking Suite for Financial Large Language Models and Agents
by: Lin, Shengyuan, et al.
Published: (2026) -
Evaluating Large Language Models (LLMs) in Financial NLP: A Comparative Study on Financial Report Analysis
by: Mohsin, Md Talha
Published: (2025) -
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
by: Yang, Yuzhe, et al.
Published: (2024) -
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
by: Wu, Xiaojun, et al.
Published: (2024) -
FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation
by: Zhu, Jiayong, et al.
Published: (2026)