FLAME: Financial Large-Language Model Assessment and Metrics Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Jiayu, Guo, Yu, Li, Martha, Tan, Songtao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FinBen: A Holistic Financial Benchmark for Large Language Models
by: Xie, Qianqian, et al.
Published: (2024)
by: Xie, Qianqian, et al.
Published: (2024)
Evaluating Large Language Models (LLMs) in Financial NLP: A Comparative Study on Financial Report Analysis
by: Mohsin, Md Talha
Published: (2025)
by: Mohsin, Md Talha
Published: (2025)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
by: Lu, Guilong, et al.
Published: (2025)
by: Lu, Guilong, et al.
Published: (2025)
Utilizing Modern Large Language Models (LLM) for Financial Trend Analysis and Digest Creation
by: Lazarev, Andrei, et al.
Published: (2025)
by: Lazarev, Andrei, et al.
Published: (2025)
Enterprise Benchmarks for Large Language Model Evaluation
by: Zhang, Bing, et al.
Published: (2024)
by: Zhang, Bing, et al.
Published: (2024)
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
by: Guo, Sikun, et al.
Published: (2024)
by: Guo, Sikun, et al.
Published: (2024)
ASDA: Automated Skill Distillation and Adaptation for Financial Reasoning
by: Yim, Tik Yu, et al.
Published: (2026)
by: Yim, Tik Yu, et al.
Published: (2026)
Modeling News Interactions and Influence for Financial Market Prediction
by: Wang, Mengyu, et al.
Published: (2024)
by: Wang, Mengyu, et al.
Published: (2024)
SECQUE: A Benchmark for Evaluating Real-World Financial Analysis Capabilities
by: Yoash, Noga Ben, et al.
Published: (2025)
by: Yoash, Noga Ben, et al.
Published: (2025)
Finance Language Model Evaluation (FLaME)
by: Matlin, Glenn, et al.
Published: (2025)
by: Matlin, Glenn, et al.
Published: (2025)
LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset
by: Yu, Botao, et al.
Published: (2024)
by: Yu, Botao, et al.
Published: (2024)
The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems
by: Xie, Zhuohan, et al.
Published: (2026)
by: Xie, Zhuohan, et al.
Published: (2026)
EUR-USD Exchange Rate Forecasting Based on Information Fusion with Large Language Models and Deep Learning Methods
by: Ding, Hongcheng, et al.
Published: (2024)
by: Ding, Hongcheng, et al.
Published: (2024)
Opportunities for Large Language Models and Discourse in Engineering Design
by: Göpfert, Jan, et al.
Published: (2023)
by: Göpfert, Jan, et al.
Published: (2023)
Redefining Evaluation Standards: A Unified Framework for Evaluating the Korean Capabilities of Language Models
by: Lee, Hanwool, et al.
Published: (2025)
by: Lee, Hanwool, et al.
Published: (2025)
RAMIE: Retrieval-Augmented Multi-task Information Extraction with Large Language Models on Dietary Supplements
by: Zhan, Zaifu, et al.
Published: (2024)
by: Zhan, Zaifu, et al.
Published: (2024)
TCM-FTP: Fine-Tuning Large Language Models for Herbal Prescription Prediction
by: Zhou, Xingzhi, et al.
Published: (2024)
by: Zhou, Xingzhi, et al.
Published: (2024)
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
by: Yang, Yuzhe, et al.
Published: (2024)
by: Yang, Yuzhe, et al.
Published: (2024)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
by: Wu, Xiaojun, et al.
Published: (2024)
by: Wu, Xiaojun, et al.
Published: (2024)
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
by: Cao, Yupeng, et al.
Published: (2026)
by: Cao, Yupeng, et al.
Published: (2026)
Distributional Semantics Tracing: A Framework for Explaining Hallucinations in Large Language Models
by: Bhatia, Gagan, et al.
Published: (2025)
by: Bhatia, Gagan, et al.
Published: (2025)
Quokka: An Open-source Large Language Model ChatBot for Material Science
by: Yang, Xianjun, et al.
Published: (2024)
by: Yang, Xianjun, et al.
Published: (2024)
Optimizing Large Language Models for ESG Activity Detection in Financial Texts
by: Birti, Mattia, et al.
Published: (2025)
by: Birti, Mattia, et al.
Published: (2025)
FFN: a Fine-grained Chinese-English Financial Domain Parallel Corpus
by: Fu, Yuxin, et al.
Published: (2024)
by: Fu, Yuxin, et al.
Published: (2024)
FMPAF: How Do Fed Chairs Affect the Financial Market? A Fine-grained Monetary Policy Analysis Framework on Their Language
by: Deng, Yayue, et al.
Published: (2024)
by: Deng, Yayue, et al.
Published: (2024)
Reverse Physician-AI Relationship: Full-process Clinical Diagnosis Driven by a Large Language Model
by: Xu, Shicheng, et al.
Published: (2025)
by: Xu, Shicheng, et al.
Published: (2025)
A Retrieval-Augmented Language Assistant for Unmanned Aircraft Safety Assessment and Regulatory Compliance
by: Immordino, Gabriele, et al.
Published: (2026)
by: Immordino, Gabriele, et al.
Published: (2026)
FinSight: Towards Real-World Financial Deep Research
by: Jin, Jiajie, et al.
Published: (2025)
by: Jin, Jiajie, et al.
Published: (2025)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Program of Thoughts for Financial Reasoning: Leveraging Dynamic In-Context Examples and Generative Retrieval
by: Khatuya, Subhendu, et al.
Published: (2025)
by: Khatuya, Subhendu, et al.
Published: (2025)
FiSTECH: Financial Style Transfer to Enhance Creativity without Hallucinations in LLMs
by: Roychowdhury, Sohini, et al.
Published: (2024)
by: Roychowdhury, Sohini, et al.
Published: (2024)
QuantMCP: Grounding Large Language Models in Verifiable Financial Reality
by: Zeng, Yifan
Published: (2025)
by: Zeng, Yifan
Published: (2025)
PRISM: Prompt-Refined In-Context System Modelling for Financial Retrieval
by: Ng, Chun Chet, et al.
Published: (2025)
by: Ng, Chun Chet, et al.
Published: (2025)
Computational Lesions in Multilingual Language Models Separate Shared and Language-specific Brain Alignment
by: Cui, Yang, et al.
Published: (2026)
by: Cui, Yang, et al.
Published: (2026)
FaStfact: Faster, Stronger Long-Form Factuality Evaluations in LLMs
by: Wan, Yingjia, et al.
Published: (2025)
by: Wan, Yingjia, et al.
Published: (2025)
SILC-EFSA: Self-aware In-context Learning Correction for Entity-level Financial Sentiment Analysis
by: Zhu, Senbin, et al.
Published: (2024)
by: Zhu, Senbin, et al.
Published: (2024)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
by: Huang, Jimin, et al.
Published: (2024)
by: Huang, Jimin, et al.
Published: (2024)
On Languaging a Simulation Engine
by: Liu, Han, et al.
Published: (2024)
by: Liu, Han, et al.
Published: (2024)
Interactive DualChecker for Mitigating Hallucinations in Distilling Large Language Models
by: Wang, Meiyun, et al.
Published: (2024)
by: Wang, Meiyun, et al.
Published: (2024)
LiveTradeBench: Seeking Real-World Alpha with Large Language Models
by: Yu, Haofei, et al.
Published: (2025)
by: Yu, Haofei, et al.
Published: (2025)
Similar Items
-
FinBen: A Holistic Financial Benchmark for Large Language Models
by: Xie, Qianqian, et al.
Published: (2024) -
Evaluating Large Language Models (LLMs) in Financial NLP: A Comparative Study on Financial Report Analysis
by: Mohsin, Md Talha
Published: (2025) -
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
by: Lu, Guilong, et al.
Published: (2025) -
Utilizing Modern Large Language Models (LLM) for Financial Trend Analysis and Digest Creation
by: Lazarev, Andrei, et al.
Published: (2025) -
Enterprise Benchmarks for Large Language Model Evaluation
by: Zhang, Bing, et al.
Published: (2024)