Finance Language Model Evaluation (FLaME)
Fuente:
arXiv
Guardado en:
| Autores principales: | Matlin, Glenn, Okamoto, Mika, Pardawala, Huzaifa, Yang, Yang, Chava, Sudheer |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enterprise Benchmarks for Large Language Model Evaluation
por: Zhang, Bing, et al.
Publicado: (2024)
por: Zhang, Bing, et al.
Publicado: (2024)
Redefining Evaluation Standards: A Unified Framework for Evaluating the Korean Capabilities of Language Models
por: Lee, Hanwool, et al.
Publicado: (2025)
por: Lee, Hanwool, et al.
Publicado: (2025)
FLAME: Financial Large-Language Model Assessment and Metrics Evaluation
por: Guo, Jiayu, et al.
Publicado: (2025)
por: Guo, Jiayu, et al.
Publicado: (2025)
Quokka: An Open-source Large Language Model ChatBot for Material Science
por: Yang, Xianjun, et al.
Publicado: (2024)
por: Yang, Xianjun, et al.
Publicado: (2024)
FinBERT2: A Specialized Bidirectional Encoder for Bridging the Gap in Finance-Specific Deployment of Large Language Models
por: Xu, Xuan, et al.
Publicado: (2025)
por: Xu, Xuan, et al.
Publicado: (2025)
Assessing Consistency and Reproducibility in the Outputs of Large Language Models: Evidence Across Diverse Finance and Accounting Tasks
por: Wang, Julian Junyan, et al.
Publicado: (2025)
por: Wang, Julian Junyan, et al.
Publicado: (2025)
FiMI: A Domain-Specific Language Model for Indian Finance Ecosystem
por: Kathar, Aboli, et al.
Publicado: (2026)
por: Kathar, Aboli, et al.
Publicado: (2026)
Computational Lesions in Multilingual Language Models Separate Shared and Language-specific Brain Alignment
por: Cui, Yang, et al.
Publicado: (2026)
por: Cui, Yang, et al.
Publicado: (2026)
Financial Instruction Following Evaluation (FIFE)
por: Matlin, Glenn, et al.
Publicado: (2025)
por: Matlin, Glenn, et al.
Publicado: (2025)
Mixing It Up: The Cocktail Effect of Multi-Task Fine-Tuning on LLM Performance -- A Case Study in Finance
por: Brief, Meni, et al.
Publicado: (2024)
por: Brief, Meni, et al.
Publicado: (2024)
FinBen: A Holistic Financial Benchmark for Large Language Models
por: Xie, Qianqian, et al.
Publicado: (2024)
por: Xie, Qianqian, et al.
Publicado: (2024)
EUR-USD Exchange Rate Forecasting Based on Information Fusion with Large Language Models and Deep Learning Methods
por: Ding, Hongcheng, et al.
Publicado: (2024)
por: Ding, Hongcheng, et al.
Publicado: (2024)
When Valid Signals Fail: Regime Boundaries Between LLM Features and RL Trading Policies
por: Yang, Zhengzhe
Publicado: (2026)
por: Yang, Zhengzhe
Publicado: (2026)
Opportunities for Large Language Models and Discourse in Engineering Design
por: Göpfert, Jan, et al.
Publicado: (2023)
por: Göpfert, Jan, et al.
Publicado: (2023)
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
por: Guo, Sikun, et al.
Publicado: (2024)
por: Guo, Sikun, et al.
Publicado: (2024)
Evaluating Large Language Models (LLMs) in Financial NLP: A Comparative Study on Financial Report Analysis
por: Mohsin, Md Talha
Publicado: (2025)
por: Mohsin, Md Talha
Publicado: (2025)
Distributional Semantics Tracing: A Framework for Explaining Hallucinations in Large Language Models
por: Bhatia, Gagan, et al.
Publicado: (2025)
por: Bhatia, Gagan, et al.
Publicado: (2025)
TCM-FTP: Fine-Tuning Large Language Models for Herbal Prescription Prediction
por: Zhou, Xingzhi, et al.
Publicado: (2024)
por: Zhou, Xingzhi, et al.
Publicado: (2024)
Words That Unite The World: A Unified Framework for Deciphering Central Bank Communications Globally
por: Shah, Agam, et al.
Publicado: (2025)
por: Shah, Agam, et al.
Publicado: (2025)
LAET: A Layer-wise Adaptive Ensemble Tuning Framework for Pretrained Language Models
por: Ahad, Jawad Ibn, et al.
Publicado: (2025)
por: Ahad, Jawad Ibn, et al.
Publicado: (2025)
Modeling News Interactions and Influence for Financial Market Prediction
por: Wang, Mengyu, et al.
Publicado: (2024)
por: Wang, Mengyu, et al.
Publicado: (2024)
RAMIE: Retrieval-Augmented Multi-task Information Extraction with Large Language Models on Dietary Supplements
por: Zhan, Zaifu, et al.
Publicado: (2024)
por: Zhan, Zaifu, et al.
Publicado: (2024)
Reverse Physician-AI Relationship: Full-process Clinical Diagnosis Driven by a Large Language Model
por: Xu, Shicheng, et al.
Publicado: (2025)
por: Xu, Shicheng, et al.
Publicado: (2025)
PLLaMa: An Open-source Large Language Model for Plant Science
por: Yang, Xianjun, et al.
Publicado: (2024)
por: Yang, Xianjun, et al.
Publicado: (2024)
Utilizing Modern Large Language Models (LLM) for Financial Trend Analysis and Digest Creation
por: Lazarev, Andrei, et al.
Publicado: (2025)
por: Lazarev, Andrei, et al.
Publicado: (2025)
LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset
por: Yu, Botao, et al.
Publicado: (2024)
por: Yu, Botao, et al.
Publicado: (2024)
On Languaging a Simulation Engine
por: Liu, Han, et al.
Publicado: (2024)
por: Liu, Han, et al.
Publicado: (2024)
SECQUE: A Benchmark for Evaluating Real-World Financial Analysis Capabilities
por: Yoash, Noga Ben, et al.
Publicado: (2025)
por: Yoash, Noga Ben, et al.
Publicado: (2025)
Text to model via SysML: Automated generation of dynamical system computational models from unstructured natural language text via enhanced System Modeling Language diagrams
por: Hendricks, Matthew Anderson, et al.
Publicado: (2025)
por: Hendricks, Matthew Anderson, et al.
Publicado: (2025)
The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems
por: Xie, Zhuohan, et al.
Publicado: (2026)
por: Xie, Zhuohan, et al.
Publicado: (2026)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
por: Lu, Guilong, et al.
Publicado: (2025)
por: Lu, Guilong, et al.
Publicado: (2025)
AntigenLM: Structure-Aware DNA Language Modeling for Influenza
por: Pei, Yue, et al.
Publicado: (2026)
por: Pei, Yue, et al.
Publicado: (2026)
A Retrieval-Augmented Language Assistant for Unmanned Aircraft Safety Assessment and Regulatory Compliance
por: Immordino, Gabriele, et al.
Publicado: (2026)
por: Immordino, Gabriele, et al.
Publicado: (2026)
Baichuan4-Finance Technical Report
por: Zhang, Hanyu, et al.
Publicado: (2024)
por: Zhang, Hanyu, et al.
Publicado: (2024)
FMPAF: How Do Fed Chairs Affect the Financial Market? A Fine-grained Monetary Policy Analysis Framework on Their Language
por: Deng, Yayue, et al.
Publicado: (2024)
por: Deng, Yayue, et al.
Publicado: (2024)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
por: Liu, Yujie, et al.
Publicado: (2025)
por: Liu, Yujie, et al.
Publicado: (2025)
MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback
por: Liu, Wanhao, et al.
Publicado: (2025)
por: Liu, Wanhao, et al.
Publicado: (2025)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
por: Wang, Yan, et al.
Publicado: (2025)
por: Wang, Yan, et al.
Publicado: (2025)
Be.FM: Open Foundation Models for Human Behavior
por: Xie, Yutong, et al.
Publicado: (2025)
por: Xie, Yutong, et al.
Publicado: (2025)
NumLLM: Numeric-Sensitive Large Language Model for Chinese Finance
por: Su, Huan-Yi, et al.
Publicado: (2024)
por: Su, Huan-Yi, et al.
Publicado: (2024)
Ejemplares similares
-
Enterprise Benchmarks for Large Language Model Evaluation
por: Zhang, Bing, et al.
Publicado: (2024) -
Redefining Evaluation Standards: A Unified Framework for Evaluating the Korean Capabilities of Language Models
por: Lee, Hanwool, et al.
Publicado: (2025) -
FLAME: Financial Large-Language Model Assessment and Metrics Evaluation
por: Guo, Jiayu, et al.
Publicado: (2025) -
Quokka: An Open-source Large Language Model ChatBot for Material Science
por: Yang, Xianjun, et al.
Publicado: (2024) -
FinBERT2: A Specialized Bidirectional Encoder for Bridging the Gap in Finance-Specific Deployment of Large Language Models
por: Xu, Xuan, et al.
Publicado: (2025)