Ebisu: Benchmarking Large Language Models in Japanese Finance
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Peng, Xueqing, Xiang, Ruoyu, Zhang, Fan, Song, Mingzi, Jiang, Mingyang, Wang, Yan, Qian, Lingfei, Hara, Taiki, Guo, Yuqing, Huang, Jimin, Tsujii, Junichi, Ananiadou, Sophia |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Plutus: Benchmarking Large Language Models in Low-Resource Greek Finance
von: Peng, Xueqing, et al.
Veröffentlicht: (2025)
von: Peng, Xueqing, et al.
Veröffentlicht: (2025)
Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading
von: Giannouris, Polydoros, et al.
Veröffentlicht: (2026)
von: Giannouris, Polydoros, et al.
Veröffentlicht: (2026)
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
von: Liu, Zhiwei, et al.
Veröffentlicht: (2025)
von: Liu, Zhiwei, et al.
Veröffentlicht: (2025)
OrdRankBen: A Novel Ranking Benchmark for Ordinal Relevance in NLP
von: Wang, Yan, et al.
Veröffentlicht: (2025)
von: Wang, Yan, et al.
Veröffentlicht: (2025)
FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
von: He, Yueru, et al.
Veröffentlicht: (2025)
von: He, Yueru, et al.
Veröffentlicht: (2025)
Ebisu: Études Japonaises
Veröffentlicht: (2022)
Veröffentlicht: (2022)
All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
von: Jiang, Yuechen, et al.
Veröffentlicht: (2026)
von: Jiang, Yuechen, et al.
Veröffentlicht: (2026)
Fino1: On the Transferability of Reasoning-Enhanced LLMs and Reinforcement Learning to Finance
von: Qian, Lingfei, et al.
Veröffentlicht: (2025)
von: Qian, Lingfei, et al.
Veröffentlicht: (2025)
MemAdapter: Fast Alignment across Agent Memory Paradigms via Generative Subgraph Retrieval
von: Zhang, Xin, et al.
Veröffentlicht: (2026)
von: Zhang, Xin, et al.
Veröffentlicht: (2026)
Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment
von: Han, Yi, et al.
Veröffentlicht: (2026)
von: Han, Yi, et al.
Veröffentlicht: (2026)
Retrieval-augmented Large Language Models for Financial Time Series Forecasting
von: Xiao, Mengxi, et al.
Veröffentlicht: (2025)
von: Xiao, Mengxi, et al.
Veröffentlicht: (2025)
Neuron-Level Knowledge Attribution in Large Language Models
von: Yu, Zeping, et al.
Veröffentlicht: (2023)
von: Yu, Zeping, et al.
Veröffentlicht: (2023)
MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
von: Peng, Xueqing, et al.
Veröffentlicht: (2025)
von: Peng, Xueqing, et al.
Veröffentlicht: (2025)
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis
von: Yu, Zeping, et al.
Veröffentlicht: (2024)
von: Yu, Zeping, et al.
Veröffentlicht: (2024)
When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents
von: Qian, Lingfei, et al.
Veröffentlicht: (2025)
von: Qian, Lingfei, et al.
Veröffentlicht: (2025)
How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric Learning
von: Yu, Zeping, et al.
Veröffentlicht: (2024)
von: Yu, Zeping, et al.
Veröffentlicht: (2024)
No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks
von: Hu, Gang, et al.
Veröffentlicht: (2024)
von: Hu, Gang, et al.
Veröffentlicht: (2024)
FMDLlama: Financial Misinformation Detection based on Large Language Models
von: Liu, Zhiwei, et al.
Veröffentlicht: (2024)
von: Liu, Zhiwei, et al.
Veröffentlicht: (2024)
MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models
von: Yang, Kailai, et al.
Veröffentlicht: (2023)
von: Yang, Kailai, et al.
Veröffentlicht: (2023)
Are Large Language Models True Healthcare Jacks-of-All-Trades? Benchmarking Across Health Professions Beyond Physician Exams
von: Luo, Zheheng, et al.
Veröffentlicht: (2024)
von: Luo, Zheheng, et al.
Veröffentlicht: (2024)
The Lay Person's Guide to Biomedicine: Orchestrating Large Language Models
von: Luo, Zheheng, et al.
Veröffentlicht: (2024)
von: Luo, Zheheng, et al.
Veröffentlicht: (2024)
Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models
von: Yu, Zeping, et al.
Veröffentlicht: (2025)
von: Yu, Zeping, et al.
Veröffentlicht: (2025)
Understanding Multimodal LLMs: the Mechanistic Interpretability of Llava in Visual Question Answering
von: Yu, Zeping, et al.
Veröffentlicht: (2024)
von: Yu, Zeping, et al.
Veröffentlicht: (2024)
Understanding and Mitigating Gender Bias in LLMs via Interpretable Neuron Editing
von: Yu, Zeping, et al.
Veröffentlicht: (2025)
von: Yu, Zeping, et al.
Veröffentlicht: (2025)
Locate-then-Merge: Neuron-Level Parameter Fusion for Mitigating Catastrophic Forgetting in Multimodal LLMs
von: Yu, Zeping, et al.
Veröffentlicht: (2025)
von: Yu, Zeping, et al.
Veröffentlicht: (2025)
NOMAD: A Multi-Agent LLM System for UML Class Diagram Generation from Natural Language Requirements
von: Giannouris, Polydoros, et al.
Veröffentlicht: (2025)
von: Giannouris, Polydoros, et al.
Veröffentlicht: (2025)
TRACE: Temporal Routing with Autoregressive Cross-channel Experts for EEG Representation Learning
von: Ma, Fan, et al.
Veröffentlicht: (2026)
von: Ma, Fan, et al.
Veröffentlicht: (2026)
Dólares or Dollars? Unraveling the Bilingual Prowess of Financial LLMs Between Spanish and English
von: Zhang, Xiao, et al.
Veröffentlicht: (2024)
von: Zhang, Xiao, et al.
Veröffentlicht: (2024)
MetaAligner: Towards Generalizable Multi-Objective Alignment of Language Models
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
Selective Preference Optimization via Token-Level Reward Function Estimation
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
Concordia: Self-Improving Synthetic Tables for Federated LLMs
von: Huang, Jimin, et al.
Veröffentlicht: (2026)
von: Huang, Jimin, et al.
Veröffentlicht: (2026)
SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning
von: Elbadry, Rania, et al.
Veröffentlicht: (2026)
von: Elbadry, Rania, et al.
Veröffentlicht: (2026)
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
von: Xie, Zhuohan, et al.
Veröffentlicht: (2025)
von: Xie, Zhuohan, et al.
Veröffentlicht: (2025)
Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation
von: Wang, Yan, et al.
Veröffentlicht: (2026)
von: Wang, Yan, et al.
Veröffentlicht: (2026)
MFMDQwen: Multilingual Financial Misinformation Detection Based on Large Language Model
von: Liu, Zhiwei, et al.
Veröffentlicht: (2026)
von: Liu, Zhiwei, et al.
Veröffentlicht: (2026)
Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection
von: Liu, Zhiwei, et al.
Veröffentlicht: (2026)
von: Liu, Zhiwei, et al.
Veröffentlicht: (2026)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
von: Huang, Jimin, et al.
Veröffentlicht: (2024)
von: Huang, Jimin, et al.
Veröffentlicht: (2024)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
von: Li, Haohang, et al.
Veröffentlicht: (2024)
von: Li, Haohang, et al.
Veröffentlicht: (2024)
Existence of Large deviations rate function for any $S$-unimodal map
von: Takahasi, Hiroki, et al.
Veröffentlicht: (2019)
von: Takahasi, Hiroki, et al.
Veröffentlicht: (2019)
Break the Checkbox: Challenging Closed-Style Evaluations of Cultural Alignment in LLMs
von: Kabir, Mohsinul, et al.
Veröffentlicht: (2025)
von: Kabir, Mohsinul, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Plutus: Benchmarking Large Language Models in Low-Resource Greek Finance
von: Peng, Xueqing, et al.
Veröffentlicht: (2025) -
Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading
von: Giannouris, Polydoros, et al.
Veröffentlicht: (2026) -
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
von: Liu, Zhiwei, et al.
Veröffentlicht: (2025) -
OrdRankBen: A Novel Ranking Benchmark for Ordinal Relevance in NLP
von: Wang, Yan, et al.
Veröffentlicht: (2025) -
FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
von: He, Yueru, et al.
Veröffentlicht: (2025)