MTFinEval:A Multi-domain Chinese Financial Benchmark with Eurypalynous questions
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Xinyu, Jin, Ke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SER Evals: In-domain and Out-of-domain Benchmarking for Speech Emotion Recognition
di: Osman, Mohamed, et al.
Pubblicazione: (2024)
di: Osman, Mohamed, et al.
Pubblicazione: (2024)
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025)
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
di: Yu, Linhao, et al.
Pubblicazione: (2024)
di: Yu, Linhao, et al.
Pubblicazione: (2024)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
di: Ma, Guoqing, et al.
Pubblicazione: (2025)
di: Ma, Guoqing, et al.
Pubblicazione: (2025)
KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding
di: Hwang, Bokwang, et al.
Pubblicazione: (2025)
di: Hwang, Bokwang, et al.
Pubblicazione: (2025)
PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological Counselor
di: Pan, Qianjun, et al.
Pubblicazione: (2026)
di: Pan, Qianjun, et al.
Pubblicazione: (2026)
MCFEND: A Multi-source Benchmark Dataset for Chinese Fake News Detection
di: Li, Yupeng, et al.
Pubblicazione: (2024)
di: Li, Yupeng, et al.
Pubblicazione: (2024)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
di: Yao, Xuan, et al.
Pubblicazione: (2025)
di: Yao, Xuan, et al.
Pubblicazione: (2025)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
di: Ye, Fangda, et al.
Pubblicazione: (2026)
di: Ye, Fangda, et al.
Pubblicazione: (2026)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
di: Jubair, Sheikh, et al.
Pubblicazione: (2025)
di: Jubair, Sheikh, et al.
Pubblicazione: (2025)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
di: Zhu, Jie, et al.
Pubblicazione: (2024)
di: Zhu, Jie, et al.
Pubblicazione: (2024)
SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials
di: Li, Zhaohui, et al.
Pubblicazione: (2026)
di: Li, Zhaohui, et al.
Pubblicazione: (2026)
MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
di: Pombal, José, et al.
Pubblicazione: (2025)
di: Pombal, José, et al.
Pubblicazione: (2025)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
ContractEval: Benchmarking LLMs for Clause-Level Legal Risk Identification in Commercial Contracts
di: Liu, Shuang, et al.
Pubblicazione: (2025)
di: Liu, Shuang, et al.
Pubblicazione: (2025)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
di: Zhang, Tanghaoran, et al.
Pubblicazione: (2026)
di: Zhang, Tanghaoran, et al.
Pubblicazione: (2026)
MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models
di: Einarsson, Hafsteinn
Pubblicazione: (2025)
di: Einarsson, Hafsteinn
Pubblicazione: (2025)
EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
di: Li, Zhong-Zhi, et al.
Pubblicazione: (2024)
di: Li, Zhong-Zhi, et al.
Pubblicazione: (2024)
WebGraphEval: Multi-Turn Trajectory Evaluation for Web Agents using Graph Representation
di: Qian, Yaoyao, et al.
Pubblicazione: (2025)
di: Qian, Yaoyao, et al.
Pubblicazione: (2025)
EnigmaEval: A Benchmark of Long Multimodal Reasoning Challenges
di: Wang, Clinton J., et al.
Pubblicazione: (2025)
di: Wang, Clinton J., et al.
Pubblicazione: (2025)
CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning
di: He, Zheqi, et al.
Pubblicazione: (2024)
di: He, Zheqi, et al.
Pubblicazione: (2024)
MMCircuitEval: A Comprehensive Multimodal Circuit-Focused Benchmark for Evaluating LLMs
di: Zhao, Chenchen, et al.
Pubblicazione: (2025)
di: Zhao, Chenchen, et al.
Pubblicazione: (2025)
SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment
di: Jiang, Sihang, et al.
Pubblicazione: (2026)
di: Jiang, Sihang, et al.
Pubblicazione: (2026)
LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks
di: Gao, Hengjian, et al.
Pubblicazione: (2026)
di: Gao, Hengjian, et al.
Pubblicazione: (2026)
Understanding Financial Reasoning in AI: A Multimodal Benchmark and Error Learning Approach
di: Deng, Shuangyan, et al.
Pubblicazione: (2025)
di: Deng, Shuangyan, et al.
Pubblicazione: (2025)
InsightEval: An Expert-Curated Benchmark for Assessing Insight Discovery in LLM-Driven Data Agents
di: Zhu, Zhenghao, et al.
Pubblicazione: (2025)
di: Zhu, Zhenghao, et al.
Pubblicazione: (2025)
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
di: Zhang, Mengyuan, et al.
Pubblicazione: (2024)
di: Zhang, Mengyuan, et al.
Pubblicazione: (2024)
ScenEval: A Benchmark for Scenario-Based Evaluation of Code Generation
di: Paul, Debalina Ghosh, et al.
Pubblicazione: (2024)
di: Paul, Debalina Ghosh, et al.
Pubblicazione: (2024)
NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmark
di: Mikhailov, Vladislav, et al.
Pubblicazione: (2025)
di: Mikhailov, Vladislav, et al.
Pubblicazione: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
di: Pan, Tianjun, et al.
Pubblicazione: (2026)
di: Pan, Tianjun, et al.
Pubblicazione: (2026)
TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents
di: Chen, Weiyi, et al.
Pubblicazione: (2026)
di: Chen, Weiyi, et al.
Pubblicazione: (2026)
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
di: Li, Chenxin, et al.
Pubblicazione: (2026)
di: Li, Chenxin, et al.
Pubblicazione: (2026)
FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning
di: Deng, Shuangyan, et al.
Pubblicazione: (2025)
di: Deng, Shuangyan, et al.
Pubblicazione: (2025)
Multi-IaC-Eval: Benchmarking Cloud Infrastructure as Code Across Multiple Formats
di: Davidson, Sam, et al.
Pubblicazione: (2025)
di: Davidson, Sam, et al.
Pubblicazione: (2025)
CPSDBench: A Large Language Model Evaluation Benchmark and Baseline for Chinese Public Security Domain
di: Tong, Xin, et al.
Pubblicazione: (2024)
di: Tong, Xin, et al.
Pubblicazione: (2024)
Are Large Language Models Good In-context Learners for Financial Sentiment Analysis?
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
OpsEval: A Comprehensive IT Operations Benchmark Suite for Large Language Models
di: Liu, Yuhe, et al.
Pubblicazione: (2023)
di: Liu, Yuhe, et al.
Pubblicazione: (2023)
Documenti analoghi
-
SER Evals: In-domain and Out-of-domain Benchmarking for Speech Emotion Recognition
di: Osman, Mohamed, et al.
Pubblicazione: (2024) -
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025) -
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
di: Yu, Linhao, et al.
Pubblicazione: (2024) -
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
di: Ma, Guoqing, et al.
Pubblicazione: (2025) -
KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding
di: Hwang, Bokwang, et al.
Pubblicazione: (2025)