EconNLI: Evaluating Large Language Models on Economics Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Guo, Yue, Yang, Yi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
von: Quan, Yinzhu, et al.
Veröffentlicht: (2024)
von: Quan, Yinzhu, et al.
Veröffentlicht: (2024)
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
von: Lee, Donggyu, et al.
Veröffentlicht: (2025)
von: Lee, Donggyu, et al.
Veröffentlicht: (2025)
SylloBio-NLI: Evaluating Large Language Models on Biomedical Syllogistic Reasoning
von: Wysocka, Magdalena, et al.
Veröffentlicht: (2024)
von: Wysocka, Magdalena, et al.
Veröffentlicht: (2024)
Rethinking STS and NLI in Large Language Models
von: Wang, Yuxia, et al.
Veröffentlicht: (2023)
von: Wang, Yuxia, et al.
Veröffentlicht: (2023)
EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments
von: Liu, Zefang, et al.
Veröffentlicht: (2025)
von: Liu, Zefang, et al.
Veröffentlicht: (2025)
EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agents
von: Fish, Sara, et al.
Veröffentlicht: (2025)
von: Fish, Sara, et al.
Veröffentlicht: (2025)
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
von: Li, Mukai, et al.
Veröffentlicht: (2025)
von: Li, Mukai, et al.
Veröffentlicht: (2025)
AfriEconQA: A Benchmark Dataset for African Economic Analysis based on World Bank Reports
von: Ajayi, Edward
Veröffentlicht: (2026)
von: Ajayi, Edward
Veröffentlicht: (2026)
Self-Rationalization in the Wild: A Large Scale Out-of-Distribution Evaluation on NLI-related tasks
von: Yang, Jing, et al.
Veröffentlicht: (2025)
von: Yang, Jing, et al.
Veröffentlicht: (2025)
CLR-Fact: Evaluating the Complex Logical Reasoning Capability of Large Language Models over Factual Knowledge
von: Zheng, Tianshi, et al.
Veröffentlicht: (2024)
von: Zheng, Tianshi, et al.
Veröffentlicht: (2024)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
von: Xu, Zixiang, et al.
Veröffentlicht: (2025)
von: Xu, Zixiang, et al.
Veröffentlicht: (2025)
GLoRE: Evaluating Logical Reasoning of Large Language Models
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
Lost in Variation? Evaluating NLI Performance in Basque and Spanish Geographical Variants
von: Bengoetxea, Jaione, et al.
Veröffentlicht: (2025)
von: Bengoetxea, Jaione, et al.
Veröffentlicht: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
von: Liu, Changshu, et al.
Veröffentlicht: (2024)
von: Liu, Changshu, et al.
Veröffentlicht: (2024)
MSciNLI: A Diverse Benchmark for Scientific Natural Language Inference
von: Sadat, Mobashir, et al.
Veröffentlicht: (2024)
von: Sadat, Mobashir, et al.
Veröffentlicht: (2024)
DARG: Dynamic Evaluation of Large Language Models via Adaptive Reasoning Graph
von: Zhang, Zhehao, et al.
Veröffentlicht: (2024)
von: Zhang, Zhehao, et al.
Veröffentlicht: (2024)
PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models
von: Qiu, Shi, et al.
Veröffentlicht: (2025)
von: Qiu, Shi, et al.
Veröffentlicht: (2025)
Evaluating Counterfactual Strategic Reasoning in Large Language Models
von: Georgousis, Dimitrios, et al.
Veröffentlicht: (2026)
von: Georgousis, Dimitrios, et al.
Veröffentlicht: (2026)
Evaluating Accounting Reasoning Capabilities of Large Language Models
von: Zhou, Jie, et al.
Veröffentlicht: (2026)
von: Zhou, Jie, et al.
Veröffentlicht: (2026)
CHBench: A Chinese Dataset for Evaluating Health in Large Language Models
von: Guo, Chenlu, et al.
Veröffentlicht: (2024)
von: Guo, Chenlu, et al.
Veröffentlicht: (2024)
When Does Meaning Backfire? Investigating the Role of AMRs in NLI
von: Min, Junghyun, et al.
Veröffentlicht: (2025)
von: Min, Junghyun, et al.
Veröffentlicht: (2025)
Mathematical Reasoning Enhanced LLM for Formula Derivation: A Case Study on Fiber NLI Modellin
von: Zhang, Yao, et al.
Veröffentlicht: (2026)
von: Zhang, Yao, et al.
Veröffentlicht: (2026)
FragRel: Exploiting Fragment-level Relations in the External Memory of Large Language Models
von: Yue, Xihang, et al.
Veröffentlicht: (2024)
von: Yue, Xihang, et al.
Veröffentlicht: (2024)
A Survey on Evaluation of Large Language Models
von: Chang, Yupeng, et al.
Veröffentlicht: (2023)
von: Chang, Yupeng, et al.
Veröffentlicht: (2023)
Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
von: Zhou, Shuang, et al.
Veröffentlicht: (2025)
von: Zhou, Shuang, et al.
Veröffentlicht: (2025)
Evaluating CxG Generalisation in LLMs via Construction-Based NLI Fine Tuning
von: Mackintosh, Tom, et al.
Veröffentlicht: (2025)
von: Mackintosh, Tom, et al.
Veröffentlicht: (2025)
Exploring Continual Learning of Compositional Generalization in NLI
von: Fu, Xiyan, et al.
Veröffentlicht: (2024)
von: Fu, Xiyan, et al.
Veröffentlicht: (2024)
Entailed Between the Lines: Incorporating Implication into NLI
von: Havaldar, Shreya, et al.
Veröffentlicht: (2025)
von: Havaldar, Shreya, et al.
Veröffentlicht: (2025)
Estimating the Causal Effects of Natural Logic Features in Neural NLI Models
von: Rozanova, Julia, et al.
Veröffentlicht: (2023)
von: Rozanova, Julia, et al.
Veröffentlicht: (2023)
Evaluating Large Language Models with Psychometrics
von: Li, Yuan, et al.
Veröffentlicht: (2024)
von: Li, Yuan, et al.
Veröffentlicht: (2024)
Forget NLI, Use a Dictionary: Zero-Shot Topic Classification for Low-Resource Languages with Application to Luxembourgish
von: Philippy, Fred, et al.
Veröffentlicht: (2024)
von: Philippy, Fred, et al.
Veröffentlicht: (2024)
Reverse-engineering NLI: A study of the meta-inferential properties of Natural Language Inference
von: Blanck, Rasmus, et al.
Veröffentlicht: (2026)
von: Blanck, Rasmus, et al.
Veröffentlicht: (2026)
Affective-NLI: Towards Accurate and Interpretable Personality Recognition in Conversation
von: Wen, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Wen, Zhiyuan, et al.
Veröffentlicht: (2024)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2024)
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2024)
LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models
von: Hao, Shibo, et al.
Veröffentlicht: (2024)
von: Hao, Shibo, et al.
Veröffentlicht: (2024)
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions
von: Cohn, Anthony G, et al.
Veröffentlicht: (2024)
von: Cohn, Anthony G, et al.
Veröffentlicht: (2024)
Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis
von: Zhou, Jie, et al.
Veröffentlicht: (2025)
von: Zhou, Jie, et al.
Veröffentlicht: (2025)
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
von: Chen, Yuefei, et al.
Veröffentlicht: (2025)
von: Chen, Yuefei, et al.
Veröffentlicht: (2025)
Evaluating Intermediate Reasoning of Code-Assisted Large Language Models for Mathematics
von: Al-Khalili, Zena, et al.
Veröffentlicht: (2025)
von: Al-Khalili, Zena, et al.
Veröffentlicht: (2025)
Evaluating the Presence of Sex Bias in Clinical Reasoning by Large Language Models
von: Tsintsiper, Isabel, et al.
Veröffentlicht: (2026)
von: Tsintsiper, Isabel, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
von: Quan, Yinzhu, et al.
Veröffentlicht: (2024) -
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
von: Lee, Donggyu, et al.
Veröffentlicht: (2025) -
SylloBio-NLI: Evaluating Large Language Models on Biomedical Syllogistic Reasoning
von: Wysocka, Magdalena, et al.
Veröffentlicht: (2024) -
Rethinking STS and NLI in Large Language Models
von: Wang, Yuxia, et al.
Veröffentlicht: (2023) -
EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments
von: Liu, Zefang, et al.
Veröffentlicht: (2025)