A Critical Review of Causal Reasoning Benchmarks for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Linying, Shirvaikar, Vik, Clivio, Oscar, Falck, Fabian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking recidivism through a causal lens
par: Shirvaikar, Vik, et autres
Publié: (2020)
par: Shirvaikar, Vik, et autres
Publié: (2020)
Neural Score Matching for High-Dimensional Causal Inference
par: Clivio, Oscar, et autres
Publié: (2022)
par: Clivio, Oscar, et autres
Publié: (2022)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
par: Komanduri, Aneesh, et autres
Publié: (2025)
par: Komanduri, Aneesh, et autres
Publié: (2025)
Benchmarking Large Language Models for Math Reasoning Tasks
par: Seßler, Kathrin, et autres
Publié: (2024)
par: Seßler, Kathrin, et autres
Publié: (2024)
metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models
par: Kipnis, Alex, et autres
Publié: (2024)
par: Kipnis, Alex, et autres
Publié: (2024)
Unveiling Causal Reasoning in Large Language Models: Reality or Mirage?
par: Chi, Haoang, et autres
Publié: (2025)
par: Chi, Haoang, et autres
Publié: (2025)
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
par: Tu, Ruibo, et autres
Publié: (2024)
par: Tu, Ruibo, et autres
Publié: (2024)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
par: Tiwari, Utkarsh, et autres
Publié: (2025)
par: Tiwari, Utkarsh, et autres
Publié: (2025)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
par: Li, Yuangang, et autres
Publié: (2025)
par: Li, Yuangang, et autres
Publié: (2025)
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
par: Cai, Hengrui, et autres
Publié: (2023)
par: Cai, Hengrui, et autres
Publié: (2023)
Enhancing Event Reasoning in Large Language Models through Instruction Fine-Tuning with Semantic Causal Graphs
par: Bethany, Mazal, et autres
Publié: (2024)
par: Bethany, Mazal, et autres
Publié: (2024)
Towards Incremental Learning in Large Language Models: A Critical Review
par: Jovanovic, Mladjan, et autres
Publié: (2024)
par: Jovanovic, Mladjan, et autres
Publié: (2024)
Spectral Insights into Data-Oblivious Critical Layers in Large Language Models
par: Liu, Xuyuan, et autres
Publié: (2025)
par: Liu, Xuyuan, et autres
Publié: (2025)
On the effectiveness of Large Language Models in the mechanical design domain
par: Grandi, Daniele, et autres
Publié: (2025)
par: Grandi, Daniele, et autres
Publié: (2025)
Causality for Large Language Models
par: Wu, Anpeng, et autres
Publié: (2024)
par: Wu, Anpeng, et autres
Publié: (2024)
Targeting relative risk heterogeneity with causal forests
par: Shirvaikar, Vik, et autres
Publié: (2023)
par: Shirvaikar, Vik, et autres
Publié: (2023)
Confidence in the Reasoning of Large Language Models
par: Pawitan, Yudi, et autres
Publié: (2024)
par: Pawitan, Yudi, et autres
Publié: (2024)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
par: Lin, Zicheng, et autres
Publié: (2024)
par: Lin, Zicheng, et autres
Publié: (2024)
Compositional Causal Reasoning Evaluation in Language Models
par: Maasch, Jacqueline R. M. A., et autres
Publié: (2025)
par: Maasch, Jacqueline R. M. A., et autres
Publié: (2025)
CLadder: Assessing Causal Reasoning in Language Models
par: Jin, Zhijing, et autres
Publié: (2023)
par: Jin, Zhijing, et autres
Publié: (2023)
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
par: Shah, Kulin, et autres
Publié: (2024)
par: Shah, Kulin, et autres
Publié: (2024)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
par: Wang, Wentian, et autres
Publié: (2024)
par: Wang, Wentian, et autres
Publié: (2024)
Out-of-Context Reasoning in Large Language Models
par: Shaki, Jonathan, et autres
Publié: (2025)
par: Shaki, Jonathan, et autres
Publié: (2025)
GLBench: A Comprehensive Benchmark for Graph with Large Language Models
par: Li, Yuhan, et autres
Publié: (2024)
par: Li, Yuhan, et autres
Publié: (2024)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
par: AlDahoul, Nouar, et autres
Publié: (2025)
par: AlDahoul, Nouar, et autres
Publié: (2025)
PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models
par: Xu, Yinggan, et autres
Publié: (2025)
par: Xu, Yinggan, et autres
Publié: (2025)
Causal Reasoning and Large Language Models: Opening a New Frontier for Causality
par: Kıcıman, Emre, et autres
Publié: (2023)
par: Kıcıman, Emre, et autres
Publié: (2023)
DeepCritic: Deliberate Critique with Large Language Models
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
A Systematic Survey and Critical Review on Evaluating Large Language Models: Challenges, Limitations, and Recommendations
par: Laskar, Md Tahmid Rahman, et autres
Publié: (2024)
par: Laskar, Md Tahmid Rahman, et autres
Publié: (2024)
A Review of Developmental Interpretability in Large Language Models
par: Kendiukhov, Ihor
Publié: (2025)
par: Kendiukhov, Ihor
Publié: (2025)
Benchmarking Large Language Model Uncertainty for Prompt Optimization
par: Guo, Pei-Fu, et autres
Publié: (2024)
par: Guo, Pei-Fu, et autres
Publié: (2024)
Do Large Language Model Benchmarks Test Reliability?
par: Vendrow, Joshua, et autres
Publié: (2025)
par: Vendrow, Joshua, et autres
Publié: (2025)
CEQuest: Benchmarking Large Language Models for Construction Estimation
par: Wu, Yanzhao, et autres
Publié: (2025)
par: Wu, Yanzhao, et autres
Publié: (2025)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
par: Chung, Tsz Ting, et autres
Publié: (2025)
par: Chung, Tsz Ting, et autres
Publié: (2025)
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
par: Düzkar, Kemal
Publié: (2026)
par: Düzkar, Kemal
Publié: (2026)
Self-Training Large Language Models with Confident Reasoning
par: Jang, Hyosoon, et autres
Publié: (2025)
par: Jang, Hyosoon, et autres
Publié: (2025)
Benchmarking Benchmark Leakage in Large Language Models
par: Xu, Ruijie, et autres
Publié: (2024)
par: Xu, Ruijie, et autres
Publié: (2024)
Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models
par: Yuan, Aojie, et autres
Publié: (2026)
par: Yuan, Aojie, et autres
Publié: (2026)
Prompting Fairness: Integrating Causality to Debias Large Language Models
par: Li, Jingling, et autres
Publié: (2024)
par: Li, Jingling, et autres
Publié: (2024)
Efficacy of Large Language Models in Systematic Reviews
par: Shah, Aaditya, et autres
Publié: (2024)
par: Shah, Aaditya, et autres
Publié: (2024)
Documents similaires
-
Rethinking recidivism through a causal lens
par: Shirvaikar, Vik, et autres
Publié: (2020) -
Neural Score Matching for High-Dimensional Causal Inference
par: Clivio, Oscar, et autres
Publié: (2022) -
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
par: Komanduri, Aneesh, et autres
Publié: (2025) -
Benchmarking Large Language Models for Math Reasoning Tasks
par: Seßler, Kathrin, et autres
Publié: (2024) -
metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models
par: Kipnis, Alex, et autres
Publié: (2024)