CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tu, Ruibo, Kjellström, Hedvig, Henter, Gustav Eje, Zhang, Cheng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Causality for Tabular Data Synthesis: A High-Order Structure Causal Benchmark Framework
by: Tu, Ruibo, et al.
Published: (2024)
by: Tu, Ruibo, et al.
Published: (2024)
Evaluating Interventional Reasoning Capabilities of Large Language Models
by: Kasetty, Tejas, et al.
Published: (2024)
by: Kasetty, Tejas, et al.
Published: (2024)
Exploring Internal Numeracy in Language Models: A Case Study on ALBERT
by: Wennberg, Ulme, et al.
Published: (2024)
by: Wennberg, Ulme, et al.
Published: (2024)
VoXtream: Full-Stream Text-to-Speech with Extremely Low Latency
by: Torgashov, Nikita, et al.
Published: (2025)
by: Torgashov, Nikita, et al.
Published: (2025)
VoXtream2: Full-stream TTS with dynamic speaking rate control
by: Torgashov, Nikita, et al.
Published: (2026)
by: Torgashov, Nikita, et al.
Published: (2026)
Causal Graph Discovery with Retrieval-Augmented Generation based Large Language Models
by: Zhang, Yuzhe, et al.
Published: (2024)
by: Zhang, Yuzhe, et al.
Published: (2024)
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
by: Cai, Hengrui, et al.
Published: (2023)
by: Cai, Hengrui, et al.
Published: (2023)
Causal Reasoning and Large Language Models: Opening a New Frontier for Causality
by: Kıcıman, Emre, et al.
Published: (2023)
by: Kıcıman, Emre, et al.
Published: (2023)
Optimizing Language Models for Human Preferences is a Causal Inference Problem
by: Lin, Victoria, et al.
Published: (2024)
by: Lin, Victoria, et al.
Published: (2024)
A Design-based Solution for Causal Inference with Text: Can a Language Model Be Too Large?
by: Tierney, Graham, et al.
Published: (2025)
by: Tierney, Graham, et al.
Published: (2025)
End-To-End Causal Effect Estimation from Unstructured Natural Language Data
by: Dhawan, Nikita, et al.
Published: (2024)
by: Dhawan, Nikita, et al.
Published: (2024)
TWIN-GPT: Digital Twins for Clinical Trials via Large Language Model
by: Wang, Yue, et al.
Published: (2024)
by: Wang, Yue, et al.
Published: (2024)
Matcha-TTS: A fast TTS architecture with conditional flow matching
by: Mehta, Shivam, et al.
Published: (2023)
by: Mehta, Shivam, et al.
Published: (2023)
CLEAR: Can Language Models Really Understand Causal Graphs?
by: Chen, Sirui, et al.
Published: (2024)
by: Chen, Sirui, et al.
Published: (2024)
Language Models as Causal Effect Generators
by: Bynum, Lucius E. J., et al.
Published: (2024)
by: Bynum, Lucius E. J., et al.
Published: (2024)
Proximal Causal Inference With Text Data
by: Chen, Jacob M., et al.
Published: (2024)
by: Chen, Jacob M., et al.
Published: (2024)
A Causal Lens for Evaluating Faithfulness Metrics
by: Zaman, Kerem, et al.
Published: (2025)
by: Zaman, Kerem, et al.
Published: (2025)
RCT Rejection Sampling for Causal Estimation Evaluation
by: Keith, Katherine A., et al.
Published: (2023)
by: Keith, Katherine A., et al.
Published: (2023)
Using Imperfect Surrogates for Downstream Inference: Design-based Supervised Learning for Social Science Applications of Large Language Models
by: Egami, Naoki, et al.
Published: (2023)
by: Egami, Naoki, et al.
Published: (2023)
Debiasing Watermarks for Large Language Models via Maximal Coupling
by: Xie, Yangxinyu, et al.
Published: (2024)
by: Xie, Yangxinyu, et al.
Published: (2024)
MuPlon: Multi-Path Causal Optimization for Claim Verification through Controlling Confounding
by: Guo, Hanghui, et al.
Published: (2025)
by: Guo, Hanghui, et al.
Published: (2025)
Discovering and Reasoning of Causality in the Hidden World with Large Language Models
by: Liu, Chenxi, et al.
Published: (2024)
by: Liu, Chenxi, et al.
Published: (2024)
Causal Representation Learning from Multimodal Clinical Records under Non-Random Modality Missingness
by: Liang, Zihan, et al.
Published: (2025)
by: Liang, Zihan, et al.
Published: (2025)
Evaluating the Unseen Capabilities: How Many Theorems Do LLMs Know?
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
Omitted Variable Bias in Language Models Under Distribution Shift
by: Lin, Victoria, et al.
Published: (2026)
by: Lin, Victoria, et al.
Published: (2026)
Text Rationalization for Robust Causal Effect Estimation
by: Zhang, Lijinghua, et al.
Published: (2025)
by: Zhang, Lijinghua, et al.
Published: (2025)
Causal Inference on Outcomes Learned from Text
by: Modarressi, Iman, et al.
Published: (2025)
by: Modarressi, Iman, et al.
Published: (2025)
Robust Detection of Watermarks for Large Language Models Under Human Edits
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
Random Text, Zipf's Law, Critical Length,and Implications for Large Language Models
by: Berman, Vladimir
Published: (2025)
by: Berman, Vladimir
Published: (2025)
Industrial-Grade Smart Troubleshooting through Causal Technical Language Processing: a Proof of Concept
by: Trilla, Alexandre, et al.
Published: (2024)
by: Trilla, Alexandre, et al.
Published: (2024)
A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
How to Evaluate Entity Resolution Systems: An Entity-Centric Framework with Application to Inventor Name Disambiguation
by: Binette, Olivier, et al.
Published: (2024)
by: Binette, Olivier, et al.
Published: (2024)
ALCM: Autonomous LLM-Augmented Causal Discovery Framework
by: Khatibi, Elahe, et al.
Published: (2024)
by: Khatibi, Elahe, et al.
Published: (2024)
Causal Discovery from Conditionally Stationary Time Series
by: Balsells-Rodas, Carles, et al.
Published: (2021)
by: Balsells-Rodas, Carles, et al.
Published: (2021)
Unified speech and gesture synthesis using flow matching
by: Mehta, Shivam, et al.
Published: (2023)
by: Mehta, Shivam, et al.
Published: (2023)
Do Bias Benchmarks Generalise? Evidence from Voice-based Evaluation of Gender Bias in SpeechLLMs
by: Satish, Shree Harsha Bokkahalli, et al.
Published: (2025)
by: Satish, Shree Harsha Bokkahalli, et al.
Published: (2025)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
by: Yang, Rem, et al.
Published: (2025)
by: Yang, Rem, et al.
Published: (2025)
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
by: Shah, Kulin, et al.
Published: (2024)
by: Shah, Kulin, et al.
Published: (2024)
Annotation Sensitivity: Training Data Collection Methods Affect Model Performance
by: Kern, Christoph, et al.
Published: (2023)
by: Kern, Christoph, et al.
Published: (2023)
AutoEval Done Right: Using Synthetic Data for Model Evaluation
by: Boyeau, Pierre, et al.
Published: (2024)
by: Boyeau, Pierre, et al.
Published: (2024)
Similar Items
-
Causality for Tabular Data Synthesis: A High-Order Structure Causal Benchmark Framework
by: Tu, Ruibo, et al.
Published: (2024) -
Evaluating Interventional Reasoning Capabilities of Large Language Models
by: Kasetty, Tejas, et al.
Published: (2024) -
Exploring Internal Numeracy in Language Models: A Case Study on ALBERT
by: Wennberg, Ulme, et al.
Published: (2024) -
VoXtream: Full-Stream Text-to-Speech with Extremely Low Latency
by: Torgashov, Nikita, et al.
Published: (2025) -
VoXtream2: Full-stream TTS with dynamic speaking rate control
by: Torgashov, Nikita, et al.
Published: (2026)