Evaluating Interventional Reasoning Capabilities of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kasetty, Tejas, Mahajan, Divyat, Dziugaite, Gintare Karolina, Drouin, Alexandre, Sridhar, Dhanya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Empirical Analysis of Model Selection for Heterogeneous Causal Effect Estimation
di: Mahajan, Divyat, et al.
Pubblicazione: (2022)
di: Mahajan, Divyat, et al.
Pubblicazione: (2022)
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
di: Cai, Hengrui, et al.
Pubblicazione: (2023)
di: Cai, Hengrui, et al.
Pubblicazione: (2023)
Sparse Shift Autoencoders for Identifying Concepts from Large Language Model Activations
di: Joshi, Shruti, et al.
Pubblicazione: (2025)
di: Joshi, Shruti, et al.
Pubblicazione: (2025)
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
di: Tu, Ruibo, et al.
Pubblicazione: (2024)
di: Tu, Ruibo, et al.
Pubblicazione: (2024)
Industrial-Grade Smart Troubleshooting through Causal Technical Language Processing: a Proof of Concept
di: Trilla, Alexandre, et al.
Pubblicazione: (2024)
di: Trilla, Alexandre, et al.
Pubblicazione: (2024)
A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation
di: Sarmah, Bhaskarjit, et al.
Pubblicazione: (2024)
di: Sarmah, Bhaskarjit, et al.
Pubblicazione: (2024)
Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective
di: Gagnon, Leo, et al.
Pubblicazione: (2025)
di: Gagnon, Leo, et al.
Pubblicazione: (2025)
Less is More: Undertraining Experts Improves Model Upcycling
di: Horoi, Stefan, et al.
Pubblicazione: (2025)
di: Horoi, Stefan, et al.
Pubblicazione: (2025)
AutoEval Done Right: Using Synthetic Data for Model Evaluation
di: Boyeau, Pierre, et al.
Pubblicazione: (2024)
di: Boyeau, Pierre, et al.
Pubblicazione: (2024)
CLEAR: Can Language Models Really Understand Causal Graphs?
di: Chen, Sirui, et al.
Pubblicazione: (2024)
di: Chen, Sirui, et al.
Pubblicazione: (2024)
Causal Reasoning and Large Language Models: Opening a New Frontier for Causality
di: Kıcıman, Emre, et al.
Pubblicazione: (2023)
di: Kıcıman, Emre, et al.
Pubblicazione: (2023)
Propagation and Pitfalls: Reasoning-based Assessment of Knowledge Editing through Counterfactual Tasks
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
A Causal Lens for Evaluating Faithfulness Metrics
di: Zaman, Kerem, et al.
Pubblicazione: (2025)
di: Zaman, Kerem, et al.
Pubblicazione: (2025)
RCT Rejection Sampling for Causal Estimation Evaluation
di: Keith, Katherine A., et al.
Pubblicazione: (2023)
di: Keith, Katherine A., et al.
Pubblicazione: (2023)
In-context learning and Occam's razor
di: Elmoznino, Eric, et al.
Pubblicazione: (2024)
di: Elmoznino, Eric, et al.
Pubblicazione: (2024)
Language Models as Causal Effect Generators
di: Bynum, Lucius E. J., et al.
Pubblicazione: (2024)
di: Bynum, Lucius E. J., et al.
Pubblicazione: (2024)
Continual Learning in Vision-Language Models via Aligned Model Merging
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
A Compression Perspective on Simplicity Bias
di: Marty, Tom, et al.
Pubblicazione: (2026)
di: Marty, Tom, et al.
Pubblicazione: (2026)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
di: Dong, Yihong, et al.
Pubblicazione: (2026)
di: Dong, Yihong, et al.
Pubblicazione: (2026)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
Learning to Defer for Causal Discovery with Imperfect Experts
di: Clivio, Oscar, et al.
Pubblicazione: (2025)
di: Clivio, Oscar, et al.
Pubblicazione: (2025)
RealTCD: Temporal Causal Discovery from Interventional Data with Large Language Model
di: Li, Peiwen, et al.
Pubblicazione: (2024)
di: Li, Peiwen, et al.
Pubblicazione: (2024)
Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
di: Wang, Wentian, et al.
Pubblicazione: (2024)
di: Wang, Wentian, et al.
Pubblicazione: (2024)
Discovering and Reasoning of Causality in the Hidden World with Large Language Models
di: Liu, Chenxi, et al.
Pubblicazione: (2024)
di: Liu, Chenxi, et al.
Pubblicazione: (2024)
Soup to go: mitigating forgetting during continual learning with model averaging
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors
di: Syed, Usman, et al.
Pubblicazione: (2024)
di: Syed, Usman, et al.
Pubblicazione: (2024)
Text Rationalization for Robust Causal Effect Estimation
di: Zhang, Lijinghua, et al.
Pubblicazione: (2025)
di: Zhang, Lijinghua, et al.
Pubblicazione: (2025)
From Ground Truth to Measurement: A Statistical Framework for Human Labeling
di: Chew, Robert, et al.
Pubblicazione: (2026)
di: Chew, Robert, et al.
Pubblicazione: (2026)
The Leaderboard Illusion
di: Singh, Shivalika, et al.
Pubblicazione: (2025)
di: Singh, Shivalika, et al.
Pubblicazione: (2025)
Majority of the Bests: Improving Best-of-N via Bootstrapping
di: Rakhsha, Amin, et al.
Pubblicazione: (2025)
di: Rakhsha, Amin, et al.
Pubblicazione: (2025)
Efficient Exploration for LLMs
di: Dwaracherla, Vikranth, et al.
Pubblicazione: (2024)
di: Dwaracherla, Vikranth, et al.
Pubblicazione: (2024)
ALCM: Autonomous LLM-Augmented Causal Discovery Framework
di: Khatibi, Elahe, et al.
Pubblicazione: (2024)
di: Khatibi, Elahe, et al.
Pubblicazione: (2024)
Adaptive Uncertainty Quantification for Generative AI
di: Kim, Jungeum, et al.
Pubblicazione: (2024)
di: Kim, Jungeum, et al.
Pubblicazione: (2024)
Embedding Trust: Semantic Isotropy Predicts Nonfactuality in Long-Form Text Generation
di: Bhardwaj, Dhrupad, et al.
Pubblicazione: (2025)
di: Bhardwaj, Dhrupad, et al.
Pubblicazione: (2025)
(Mis)Fitting: A Survey of Scaling Laws
di: Li, Margaret, et al.
Pubblicazione: (2025)
di: Li, Margaret, et al.
Pubblicazione: (2025)
Evaluating the Robustness of Analogical Reasoning in Large Language Models
di: Lewis, Martha, et al.
Pubblicazione: (2024)
di: Lewis, Martha, et al.
Pubblicazione: (2024)
Generative Evaluation of Complex Reasoning in Large Language Models
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
di: Guo, Phillip, et al.
Pubblicazione: (2024)
di: Guo, Phillip, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Empirical Analysis of Model Selection for Heterogeneous Causal Effect Estimation
di: Mahajan, Divyat, et al.
Pubblicazione: (2022) -
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
di: Cai, Hengrui, et al.
Pubblicazione: (2023) -
Sparse Shift Autoencoders for Identifying Concepts from Large Language Model Activations
di: Joshi, Shruti, et al.
Pubblicazione: (2025) -
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
di: Tu, Ruibo, et al.
Pubblicazione: (2024) -
Industrial-Grade Smart Troubleshooting through Causal Technical Language Processing: a Proof of Concept
di: Trilla, Alexandre, et al.
Pubblicazione: (2024)