Failure Modes of LLMs for Causal Reasoning on Narratives
Fuente:
arXiv
Guardado en:
| Autores principales: | Yamin, Khurram, Gupta, Shantanu, Ghosal, Gaurav R., Lipton, Zachary C., Wilder, Bryan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can LLMs Reconcile Knowledge Conflicts in Counterfactual Reasoning
por: Yamin, Khurram, et al.
Publicado: (2025)
por: Yamin, Khurram, et al.
Publicado: (2025)
Dependent Randomized Rounding for Budget Constrained Experimental Design
por: Yamin, Khurram, et al.
Publicado: (2025)
por: Yamin, Khurram, et al.
Publicado: (2025)
Local Causal Discovery for Estimating Causal Effects
por: Gupta, Shantanu, et al.
Publicado: (2023)
por: Gupta, Shantanu, et al.
Publicado: (2023)
Valid Inference with Imperfect Synthetic Data
por: Byun, Yewon, et al.
Publicado: (2025)
por: Byun, Yewon, et al.
Publicado: (2025)
Can Revealed Preferences Clarify LLM Alignment and Steering?
por: Yamin, Khurram, et al.
Publicado: (2026)
por: Yamin, Khurram, et al.
Publicado: (2026)
Accounting for Missing Covariates in Heterogeneous Treatment Estimation
por: Yamin, Khurram, et al.
Publicado: (2024)
por: Yamin, Khurram, et al.
Publicado: (2024)
TOFU: A Task of Fictitious Unlearning for LLMs
por: Maini, Pratyush, et al.
Publicado: (2024)
por: Maini, Pratyush, et al.
Publicado: (2024)
Understanding Finetuning for Factual Knowledge Extraction
por: Ghosal, Gaurav, et al.
Publicado: (2024)
por: Ghosal, Gaurav, et al.
Publicado: (2024)
Online Data Collection for Efficient Semiparametric Inference
por: Gupta, Shantanu, et al.
Publicado: (2024)
por: Gupta, Shantanu, et al.
Publicado: (2024)
GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence
por: Krishna, Kundan, et al.
Publicado: (2024)
por: Krishna, Kundan, et al.
Publicado: (2024)
Auditing Fairness under Unobserved Confounding
por: Byun, Yewon, et al.
Publicado: (2024)
por: Byun, Yewon, et al.
Publicado: (2024)
LLM-Select: Feature Selection with Large Language Models
por: Jeong, Daniel P., et al.
Publicado: (2024)
por: Jeong, Daniel P., et al.
Publicado: (2024)
Which LLMs are Difficult to Detect? A Detailed Analysis of Potential Factors Contributing to Difficulties in LLM Text Detection
por: Thorat, Shantanu, et al.
Publicado: (2024)
por: Thorat, Shantanu, et al.
Publicado: (2024)
Failure Modes of Maximum Entropy RLHF
por: Çağatan, Ömer Veysel, et al.
Publicado: (2025)
por: Çağatan, Ömer Veysel, et al.
Publicado: (2025)
Rethinking LLM Memorization through the Lens of Adversarial Compression
por: Schwarzschild, Avi, et al.
Publicado: (2024)
por: Schwarzschild, Avi, et al.
Publicado: (2024)
Personalized Language Modeling from Personalized Human Feedback
por: Li, Xinyu, et al.
Publicado: (2024)
por: Li, Xinyu, et al.
Publicado: (2024)
Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
A Unified Causal Framework for Auditing Recommender Systems for Ethical Concerns
por: Sharma, Vibhhu, et al.
Publicado: (2024)
por: Sharma, Vibhhu, et al.
Publicado: (2024)
Can Stories Help LLMs Reason? Curating Information Space Through Narrative
por: Javadi, Vahid Sadiri, et al.
Publicado: (2024)
por: Javadi, Vahid Sadiri, et al.
Publicado: (2024)
Medical Adaptation of Large Language and Vision-Language Models: Are We Making Progress?
por: Jeong, Daniel P., et al.
Publicado: (2024)
por: Jeong, Daniel P., et al.
Publicado: (2024)
Can Post-Training Transform LLMs into Causal Reasoners?
por: Chen, Junqi, et al.
Publicado: (2026)
por: Chen, Junqi, et al.
Publicado: (2026)
The Limited Impact of Medical Adaptation of Large Language and Vision-Language Models
por: Jeong, Daniel P., et al.
Publicado: (2024)
por: Jeong, Daniel P., et al.
Publicado: (2024)
Causal Micro-Narratives
por: Heddaya, Mourad, et al.
Publicado: (2024)
por: Heddaya, Mourad, et al.
Publicado: (2024)
T-MARS: Improving Visual Representations by Circumventing Text Feature Learning
por: Maini, Pratyush, et al.
Publicado: (2023)
por: Maini, Pratyush, et al.
Publicado: (2023)
The Fragility of Fairness: Causal Sensitivity Analysis for Fair Machine Learning
por: Fawkes, Jake, et al.
Publicado: (2024)
por: Fawkes, Jake, et al.
Publicado: (2024)
DACTYL: Diverse Adversarial Corpus of Texts Yielded from Large Language Models
por: Thorat, Shantanu, et al.
Publicado: (2025)
por: Thorat, Shantanu, et al.
Publicado: (2025)
AP-BMM: Approximating Capability-Cost Pareto Sets of LLMs via Asynchronous Prior-Guided Bayesian Model Merging
por: Chen, Kesheng, et al.
Publicado: (2025)
por: Chen, Kesheng, et al.
Publicado: (2025)
Causality $\neq$ Invariance: Function and Concept Vectors in LLMs
por: Opiełka, Gustaw, et al.
Publicado: (2026)
por: Opiełka, Gustaw, et al.
Publicado: (2026)
Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
por: Pal, Arka, et al.
Publicado: (2024)
por: Pal, Arka, et al.
Publicado: (2024)
Narrative Feature or Structured Feature? A Study of Large Language Models to Identify Cancer Patients at Risk of Heart Failure
por: Chen, Ziyi, et al.
Publicado: (2024)
por: Chen, Ziyi, et al.
Publicado: (2024)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
por: Fu, Yuqian, et al.
Publicado: (2026)
por: Fu, Yuqian, et al.
Publicado: (2026)
Large Language Model Reasoning Failures
por: Song, Peiyang, et al.
Publicado: (2026)
por: Song, Peiyang, et al.
Publicado: (2026)
Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks
por: Lee, Wilson Y.
Publicado: (2026)
por: Lee, Wilson Y.
Publicado: (2026)
Reasoning Boosts Opinion Alignment in LLMs
por: Berdoz, Frédéric, et al.
Publicado: (2026)
por: Berdoz, Frédéric, et al.
Publicado: (2026)
Learning to Reason in LLMs by Expectation Maximization
por: Lee, Junghyun, et al.
Publicado: (2025)
por: Lee, Junghyun, et al.
Publicado: (2025)
Towards Reasoning Ability of Small Language Models
por: Srivastava, Gaurav, et al.
Publicado: (2025)
por: Srivastava, Gaurav, et al.
Publicado: (2025)
Causal Reasoning Favors Encoders: On The Limits of Decoder-Only Models
por: Roy, Amartya, et al.
Publicado: (2025)
por: Roy, Amartya, et al.
Publicado: (2025)
CausalARC: Abstract Reasoning with Causal World Models
por: Maasch, Jacqueline, et al.
Publicado: (2025)
por: Maasch, Jacqueline, et al.
Publicado: (2025)
Compositional Causal Reasoning Evaluation in Language Models
por: Maasch, Jacqueline R. M. A., et al.
Publicado: (2025)
por: Maasch, Jacqueline R. M. A., et al.
Publicado: (2025)
Benchmarking and Understanding Compositional Relational Reasoning of LLMs
por: Ni, Ruikang, et al.
Publicado: (2024)
por: Ni, Ruikang, et al.
Publicado: (2024)
Ejemplares similares
-
Can LLMs Reconcile Knowledge Conflicts in Counterfactual Reasoning
por: Yamin, Khurram, et al.
Publicado: (2025) -
Dependent Randomized Rounding for Budget Constrained Experimental Design
por: Yamin, Khurram, et al.
Publicado: (2025) -
Local Causal Discovery for Estimating Causal Effects
por: Gupta, Shantanu, et al.
Publicado: (2023) -
Valid Inference with Imperfect Synthetic Data
por: Byun, Yewon, et al.
Publicado: (2025) -
Can Revealed Preferences Clarify LLM Alignment and Steering?
por: Yamin, Khurram, et al.
Publicado: (2026)