CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yuzhe, Zhu, Yaochen, Li, Jundong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment
by: Chang, Edward Y.
Published: (2026)
by: Chang, Edward Y.
Published: (2026)
Generative Risk Minimization for Out-of-Distribution Generalization on Graphs
by: Wang, Song, et al.
Published: (2025)
by: Wang, Song, et al.
Published: (2025)
Knowledge Graph-Enhanced Large Language Models via Path Selection
by: Liu, Haochen, et al.
Published: (2024)
by: Liu, Haochen, et al.
Published: (2024)
Knowledge Editing for Large Language Models: A Survey
by: Wang, Song, et al.
Published: (2023)
by: Wang, Song, et al.
Published: (2023)
Hume's Representational Conditions for Causal Judgment: What Bayesian Formalization Abstracted Away
by: Wu, Yiling
Published: (2026)
by: Wu, Yiling
Published: (2026)
CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation
by: Sawarni, Ayush, et al.
Published: (2026)
by: Sawarni, Ayush, et al.
Published: (2026)
SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation
by: Zheng, Zaiyi, et al.
Published: (2026)
by: Zheng, Zaiyi, et al.
Published: (2026)
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
by: Li, Xuchen, et al.
Published: (2025)
by: Li, Xuchen, et al.
Published: (2025)
Do Large Language Models Show Biases in Causal Learning? Insights from Contingency Judgment
by: Carro, María Victoria, et al.
Published: (2025)
by: Carro, María Victoria, et al.
Published: (2025)
Causal Concept Graph Models: Beyond Causal Opacity in Deep Learning
by: Dominici, Gabriele, et al.
Published: (2024)
by: Dominici, Gabriele, et al.
Published: (2024)
Causality Model for Semantic Understanding on Videos
by: Yicong, Li
Published: (2025)
by: Yicong, Li
Published: (2025)
NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise
by: Xu, Zhi, et al.
Published: (2026)
by: Xu, Zhi, et al.
Published: (2026)
DMCD: Semantic-Statistical Framework for Causal Discovery
by: KaPatel, Samarth, et al.
Published: (2026)
by: KaPatel, Samarth, et al.
Published: (2026)
Causal-Copilot: An Autonomous Causal Analysis Agent
by: Wang, Xinyue, et al.
Published: (2025)
by: Wang, Xinyue, et al.
Published: (2025)
Modeling Endogenous Logic: Causal Neuro-Symbolic Reasoning Model for Explainable Multi-Behavior Recommendation
by: Chen, Yuzhe, et al.
Published: (2026)
by: Chen, Yuzhe, et al.
Published: (2026)
Towards Deconfounded Image-Text Matching with Causal Inference
by: Li, Wenhui, et al.
Published: (2024)
by: Li, Wenhui, et al.
Published: (2024)
Hybrid Causal Identification and Causal Mechanism Clustering
by: Liu, Saixiong, et al.
Published: (2025)
by: Liu, Saixiong, et al.
Published: (2025)
Beyond Surface Judgments: Human-Grounded Risk Evaluation of LLM-Generated Disinformation
by: Xu, Zonghuan, et al.
Published: (2026)
by: Xu, Zonghuan, et al.
Published: (2026)
CausalAgent: A Conversational Multi-Agent System for End-to-End Causal Inference
by: Zhu, Jiawei, et al.
Published: (2026)
by: Zhu, Jiawei, et al.
Published: (2026)
A Two-Stage Interpretable Matching Framework for Causal Inference
by: Shikalgar, Sahil, et al.
Published: (2025)
by: Shikalgar, Sahil, et al.
Published: (2025)
Causality for Tabular Data Synthesis: A High-Order Structure Causal Benchmark Framework
by: Tu, Ruibo, et al.
Published: (2024)
by: Tu, Ruibo, et al.
Published: (2024)
Screen, Cache, and Match: A Training-Free Causality-Consistent Reference Frame Framework for Human Animation
by: Wang, Jianan, et al.
Published: (2025)
by: Wang, Jianan, et al.
Published: (2025)
CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures
by: Bonagiri, Akash, et al.
Published: (2026)
by: Bonagiri, Akash, et al.
Published: (2026)
Causal Strengths and Leaky Beliefs: Interpreting LLM Reasoning via Noisy-OR Causal Bayes Nets
by: Dettki, Hanna
Published: (2025)
by: Dettki, Hanna
Published: (2025)
CausalPlan: Empowering Efficient LLM Multi-Agent Collaboration Through Causality-Driven Planning
by: Nguyen, Minh Hoang, et al.
Published: (2025)
by: Nguyen, Minh Hoang, et al.
Published: (2025)
Beyond Patterns: Harnessing Causal Logic for Autonomous Driving Trajectory Prediction
by: Wang, Bonan, et al.
Published: (2025)
by: Wang, Bonan, et al.
Published: (2025)
Causal Interventions on Causal Paths: Mapping GPT-2's Reasoning From Syntax to Semantics
by: Lee, Isabelle, et al.
Published: (2024)
by: Lee, Isabelle, et al.
Published: (2024)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
by: Wang, Chaoqi, et al.
Published: (2025)
by: Wang, Chaoqi, et al.
Published: (2025)
Causality Without Causal Models
by: Halpern, Joseph Y., et al.
Published: (2025)
by: Halpern, Joseph Y., et al.
Published: (2025)
ACCESS : A Benchmark for Abstract Causal Event Discovery and Reasoning
by: Vo, Vy, et al.
Published: (2025)
by: Vo, Vy, et al.
Published: (2025)
Beyond Single-Point Judgment: Distribution Alignment for LLM-as-a-Judge
by: Chen, Luyu, et al.
Published: (2025)
by: Chen, Luyu, et al.
Published: (2025)
CausalRec: A CausalBoost Attention Model for Sequential Recommendation
by: Hou, Yunbo, et al.
Published: (2025)
by: Hou, Yunbo, et al.
Published: (2025)
CausalProfiler: Generating Synthetic Benchmarks for Rigorous and Transparent Evaluation of Causal Machine Learning
by: Panayiotou, Panayiotis, et al.
Published: (2025)
by: Panayiotou, Panayiotis, et al.
Published: (2025)
The Veln(ia)s is in the Details: Evaluating LLM Judgment on Latvian and Lithuanian Short Answer Matching
by: Kostiuk, Yevhen, et al.
Published: (2025)
by: Kostiuk, Yevhen, et al.
Published: (2025)
LLM4Causal: Democratized Causal Tools for Everyone via Large Language Model
by: Jiang, Haitao, et al.
Published: (2023)
by: Jiang, Haitao, et al.
Published: (2023)
CausalMMM: Learning Causal Structure for Marketing Mix Modeling
by: Gong, Chang, et al.
Published: (2024)
by: Gong, Chang, et al.
Published: (2024)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
by: Li, Zhiyuan, et al.
Published: (2024)
by: Li, Zhiyuan, et al.
Published: (2024)
Towards a Benchmark for Causal Business Process Reasoning with LLMs
by: Fournier, Fabiana, et al.
Published: (2024)
by: Fournier, Fabiana, et al.
Published: (2024)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
by: Komanduri, Aneesh, et al.
Published: (2025)
by: Komanduri, Aneesh, et al.
Published: (2025)
Causal Unsupervised Semantic Segmentation
by: Kim, Junho, et al.
Published: (2023)
by: Kim, Junho, et al.
Published: (2023)
Similar Items
-
Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment
by: Chang, Edward Y.
Published: (2026) -
Generative Risk Minimization for Out-of-Distribution Generalization on Graphs
by: Wang, Song, et al.
Published: (2025) -
Knowledge Graph-Enhanced Large Language Models via Path Selection
by: Liu, Haochen, et al.
Published: (2024) -
Knowledge Editing for Large Language Models: A Survey
by: Wang, Song, et al.
Published: (2023) -
Hume's Representational Conditions for Causal Judgment: What Bayesian Formalization Abstracted Away
by: Wu, Yiling
Published: (2026)