CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation
Fuente:
arXiv
Salvato in:
| Autori principali: | Sawarni, Ayush, Tan, Jiyuan, Syrgkanis, Vasilis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Consistency of Neural Causal Partial Identification
di: Tan, Jiyuan, et al.
Pubblicazione: (2024)
di: Tan, Jiyuan, et al.
Pubblicazione: (2024)
Preference Learning with Response Time: Robust Losses and Guarantees
di: Sawarni, Ayush, et al.
Pubblicazione: (2025)
di: Sawarni, Ayush, et al.
Pubblicazione: (2025)
Learning Causal Representations from General Environments: Identifiability and Intrinsic Ambiguity
di: Jin, Jikai, et al.
Pubblicazione: (2023)
di: Jin, Jikai, et al.
Pubblicazione: (2023)
Empirical Analysis of Model Selection for Heterogeneous Causal Effect Estimation
di: Mahajan, Divyat, et al.
Pubblicazione: (2022)
di: Mahajan, Divyat, et al.
Pubblicazione: (2022)
Statistical Inference and Learning for Shapley Additive Explanations (SHAP)
di: Whitehouse, Justin, et al.
Pubblicazione: (2026)
di: Whitehouse, Justin, et al.
Pubblicazione: (2026)
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
di: Jin, Jikai, et al.
Pubblicazione: (2025)
di: Jin, Jikai, et al.
Pubblicazione: (2025)
Adaptive Estimation and Inference in Conditional Moment Models via the Discrepancy Principle
di: Tan, Jiyuan, et al.
Pubblicazione: (2026)
di: Tan, Jiyuan, et al.
Pubblicazione: (2026)
Policy Learning with Abstention
di: Sawarni, Ayush, et al.
Pubblicazione: (2025)
di: Sawarni, Ayush, et al.
Pubblicazione: (2025)
NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise
di: Xu, Zhi, et al.
Pubblicazione: (2026)
di: Xu, Zhi, et al.
Pubblicazione: (2026)
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
di: Li, Xuchen, et al.
Pubblicazione: (2025)
di: Li, Xuchen, et al.
Pubblicazione: (2025)
ACCESS : A Benchmark for Abstract Causal Event Discovery and Reasoning
di: Vo, Vy, et al.
Pubblicazione: (2025)
di: Vo, Vy, et al.
Pubblicazione: (2025)
Partial Identification of Policy-Relevant Treatment Effects with Instrumental Variables via Optimal Transport
di: Tan, Jiyuan, et al.
Pubblicazione: (2026)
di: Tan, Jiyuan, et al.
Pubblicazione: (2026)
Towards a Benchmark for Causal Business Process Reasoning with LLMs
di: Fournier, Fabiana, et al.
Pubblicazione: (2024)
di: Fournier, Fabiana, et al.
Pubblicazione: (2024)
Estimation of Treatment Effects in Extreme and Unobserved Data
di: Tan, Jiyuan, et al.
Pubblicazione: (2025)
di: Tan, Jiyuan, et al.
Pubblicazione: (2025)
Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights
di: Tian, Juanxi, et al.
Pubblicazione: (2025)
di: Tian, Juanxi, et al.
Pubblicazione: (2025)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
di: Komanduri, Aneesh, et al.
Pubblicazione: (2025)
di: Komanduri, Aneesh, et al.
Pubblicazione: (2025)
InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems
di: Shi, Shaojie, et al.
Pubblicazione: (2026)
di: Shi, Shaojie, et al.
Pubblicazione: (2026)
Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences
di: Chidambaram, Keertana, et al.
Pubblicazione: (2025)
di: Chidambaram, Keertana, et al.
Pubblicazione: (2025)
CausalProfiler: Generating Synthetic Benchmarks for Rigorous and Transparent Evaluation of Causal Machine Learning
di: Panayiotou, Panayiotis, et al.
Pubblicazione: (2025)
di: Panayiotou, Panayiotis, et al.
Pubblicazione: (2025)
CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching
di: Wang, Yuzhe, et al.
Pubblicazione: (2026)
di: Wang, Yuzhe, et al.
Pubblicazione: (2026)
OCDB: Revisiting Causal Discovery with a Comprehensive Benchmark and Evaluation Framework
di: Zhou, Wei, et al.
Pubblicazione: (2024)
di: Zhou, Wei, et al.
Pubblicazione: (2024)
Causal Q-Aggregation for CATE Model Selection
di: Lan, Hui, et al.
Pubblicazione: (2023)
di: Lan, Hui, et al.
Pubblicazione: (2023)
CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models
di: Foss, Aaron, et al.
Pubblicazione: (2025)
di: Foss, Aaron, et al.
Pubblicazione: (2025)
CausalARC: Abstract Reasoning with Causal World Models
di: Maasch, Jacqueline, et al.
Pubblicazione: (2025)
di: Maasch, Jacqueline, et al.
Pubblicazione: (2025)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
di: Wei, Shaohang, et al.
Pubblicazione: (2025)
di: Wei, Shaohang, et al.
Pubblicazione: (2025)
Bucketing the Good Apples: A Method for Diagnosing and Improving Causal Abstraction
di: Puyin, Li, et al.
Pubblicazione: (2026)
di: Puyin, Li, et al.
Pubblicazione: (2026)
Disentangled Double Machine Learning for Accurate Causal Effect Estimation
di: Xiang, Guodu, et al.
Pubblicazione: (2026)
di: Xiang, Guodu, et al.
Pubblicazione: (2026)
Hybrid Causal Identification and Causal Mechanism Clustering
di: Liu, Saixiong, et al.
Pubblicazione: (2025)
di: Liu, Saixiong, et al.
Pubblicazione: (2025)
Reframing Spatial Reasoning Evaluation in Language Models: A Real-World Simulation Benchmark for Qualitative Reasoning
di: Li, Fangjun, et al.
Pubblicazione: (2024)
di: Li, Fangjun, et al.
Pubblicazione: (2024)
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
di: Lee, Donggyu, et al.
Pubblicazione: (2025)
di: Lee, Donggyu, et al.
Pubblicazione: (2025)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
Causality for Tabular Data Synthesis: A High-Order Structure Causal Benchmark Framework
di: Tu, Ruibo, et al.
Pubblicazione: (2024)
di: Tu, Ruibo, et al.
Pubblicazione: (2024)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
Towards efficient representation identification in supervised learning
di: Ahuja, Kartik, et al.
Pubblicazione: (2022)
di: Ahuja, Kartik, et al.
Pubblicazione: (2022)
Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models
di: Hu, Xinmiao, et al.
Pubblicazione: (2025)
di: Hu, Xinmiao, et al.
Pubblicazione: (2025)
Experimental Evaluation of ROS-Causal in Real-World Human-Robot Spatial Interaction Scenarios
di: Castri, Luca, et al.
Pubblicazione: (2024)
di: Castri, Luca, et al.
Pubblicazione: (2024)
Disentangled Representations for Causal Cognition
di: Torresan, Filippo, et al.
Pubblicazione: (2024)
di: Torresan, Filippo, et al.
Pubblicazione: (2024)
C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning
di: Mittal, Avni, et al.
Pubblicazione: (2026)
di: Mittal, Avni, et al.
Pubblicazione: (2026)
A Benchmark of Causal vs. Correlation AI for Predictive Maintenance
di: Dhande, Shaunak, et al.
Pubblicazione: (2025)
di: Dhande, Shaunak, et al.
Pubblicazione: (2025)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
di: Xiong, Kai, et al.
Pubblicazione: (2025)
di: Xiong, Kai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Consistency of Neural Causal Partial Identification
di: Tan, Jiyuan, et al.
Pubblicazione: (2024) -
Preference Learning with Response Time: Robust Losses and Guarantees
di: Sawarni, Ayush, et al.
Pubblicazione: (2025) -
Learning Causal Representations from General Environments: Identifiability and Intrinsic Ambiguity
di: Jin, Jikai, et al.
Pubblicazione: (2023) -
Empirical Analysis of Model Selection for Heterogeneous Causal Effect Estimation
di: Mahajan, Divyat, et al.
Pubblicazione: (2022) -
Statistical Inference and Learning for Shapley Additive Explanations (SHAP)
di: Whitehouse, Justin, et al.
Pubblicazione: (2026)