The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Zihan, Zhang, Yiming, Geng, Wenxiang, Ding, Zenghui, Sun, Yining |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?
por: Chen, Zihan, et al.
Publicado: (2025)
por: Chen, Zihan, et al.
Publicado: (2025)
RankCLIP: Ranking-Consistent Language-Image Pretraining
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
Information-Theoretic Causal Bounds under Unmeasured Confounding
por: Jung, Yonghan, et al.
Publicado: (2026)
por: Jung, Yonghan, et al.
Publicado: (2026)
Inductive Subgraphs as Shortcuts: Causal Disentanglement for Heterophilic Graph Learning
por: Wang, Xiangmeng, et al.
Publicado: (2026)
por: Wang, Xiangmeng, et al.
Publicado: (2026)
Meaningful Causal Aggregation and Paradoxical Confounding
por: Zhu, Yuchen, et al.
Publicado: (2023)
por: Zhu, Yuchen, et al.
Publicado: (2023)
The Reliability Paradox: Exploring How Shortcut Learning Undermines Language Model Calibration
por: Bihani, Geetanjali, et al.
Publicado: (2024)
por: Bihani, Geetanjali, et al.
Publicado: (2024)
Single-stream Policy Optimization
por: Xu, Zhongwen, et al.
Publicado: (2025)
por: Xu, Zhongwen, et al.
Publicado: (2025)
Networked Restless Multi-Arm Bandits with Reinforcement Learning
por: Zhang, Hanmo, et al.
Publicado: (2025)
por: Zhang, Hanmo, et al.
Publicado: (2025)
The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning
por: Shin, Kwan Soo
Publicado: (2026)
por: Shin, Kwan Soo
Publicado: (2026)
CARE: Turning LLMs Into Causal Reasoning Expert
por: Dong, Juncheng, et al.
Publicado: (2025)
por: Dong, Juncheng, et al.
Publicado: (2025)
TimeMKG: Knowledge-Infused Causal Reasoning for Multivariate Time Series Modeling
por: Sun, Yifei, et al.
Publicado: (2025)
por: Sun, Yifei, et al.
Publicado: (2025)
BEARS Make Neuro-Symbolic Models Aware of their Reasoning Shortcuts
por: Marconato, Emanuele, et al.
Publicado: (2024)
por: Marconato, Emanuele, et al.
Publicado: (2024)
Can Post-Training Transform LLMs into Causal Reasoners?
por: Chen, Junqi, et al.
Publicado: (2026)
por: Chen, Junqi, et al.
Publicado: (2026)
LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs
por: Zhou, Zenghui, et al.
Publicado: (2026)
por: Zhou, Zenghui, et al.
Publicado: (2026)
GTBench: Uncovering the Strategic Reasoning Limitations of LLMs via Game-Theoretic Evaluations
por: Duan, Jinhao, et al.
Publicado: (2024)
por: Duan, Jinhao, et al.
Publicado: (2024)
A Neuro-Symbolic Benchmark Suite for Concept Quality and Reasoning Shortcuts
por: Bortolotti, Samuele, et al.
Publicado: (2024)
por: Bortolotti, Samuele, et al.
Publicado: (2024)
Calibration-Aware Policy Optimization for Reasoning LLMs
por: Wang, Ziqi, et al.
Publicado: (2026)
por: Wang, Ziqi, et al.
Publicado: (2026)
DINORANKCLIP: DINOv3 Distillation and Injection for Vision-Language Pretraining with High-Order Ranking Consistency
por: Jiang, Shuyang, et al.
Publicado: (2026)
por: Jiang, Shuyang, et al.
Publicado: (2026)
Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection
por: Chen, Xingwu, et al.
Publicado: (2025)
por: Chen, Xingwu, et al.
Publicado: (2025)
Theoretical Analysis of Meta Reinforcement Learning: Generalization Bounds and Convergence Guarantees
por: Wang, Cangqing, et al.
Publicado: (2024)
por: Wang, Cangqing, et al.
Publicado: (2024)
MiMu: Mitigating Multiple Shortcut Learning Behavior of Transformers
por: Zhao, Lili, et al.
Publicado: (2025)
por: Zhao, Lili, et al.
Publicado: (2025)
Symbol Grounding in Neuro-Symbolic AI: A Gentle Introduction to Reasoning Shortcuts
por: Marconato, Emanuele, et al.
Publicado: (2025)
por: Marconato, Emanuele, et al.
Publicado: (2025)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
por: Xu, Wenzhe, et al.
Publicado: (2026)
por: Xu, Wenzhe, et al.
Publicado: (2026)
Information-Theoretic Safe Bayesian Optimization
por: Bottero, Alessandro G., et al.
Publicado: (2024)
por: Bottero, Alessandro G., et al.
Publicado: (2024)
Reasoning Stabilization Point: A Training-Time Signal for Stable Evidence and Shortcut Reliance
por: Dhayalkar, Sahil Rajesh
Publicado: (2026)
por: Dhayalkar, Sahil Rajesh
Publicado: (2026)
Efficient Transfer Learning via Causal Bounds
por: Gong, Xueping, et al.
Publicado: (2023)
por: Gong, Xueping, et al.
Publicado: (2023)
Learning with Logical Constraints but without Shortcut Satisfaction
por: Li, Zenan, et al.
Publicado: (2024)
por: Li, Zenan, et al.
Publicado: (2024)
Learning to Correct for QA Reasoning with Black-box LLMs
por: Kim, Jaehyung, et al.
Publicado: (2024)
por: Kim, Jaehyung, et al.
Publicado: (2024)
Rectifying Shortcut Behaviors in Preference-based Reward Learning
por: Ye, Wenqian, et al.
Publicado: (2025)
por: Ye, Wenqian, et al.
Publicado: (2025)
Generalization of RLVR Using Causal Reasoning as a Testbed
por: Lu, Brian, et al.
Publicado: (2025)
por: Lu, Brian, et al.
Publicado: (2025)
Revisiting Meta-Learning with Noisy Labels: Reweighting Dynamics and Theoretical Guarantees
por: Zhang, Yiming, et al.
Publicado: (2025)
por: Zhang, Yiming, et al.
Publicado: (2025)
Transferring Information Across Interventions in Causal Bayesian Optimization
por: Javidian, Mohammad Ali
Publicado: (2026)
por: Javidian, Mohammad Ali
Publicado: (2026)
Probing Neural Combinatorial Optimization Models
por: Zhang, Zhiqin, et al.
Publicado: (2025)
por: Zhang, Zhiqin, et al.
Publicado: (2025)
On the Empirical Complexity of Reasoning and Planning in LLMs
por: Kang, Liwei, et al.
Publicado: (2024)
por: Kang, Liwei, et al.
Publicado: (2024)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
por: Miao, Yuchun, et al.
Publicado: (2024)
por: Miao, Yuchun, et al.
Publicado: (2024)
Gradient-based Model Shortcut Detection for Time Series Classification
por: Ibarra, Salomon, et al.
Publicado: (2025)
por: Ibarra, Salomon, et al.
Publicado: (2025)
HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs
por: Kachroo, Darsh, et al.
Publicado: (2026)
por: Kachroo, Darsh, et al.
Publicado: (2026)
Deciphering Scientific Reasoning Steps from Outcome Data for Molecule Optimization
por: Liu, Zequn, et al.
Publicado: (2026)
por: Liu, Zequn, et al.
Publicado: (2026)
Causal Masking on Spatial Data: An Information-Theoretic Case for Learning Spatial Datasets with Unimodal Language Models
por: Junkin, Jared, et al.
Publicado: (2025)
por: Junkin, Jared, et al.
Publicado: (2025)
ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding
por: Zhoubian, Sining, et al.
Publicado: (2025)
por: Zhoubian, Sining, et al.
Publicado: (2025)
Ejemplares similares
-
Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?
por: Chen, Zihan, et al.
Publicado: (2025) -
RankCLIP: Ranking-Consistent Language-Image Pretraining
por: Zhang, Yiming, et al.
Publicado: (2024) -
Information-Theoretic Causal Bounds under Unmeasured Confounding
por: Jung, Yonghan, et al.
Publicado: (2026) -
Inductive Subgraphs as Shortcuts: Causal Disentanglement for Heterophilic Graph Learning
por: Wang, Xiangmeng, et al.
Publicado: (2026) -
Meaningful Causal Aggregation and Paradoxical Confounding
por: Zhu, Yuchen, et al.
Publicado: (2023)