Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jingyao, Guo, Peizheng, Qiang, Wenwen, Zhou, Jiahuan, Guo, Huijie, Zheng, Changwen, Xiong, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models
di: Guo, Huijie, et al.
Pubblicazione: (2026)
di: Guo, Huijie, et al.
Pubblicazione: (2026)
Rethinking Multi-Modal Learning from Gradient Uncertainty
di: Guo, Peizheng, et al.
Pubblicazione: (2025)
di: Guo, Peizheng, et al.
Pubblicazione: (2025)
Exploring Transferability of Self-Supervised Learning by Task Conflict Calibration
di: Guo, Huijie, et al.
Pubblicazione: (2025)
di: Guo, Huijie, et al.
Pubblicazione: (2025)
COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs
di: Guo, Peizheng, et al.
Pubblicazione: (2025)
di: Guo, Peizheng, et al.
Pubblicazione: (2025)
Group Causal Policy Optimization for Post-Training Large Language Models
di: Gu, Ziyin, et al.
Pubblicazione: (2025)
di: Gu, Ziyin, et al.
Pubblicazione: (2025)
PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models
di: Guo, Peizheng, et al.
Pubblicazione: (2026)
di: Guo, Peizheng, et al.
Pubblicazione: (2026)
Neuromodulated Meta-Learning
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
Towards the Causal Complete Cause of Multi-Modal Representation Learning
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
On the Plasticity and Stability for Post-Training Large Language Models
di: Qiang, Wenwen, et al.
Pubblicazione: (2026)
di: Qiang, Wenwen, et al.
Pubblicazione: (2026)
Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs
di: Wang, Jingyao, et al.
Pubblicazione: (2025)
di: Wang, Jingyao, et al.
Pubblicazione: (2025)
Causal Reward Adjustment: Mitigating Reward Hacking in External Reasoning via Backdoor Correction
di: Song, Ruike, et al.
Pubblicazione: (2025)
di: Song, Ruike, et al.
Pubblicazione: (2025)
On the Universality of Self-Supervised Learning
di: Qiang, Wenwen, et al.
Pubblicazione: (2024)
di: Qiang, Wenwen, et al.
Pubblicazione: (2024)
Towards Task Sampler Learning for Meta-Learning
di: Wang, Jingyao, et al.
Pubblicazione: (2023)
di: Wang, Jingyao, et al.
Pubblicazione: (2023)
Rethinking Meta-Learning from a Learning Lens
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
Not All Frequencies Are Created Equal:Towards a Dynamic Fusion of Frequencies in Time-Series Forecasting
di: Zhang, Xingyu, et al.
Pubblicazione: (2024)
di: Zhang, Xingyu, et al.
Pubblicazione: (2024)
On the Out-of-Distribution Generalization of Self-Supervised Learning
di: Qiang, Wenwen, et al.
Pubblicazione: (2025)
di: Qiang, Wenwen, et al.
Pubblicazione: (2025)
Spatio-Temporal Fuzzy-oriented Multi-Modal Meta-Learning for Fine-grained Emotion Recognition
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
Adaptive Uncertainty-Aware Tree Search for Robust Reasoning
di: Song, Zeen, et al.
Pubblicazione: (2026)
di: Song, Zeen, et al.
Pubblicazione: (2026)
Reward Model Generalization for Compute-Aware Test-Time Reasoning
di: Song, Zeen, et al.
Pubblicazione: (2025)
di: Song, Zeen, et al.
Pubblicazione: (2025)
Enhancing Large Language Models for Time-Series Forecasting via Vector-Injected In-Context Learning
di: Zhang, Jianqi, et al.
Pubblicazione: (2026)
di: Zhang, Jianqi, et al.
Pubblicazione: (2026)
Hacking Task Confounder in Meta-Learning
di: Wang, Jingyao, et al.
Pubblicazione: (2023)
di: Wang, Jingyao, et al.
Pubblicazione: (2023)
AwesomeMeta+: A Mixed-Prototyping Meta-Learning System Supporting AI Application Design Anywhere
di: Wang, Jingyao, et al.
Pubblicazione: (2023)
di: Wang, Jingyao, et al.
Pubblicazione: (2023)
On the Generalization and Causal Explanation in Self-Supervised Learning
di: Qiang, Wenwen, et al.
Pubblicazione: (2024)
di: Qiang, Wenwen, et al.
Pubblicazione: (2024)
Understanding Token-level Topological Structures in Transformer-based Time Series Forecasting
di: Zhang, Jianqi, et al.
Pubblicazione: (2024)
di: Zhang, Jianqi, et al.
Pubblicazione: (2024)
Beyond All-to-All: Causal-Aligned Transformer with Dynamic Structure Learning for Multivariate Time Series Forecasting
di: Zhang, Xingyu, et al.
Pubblicazione: (2025)
di: Zhang, Xingyu, et al.
Pubblicazione: (2025)
A Generalized Learning Framework for Self-Supervised Contrastive Learning
di: Si, Lingyu, et al.
Pubblicazione: (2025)
di: Si, Lingyu, et al.
Pubblicazione: (2025)
Causal Prompt Calibration Guided Segment Anything Model for Open-Vocabulary Multi-Entity Segmentation
di: Wang, Jingyao, et al.
Pubblicazione: (2025)
di: Wang, Jingyao, et al.
Pubblicazione: (2025)
Enhancing RL Safety with Counterfactual LLM Reasoning
di: Gross, Dennis, et al.
Pubblicazione: (2024)
di: Gross, Dennis, et al.
Pubblicazione: (2024)
RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
On the Transferability and Discriminability of Repersentation Learning in Unsupervised Domain Adaptation
di: Qiang, Wenwen, et al.
Pubblicazione: (2025)
di: Qiang, Wenwen, et al.
Pubblicazione: (2025)
Executable Counterfactuals: Improving LLMs' Causal Reasoning Through Code
di: Vashishtha, Aniket, et al.
Pubblicazione: (2025)
di: Vashishtha, Aniket, et al.
Pubblicazione: (2025)
Learn to Think: Bootstrapping LLM Reasoning Capability Through Graph Representation Learning
di: Gao, Hang, et al.
Pubblicazione: (2025)
di: Gao, Hang, et al.
Pubblicazione: (2025)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
di: He, Yinhan, et al.
Pubblicazione: (2026)
di: He, Yinhan, et al.
Pubblicazione: (2026)
CARE-ECG: Causal Agent-based Reasoning for Explainable and Counterfactual ECG Interpretation
di: Khatibi, Elahe, et al.
Pubblicazione: (2026)
di: Khatibi, Elahe, et al.
Pubblicazione: (2026)
Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models
di: Guo, Hanze, et al.
Pubblicazione: (2025)
di: Guo, Hanze, et al.
Pubblicazione: (2025)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
di: Li, Xuan, et al.
Pubblicazione: (2026)
di: Li, Xuan, et al.
Pubblicazione: (2026)
GuardReasoner: Towards Reasoning-based LLM Safeguards
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models
di: Guo, Huijie, et al.
Pubblicazione: (2026) -
Rethinking Multi-Modal Learning from Gradient Uncertainty
di: Guo, Peizheng, et al.
Pubblicazione: (2025) -
Exploring Transferability of Self-Supervised Learning by Task Conflict Calibration
di: Guo, Huijie, et al.
Pubblicazione: (2025) -
COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs
di: Guo, Peizheng, et al.
Pubblicazione: (2025) -
Group Causal Policy Optimization for Post-Training Large Language Models
di: Gu, Ziyin, et al.
Pubblicazione: (2025)