Reinforcement Learning for Compositional Generalization with Outcome-Level Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Fu, Xiyan, Liu, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring Continual Learning of Compositional Generalization in NLI
di: Fu, Xiyan, et al.
Pubblicazione: (2024)
di: Fu, Xiyan, et al.
Pubblicazione: (2024)
The Mystery of Compositional Generalization in Graph-based Generative Commonsense Reasoning
di: Fu, Xiyan, et al.
Pubblicazione: (2024)
di: Fu, Xiyan, et al.
Pubblicazione: (2024)
IPCGRL: Language-Instructed Reinforcement Learning for Procedural Level Generation
di: Baek, In-Chang, et al.
Pubblicazione: (2025)
di: Baek, In-Chang, et al.
Pubblicazione: (2025)
Compositional Instruction Following with Language Models and Reinforcement Learning
di: Cohen, Vanya, et al.
Pubblicazione: (2025)
di: Cohen, Vanya, et al.
Pubblicazione: (2025)
Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
di: Liu, Chi, et al.
Pubblicazione: (2025)
di: Liu, Chi, et al.
Pubblicazione: (2025)
General Preference Reinforcement Learning
di: Umer, Muhammad, et al.
Pubblicazione: (2026)
di: Umer, Muhammad, et al.
Pubblicazione: (2026)
MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning
di: Wang, Hongjun, et al.
Pubblicazione: (2026)
di: Wang, Hongjun, et al.
Pubblicazione: (2026)
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
di: Jiang, Guochao, et al.
Pubblicazione: (2026)
di: Jiang, Guochao, et al.
Pubblicazione: (2026)
Complementary Reinforcement Learning
di: Muhtar, Dilxat, et al.
Pubblicazione: (2026)
di: Muhtar, Dilxat, et al.
Pubblicazione: (2026)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026)
di: Bai, Yang, et al.
Pubblicazione: (2026)
Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
TACO-RL: Task Aware Prompt Compression Optimization with Reinforcement Learning
di: Shandilya, Shivam, et al.
Pubblicazione: (2024)
di: Shandilya, Shivam, et al.
Pubblicazione: (2024)
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning
di: Li, Ran, et al.
Pubblicazione: (2026)
di: Li, Ran, et al.
Pubblicazione: (2026)
Towards Understanding the Relationship between In-context Learning and Compositional Generalization
di: Han, Sungjun, et al.
Pubblicazione: (2024)
di: Han, Sungjun, et al.
Pubblicazione: (2024)
Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective
di: He, Shenghua, et al.
Pubblicazione: (2025)
di: He, Shenghua, et al.
Pubblicazione: (2025)
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning
di: Lyu, Chengqi, et al.
Pubblicazione: (2025)
di: Lyu, Chengqi, et al.
Pubblicazione: (2025)
Learning from Failures in Multi-Attempt Reinforcement Learning
di: Chung, Stephen, et al.
Pubblicazione: (2025)
di: Chung, Stephen, et al.
Pubblicazione: (2025)
Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
di: Li, Junliang, et al.
Pubblicazione: (2025)
di: Li, Junliang, et al.
Pubblicazione: (2025)
MaxCode: A Max-Reward Reinforcement Learning Framework for Automated Code Optimization
di: Ou, Jiefu, et al.
Pubblicazione: (2026)
di: Ou, Jiefu, et al.
Pubblicazione: (2026)
ToolExpander: Extending the Frontiers of Tool-Using Reinforcement Learning to Weak LLMs
di: Chen, Fu, et al.
Pubblicazione: (2025)
di: Chen, Fu, et al.
Pubblicazione: (2025)
Reinforcing General Reasoning without Verifiers
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
di: Hu, Senkang, et al.
Pubblicazione: (2026)
di: Hu, Senkang, et al.
Pubblicazione: (2026)
Reinforced Attention Learning
di: Li, Bangzheng, et al.
Pubblicazione: (2026)
di: Li, Bangzheng, et al.
Pubblicazione: (2026)
Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback
di: Wang, Yikai, et al.
Pubblicazione: (2026)
di: Wang, Yikai, et al.
Pubblicazione: (2026)
Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax
di: Su, Zeli, et al.
Pubblicazione: (2026)
di: Su, Zeli, et al.
Pubblicazione: (2026)
CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
On Provable Length and Compositional Generalization
di: Ahuja, Kartik, et al.
Pubblicazione: (2024)
di: Ahuja, Kartik, et al.
Pubblicazione: (2024)
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
LLM-Upgraded Graph Reinforcement Learning for Carbon-Aware Job Scheduling in Smart Manufacturing
di: Yang, Zhiying, et al.
Pubblicazione: (2025)
di: Yang, Zhiying, et al.
Pubblicazione: (2025)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
di: Yu, Qiying, et al.
Pubblicazione: (2025)
di: Yu, Qiying, et al.
Pubblicazione: (2025)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
di: Min, Do June, et al.
Pubblicazione: (2024)
di: Min, Do June, et al.
Pubblicazione: (2024)
Compositional Automata Embeddings for Goal-Conditioned Reinforcement Learning
di: Yalcinkaya, Beyazit, et al.
Pubblicazione: (2024)
di: Yalcinkaya, Beyazit, et al.
Pubblicazione: (2024)
How Reliable is Multilingual LLM-as-a-Judge?
di: Fu, Xiyan, et al.
Pubblicazione: (2025)
di: Fu, Xiyan, et al.
Pubblicazione: (2025)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
di: Feng, Weitao, et al.
Pubblicazione: (2025)
di: Feng, Weitao, et al.
Pubblicazione: (2025)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
di: Xia, Yinan, et al.
Pubblicazione: (2026)
di: Xia, Yinan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Exploring Continual Learning of Compositional Generalization in NLI
di: Fu, Xiyan, et al.
Pubblicazione: (2024) -
The Mystery of Compositional Generalization in Graph-based Generative Commonsense Reasoning
di: Fu, Xiyan, et al.
Pubblicazione: (2024) -
IPCGRL: Language-Instructed Reinforcement Learning for Procedural Level Generation
di: Baek, In-Chang, et al.
Pubblicazione: (2025) -
Compositional Instruction Following with Language Models and Reinforcement Learning
di: Cohen, Vanya, et al.
Pubblicazione: (2025) -
Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
di: Liu, Chi, et al.
Pubblicazione: (2025)