How Does RL Post-training Induce Skill Composition? A Case Study on Countdown
Fuente:
arXiv
Salvato in:
| Autori principali: | Park, Simon, Kaur, Simran, Arora, Sanjeev |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Instruct-SkillMix: A Powerful Pipeline for LLM Instruction Tuning
di: Kaur, Simran, et al.
Pubblicazione: (2024)
di: Kaur, Simran, et al.
Pubblicazione: (2024)
Can Models Learn Skill Composition from Examples?
di: Zhao, Haoyu, et al.
Pubblicazione: (2024)
di: Zhao, Haoyu, et al.
Pubblicazione: (2024)
Skill-Targeted Adaptive Training
di: He, Yinghui, et al.
Pubblicazione: (2025)
di: He, Yinghui, et al.
Pubblicazione: (2025)
Prioritized Replay for RL Post-training
di: Fatemi, Mehdi
Pubblicazione: (2026)
di: Fatemi, Mehdi
Pubblicazione: (2026)
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
Contextual Drag: How Errors in the Context Affect LLM Reasoning
di: Cheng, Yun, et al.
Pubblicazione: (2026)
di: Cheng, Yun, et al.
Pubblicazione: (2026)
On the Power of Context-Enhanced Learning in LLMs
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
Optimistic Verifiable Training by Controlling Hardware Nondeterminism
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
di: Chu, Tianzhe, et al.
Pubblicazione: (2025)
di: Chu, Tianzhe, et al.
Pubblicazione: (2025)
When and How Does CLIP Enable Domain and Compositional Generalization?
di: Kempf, Elias, et al.
Pubblicazione: (2025)
di: Kempf, Elias, et al.
Pubblicazione: (2025)
Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining
di: Zhao, Rosie, et al.
Pubblicazione: (2025)
di: Zhao, Rosie, et al.
Pubblicazione: (2025)
VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
CRePE: Convolution-aware Relative Importance in Post-training Pruning with Efficient Search
di: Park, Cheonjun
Pubblicazione: (2026)
di: Park, Cheonjun
Pubblicazione: (2026)
DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
The unregulated plant‐based ‘milk’ industry: A threat to nutrition, health and safety?
di: Simran Kaur Arora
Pubblicazione: (2024)
di: Simran Kaur Arora
Pubblicazione: (2024)
On the Impossibility of Retrain Equivalence in Machine Unlearning
di: Yu, Jiatong, et al.
Pubblicazione: (2025)
di: Yu, Jiatong, et al.
Pubblicazione: (2025)
On the SDEs and Scaling Rules for Adaptive Gradient Algorithms
di: Malladi, Sadhika, et al.
Pubblicazione: (2022)
di: Malladi, Sadhika, et al.
Pubblicazione: (2022)
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
di: Xia, Peng, et al.
Pubblicazione: (2026)
di: Xia, Peng, et al.
Pubblicazione: (2026)
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?
di: Park, Simon, et al.
Pubblicazione: (2025)
di: Park, Simon, et al.
Pubblicazione: (2025)
JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training
di: Hu, Zhengding, et al.
Pubblicazione: (2026)
di: Hu, Zhengding, et al.
Pubblicazione: (2026)
Skill Reuse as Compression in Agentic RL
di: Xu, Zhikun, et al.
Pubblicazione: (2026)
di: Xu, Zhikun, et al.
Pubblicazione: (2026)
SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Grounding
di: Zabounidis, Renos, et al.
Pubblicazione: (2026)
di: Zabounidis, Renos, et al.
Pubblicazione: (2026)
A Quadratic Synchronization Rule for Distributed Deep Learning
di: Gu, Xinran, et al.
Pubblicazione: (2023)
di: Gu, Xinran, et al.
Pubblicazione: (2023)
SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
di: Wang, Chen, et al.
Pubblicazione: (2025)
di: Wang, Chen, et al.
Pubblicazione: (2025)
ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL
di: He, Zelin, et al.
Pubblicazione: (2026)
di: He, Zelin, et al.
Pubblicazione: (2026)
ASAP: Unsupervised Post-training with Label Distribution Shift Adaptive Learning Rate
di: Park, Heewon, et al.
Pubblicazione: (2025)
di: Park, Heewon, et al.
Pubblicazione: (2025)
LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs
di: Jha, Piyush, et al.
Pubblicazione: (2024)
di: Jha, Piyush, et al.
Pubblicazione: (2024)
SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning
di: Zhang, Ruiqi, et al.
Pubblicazione: (2025)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2025)
How Does Critical Batch Size Scale in Pre-training?
di: Zhang, Hanlin, et al.
Pubblicazione: (2024)
di: Zhang, Hanlin, et al.
Pubblicazione: (2024)
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions
di: Wu, Haoze, et al.
Pubblicazione: (2025)
di: Wu, Haoze, et al.
Pubblicazione: (2025)
Metacognitive Reuse: Turning Recurring LLM Reasoning Into Concise Behaviors
di: Didolkar, Aniket, et al.
Pubblicazione: (2025)
di: Didolkar, Aniket, et al.
Pubblicazione: (2025)
Trainable Transformer in Transformer
di: Panigrahi, Abhishek, et al.
Pubblicazione: (2023)
di: Panigrahi, Abhishek, et al.
Pubblicazione: (2023)
Provable unlearning in topic modeling and downstream tasks
di: Wei, Stanley, et al.
Pubblicazione: (2024)
di: Wei, Stanley, et al.
Pubblicazione: (2024)
Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training
di: Lu, Aojun, et al.
Pubblicazione: (2026)
di: Lu, Aojun, et al.
Pubblicazione: (2026)
Unrealized Expectations: Comparing AI Methods vs Classical Algorithms for Maximum Independent Set
di: Wu, Yikai, et al.
Pubblicazione: (2025)
di: Wu, Yikai, et al.
Pubblicazione: (2025)
Learning Dynamics in RL Post-Training for Language Models
di: Tomihari, Akiyoshi
Pubblicazione: (2026)
di: Tomihari, Akiyoshi
Pubblicazione: (2026)
RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs
di: Samineni, Soumya Rani, et al.
Pubblicazione: (2025)
di: Samineni, Soumya Rani, et al.
Pubblicazione: (2025)
Decomposing Elements of Problem Solving: What "Math" Does RL Teach?
di: Qin, Tian, et al.
Pubblicazione: (2025)
di: Qin, Tian, et al.
Pubblicazione: (2025)
When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient
di: Shang, Shuning, et al.
Pubblicazione: (2026)
di: Shang, Shuning, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Instruct-SkillMix: A Powerful Pipeline for LLM Instruction Tuning
di: Kaur, Simran, et al.
Pubblicazione: (2024) -
Can Models Learn Skill Composition from Examples?
di: Zhao, Haoyu, et al.
Pubblicazione: (2024) -
Skill-Targeted Adaptive Training
di: He, Yinghui, et al.
Pubblicazione: (2025) -
Prioritized Replay for RL Post-training
di: Fatemi, Mehdi
Pubblicazione: (2026) -
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)