DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zhenting, Cui, Guofeng, Li, Yu-Jhe, Wan, Kun, Zhao, Wentian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
di: Deng, Shijian, et al.
Pubblicazione: (2024)
di: Deng, Shijian, et al.
Pubblicazione: (2024)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
ToolSample: Dual Dynamic Sampling Methods with Curriculum Learning for RL-based Tool Learning
di: Feng, Zihao, et al.
Pubblicazione: (2025)
di: Feng, Zihao, et al.
Pubblicazione: (2025)
Prompt Curriculum Learning for Efficient LLM Post-Training
di: Gao, Zhaolin, et al.
Pubblicazione: (2025)
di: Gao, Zhaolin, et al.
Pubblicazione: (2025)
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
di: Jiang, Guochao, et al.
Pubblicazione: (2025)
di: Jiang, Guochao, et al.
Pubblicazione: (2025)
Prioritized Replay for RL Post-training
di: Fatemi, Mehdi
Pubblicazione: (2026)
di: Fatemi, Mehdi
Pubblicazione: (2026)
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
Transferable Post-training via Inverse Value Learning
di: Lu, Xinyu, et al.
Pubblicazione: (2024)
di: Lu, Xinyu, et al.
Pubblicazione: (2024)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
di: Wu, Peilin, et al.
Pubblicazione: (2026)
di: Wu, Peilin, et al.
Pubblicazione: (2026)
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
di: Zeng, Yifan, et al.
Pubblicazione: (2026)
di: Zeng, Yifan, et al.
Pubblicazione: (2026)
FlowRL: Matching Reward Distributions for LLM Reasoning
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models
di: Ahmadi, Saba, et al.
Pubblicazione: (2026)
di: Ahmadi, Saba, et al.
Pubblicazione: (2026)
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
di: Jiang, Haoxiang, et al.
Pubblicazione: (2026)
di: Jiang, Haoxiang, et al.
Pubblicazione: (2026)
Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
di: Ding, Bowen, et al.
Pubblicazione: (2025)
di: Ding, Bowen, et al.
Pubblicazione: (2025)
Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment
di: Zhang, Yizhuo, et al.
Pubblicazione: (2025)
di: Zhang, Yizhuo, et al.
Pubblicazione: (2025)
Token-Budget-Aware LLM Reasoning
di: Han, Tingxu, et al.
Pubblicazione: (2024)
di: Han, Tingxu, et al.
Pubblicazione: (2024)
AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting
di: Li, Renda, et al.
Pubblicazione: (2025)
di: Li, Renda, et al.
Pubblicazione: (2025)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
GEAR: A General Evaluation Framework for Abductive Reasoning
di: He, Kaiyu, et al.
Pubblicazione: (2025)
di: He, Kaiyu, et al.
Pubblicazione: (2025)
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
di: Wu, Peilin, et al.
Pubblicazione: (2025)
di: Wu, Peilin, et al.
Pubblicazione: (2025)
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
di: Lin, Zihan, et al.
Pubblicazione: (2026)
di: Lin, Zihan, et al.
Pubblicazione: (2026)
Embracing Imperfection: Simulating Students with Diverse Cognitive Levels Using LLM-based Agents
di: Wu, Tao, et al.
Pubblicazione: (2025)
di: Wu, Tao, et al.
Pubblicazione: (2025)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
di: Jing, Yi, et al.
Pubblicazione: (2026)
di: Jing, Yi, et al.
Pubblicazione: (2026)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
di: Xu, Ran, et al.
Pubblicazione: (2026)
di: Xu, Ran, et al.
Pubblicazione: (2026)
Post-training an LLM for RAG? Train on Self-Generated Demonstrations
di: Finlayson, Matthew, et al.
Pubblicazione: (2025)
di: Finlayson, Matthew, et al.
Pubblicazione: (2025)
FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning
di: Qiu, Zhaopeng, et al.
Pubblicazione: (2026)
di: Qiu, Zhaopeng, et al.
Pubblicazione: (2026)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
di: Parashar, Shubham, et al.
Pubblicazione: (2025)
di: Parashar, Shubham, et al.
Pubblicazione: (2025)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
di: Zhu, Dingwei, et al.
Pubblicazione: (2026)
di: Zhu, Dingwei, et al.
Pubblicazione: (2026)
Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control
di: Li, Bolian, et al.
Pubblicazione: (2026)
di: Li, Bolian, et al.
Pubblicazione: (2026)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
di: Yu, Hongli, et al.
Pubblicazione: (2025)
di: Yu, Hongli, et al.
Pubblicazione: (2025)
Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text
di: Huang, Chengyu, et al.
Pubblicazione: (2026)
di: Huang, Chengyu, et al.
Pubblicazione: (2026)
Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
di: Wen, Liang, et al.
Pubblicazione: (2025)
di: Wen, Liang, et al.
Pubblicazione: (2025)
Influence-driven Curriculum Learning for Pre-training on Limited Data
di: Schoenegger, Loris, et al.
Pubblicazione: (2025)
di: Schoenegger, Loris, et al.
Pubblicazione: (2025)
How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining
di: Luo, Kairong, et al.
Pubblicazione: (2025)
di: Luo, Kairong, et al.
Pubblicazione: (2025)
Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training
di: Shi, Hengyu, et al.
Pubblicazione: (2026)
di: Shi, Hengyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
di: Xu, Wujiang, et al.
Pubblicazione: (2025) -
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
di: Deng, Shijian, et al.
Pubblicazione: (2024) -
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
di: Wang, Zhenting, et al.
Pubblicazione: (2026) -
ToolSample: Dual Dynamic Sampling Methods with Curriculum Learning for RL-based Tool Learning
di: Feng, Zihao, et al.
Pubblicazione: (2025) -
Prompt Curriculum Learning for Efficient LLM Post-Training
di: Gao, Zhaolin, et al.
Pubblicazione: (2025)