Prioritized Replay for RL Post-training
Fuente:
arXiv
Salvato in:
| Autore principale: | Fatemi, Mehdi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
Automatic Pair Construction for Contrastive Post-training
di: Xu, Canwen, et al.
Pubblicazione: (2023)
di: Xu, Canwen, et al.
Pubblicazione: (2023)
Post-training for Efficient Communication via Convention Formation
di: Hua, Yilun, et al.
Pubblicazione: (2025)
di: Hua, Yilun, et al.
Pubblicazione: (2025)
Efficient Post-training Quantization with FP8 Formats
di: Shen, Haihao, et al.
Pubblicazione: (2023)
di: Shen, Haihao, et al.
Pubblicazione: (2023)
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
Post-training an LLM for RAG? Train on Self-Generated Demonstrations
di: Finlayson, Matthew, et al.
Pubblicazione: (2025)
di: Finlayson, Matthew, et al.
Pubblicazione: (2025)
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
di: Yang, Zhuolin, et al.
Pubblicazione: (2026)
di: Yang, Zhuolin, et al.
Pubblicazione: (2026)
Post-training makes large language models less human-like
di: Binz, Marcel, et al.
Pubblicazione: (2026)
di: Binz, Marcel, et al.
Pubblicazione: (2026)
Tracing the Representation Geometry of Language Models from Pretraining to Post-training
di: Li, Melody Zixuan, et al.
Pubblicazione: (2025)
di: Li, Melody Zixuan, et al.
Pubblicazione: (2025)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
di: Kang, Feiyang, et al.
Pubblicazione: (2025)
di: Kang, Feiyang, et al.
Pubblicazione: (2025)
FutureSim: Replaying World Events to Evaluate Adaptive Agents
di: Goel, Shashwat, et al.
Pubblicazione: (2026)
di: Goel, Shashwat, et al.
Pubblicazione: (2026)
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
di: Shi, Zhenning, et al.
Pubblicazione: (2026)
di: Shi, Zhenning, et al.
Pubblicazione: (2026)
Self-generated Replay Memories for Continual Neural Machine Translation
di: Resta, Michele, et al.
Pubblicazione: (2024)
di: Resta, Michele, et al.
Pubblicazione: (2024)
Investigating the Interplay of Prioritized Replay and Generalization
di: Panahi, Parham Mohammad, et al.
Pubblicazione: (2024)
di: Panahi, Parham Mohammad, et al.
Pubblicazione: (2024)
StateX: Enhancing RNN Recall via Post-training State Expansion
di: Shen, Xingyu, et al.
Pubblicazione: (2025)
di: Shen, Xingyu, et al.
Pubblicazione: (2025)
PoTPTQ: A Two-step Power-of-Two Post-training for LLMs
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
MSSR: Memory-Aware Adaptive Replay for Continual LLM Fine-Tuning
di: Lu, Yiyang, et al.
Pubblicazione: (2026)
di: Lu, Yiyang, et al.
Pubblicazione: (2026)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
di: Hazard, Hugo, et al.
Pubblicazione: (2025)
di: Hazard, Hugo, et al.
Pubblicazione: (2025)
Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs
di: Song, Xiangchen, et al.
Pubblicazione: (2025)
di: Song, Xiangchen, et al.
Pubblicazione: (2025)
Mechanism Shift During Post-training from Autoregressive to Masked Diffusion Language Models
di: Kong, Injin, et al.
Pubblicazione: (2026)
di: Kong, Injin, et al.
Pubblicazione: (2026)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
di: Jing, Yi, et al.
Pubblicazione: (2026)
di: Jing, Yi, et al.
Pubblicazione: (2026)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
di: Tao, Yongding, et al.
Pubblicazione: (2025)
di: Tao, Yongding, et al.
Pubblicazione: (2025)
FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning
di: Feng, Yujie, et al.
Pubblicazione: (2026)
di: Feng, Yujie, et al.
Pubblicazione: (2026)
Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models
di: Abbes, Istabrak, et al.
Pubblicazione: (2025)
di: Abbes, Istabrak, et al.
Pubblicazione: (2025)
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
di: Li, Jinze, et al.
Pubblicazione: (2025)
di: Li, Jinze, et al.
Pubblicazione: (2025)
GLIDE-RL: Grounded Language Instruction through DEmonstration in RL
di: Kharyal, Chaitanya, et al.
Pubblicazione: (2024)
di: Kharyal, Chaitanya, et al.
Pubblicazione: (2024)
Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena
di: Luo, Haipeng, et al.
Pubblicazione: (2024)
di: Luo, Haipeng, et al.
Pubblicazione: (2024)
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
di: Liu, Jinyi, et al.
Pubblicazione: (2023)
di: Liu, Jinyi, et al.
Pubblicazione: (2023)
OpenDebateEvidence: A Massive-Scale Argument Mining and Summarization Dataset
di: Roush, Allen, et al.
Pubblicazione: (2024)
di: Roush, Allen, et al.
Pubblicazione: (2024)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
di: Guan, Xinyan, et al.
Pubblicazione: (2024)
di: Guan, Xinyan, et al.
Pubblicazione: (2024)
GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
di: Zhang, Yunan, et al.
Pubblicazione: (2025)
di: Zhang, Yunan, et al.
Pubblicazione: (2025)
LIMR: Less is More for RL Scaling
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
di: Sun, Yifan, et al.
Pubblicazione: (2025)
di: Sun, Yifan, et al.
Pubblicazione: (2025)
Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation
di: Tang, Pingzhi, et al.
Pubblicazione: (2026)
di: Tang, Pingzhi, et al.
Pubblicazione: (2026)
On the Optimal Reasoning Length for RL-Trained Language Models
di: Nohara, Daisuke, et al.
Pubblicazione: (2026)
di: Nohara, Daisuke, et al.
Pubblicazione: (2026)
FlowRL: Matching Reward Distributions for LLM Reasoning
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
di: Butt, Natasha, et al.
Pubblicazione: (2024) -
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025) -
Automatic Pair Construction for Contrastive Post-training
di: Xu, Canwen, et al.
Pubblicazione: (2023) -
Post-training for Efficient Communication via Convention Formation
di: Hua, Yilun, et al.
Pubblicazione: (2025) -
Efficient Post-training Quantization with FP8 Formats
di: Shen, Haihao, et al.
Pubblicazione: (2023)