Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Weiyu, Zeng, Yongcheng, Song, Yan, Cui, Xinyu, Zhao, Jian, Liu, Xuhui, Elhoseiny, Mohamed |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
par: Liu, Jinyi, et autres
Publié: (2023)
par: Liu, Jinyi, et autres
Publié: (2023)
Prioritized Replay for RL Post-training
par: Fatemi, Mehdi
Publié: (2026)
par: Fatemi, Mehdi
Publié: (2026)
Uncertainty Prioritized Experience Replay
par: Carrasco-Davis, Rodrigo, et autres
Publié: (2025)
par: Carrasco-Davis, Rodrigo, et autres
Publié: (2025)
Enhancing LLM Agents for Code Generation with Possibility and Pass-rate Prioritized Experience Replay
par: Chen, Yuyang, et autres
Publié: (2024)
par: Chen, Yuyang, et autres
Publié: (2024)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
Sample-efficient LLM Optimization with Reset Replay
par: Liu, Zichuan, et autres
Publié: (2025)
par: Liu, Zichuan, et autres
Publié: (2025)
Evolving LLMs' Self-Refinement Capability via Synergistic Training-Inference Optimization
par: Zeng, Yongcheng, et autres
Publié: (2025)
par: Zeng, Yongcheng, et autres
Publié: (2025)
Reliability-Adjusted Prioritized Experience Replay
par: Pleiss, Leonard S., et autres
Publié: (2025)
par: Pleiss, Leonard S., et autres
Publié: (2025)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
par: Butt, Natasha, et autres
Publié: (2024)
par: Butt, Natasha, et autres
Publié: (2024)
The Evolving Landscape of LLM- and VLM-Integrated Reinforcement Learning
par: Schoepp, Sheila, et autres
Publié: (2025)
par: Schoepp, Sheila, et autres
Publié: (2025)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
VLM-Guided Experience Replay
par: Sharony, Elad, et autres
Publié: (2026)
par: Sharony, Elad, et autres
Publié: (2026)
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
par: Ahmed, Mahmoud, et autres
Publié: (2024)
par: Ahmed, Mahmoud, et autres
Publié: (2024)
MSSR: Memory-Aware Adaptive Replay for Continual LLM Fine-Tuning
par: Lu, Yiyang, et autres
Publié: (2026)
par: Lu, Yiyang, et autres
Publié: (2026)
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
par: Wang, Weiqi, et autres
Publié: (2026)
par: Wang, Weiqi, et autres
Publié: (2026)
D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation
par: Zhang, Yu, et autres
Publié: (2026)
par: Zhang, Yu, et autres
Publié: (2026)
Prioritized Generative Replay
par: Wang, Renhao, et autres
Publié: (2024)
par: Wang, Renhao, et autres
Publié: (2024)
Ask more, know better: Reinforce-Learned Prompt Questions for Decision Making with Large Language Models
par: Yan, Xue, et autres
Publié: (2023)
par: Yan, Xue, et autres
Publié: (2023)
Efficient Diversity-based Experience Replay for Deep Reinforcement Learning
par: Zhao, Kaiyan, et autres
Publié: (2024)
par: Zhao, Kaiyan, et autres
Publié: (2024)
Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problems
par: Li, Zongqian, et autres
Publié: (2026)
par: Li, Zongqian, et autres
Publié: (2026)
7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement
par: Zhao, Pu, et autres
Publié: (2024)
par: Zhao, Pu, et autres
Publié: (2024)
SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
par: Hazard, Hugo, et autres
Publié: (2025)
par: Hazard, Hugo, et autres
Publié: (2025)
Contextual Experience Replay for Self-Improvement of Language Agents
par: Liu, Yitao, et autres
Publié: (2025)
par: Liu, Yitao, et autres
Publié: (2025)
DQN Performance with Epsilon Greedy Policies and Prioritized Experience Replay
par: Perkins, Daniel, et autres
Publié: (2025)
par: Perkins, Daniel, et autres
Publié: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
par: Jiang, Zhizheng, et autres
Publié: (2026)
par: Jiang, Zhizheng, et autres
Publié: (2026)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
par: Bai, Fengshuo, et autres
Publié: (2024)
par: Bai, Fengshuo, et autres
Publié: (2024)
Token-level Direct Preference Optimization
par: Zeng, Yongcheng, et autres
Publié: (2024)
par: Zeng, Yongcheng, et autres
Publié: (2024)
LLM-Upgraded Graph Reinforcement Learning for Carbon-Aware Job Scheduling in Smart Manufacturing
par: Yang, Zhiying, et autres
Publié: (2025)
par: Yang, Zhiying, et autres
Publié: (2025)
GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
par: Zhang, Yunan, et autres
Publié: (2025)
par: Zhang, Yunan, et autres
Publié: (2025)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
par: Zhang, Wenxuan, et autres
Publié: (2024)
par: Zhang, Wenxuan, et autres
Publié: (2024)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
par: Yu, Qiying, et autres
Publié: (2025)
par: Yu, Qiying, et autres
Publié: (2025)
FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning
par: Feng, Yujie, et autres
Publié: (2026)
par: Feng, Yujie, et autres
Publié: (2026)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
par: Liu, Zexi, et autres
Publié: (2025)
par: Liu, Zexi, et autres
Publié: (2025)
Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
par: Sun, Yifan, et autres
Publié: (2025)
par: Sun, Yifan, et autres
Publié: (2025)
Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM
par: Solgi, Ryan, et autres
Publié: (2025)
par: Solgi, Ryan, et autres
Publié: (2025)
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
par: Shi, Zhenning, et autres
Publié: (2026)
par: Shi, Zhenning, et autres
Publié: (2026)
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
par: Huang, Weiyu, et autres
Publié: (2025)
par: Huang, Weiyu, et autres
Publié: (2025)
The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
par: Zhu, Xinyu, et autres
Publié: (2025)
par: Zhu, Xinyu, et autres
Publié: (2025)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
Documents similaires
-
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
par: Liu, Jinyi, et autres
Publié: (2023) -
Prioritized Replay for RL Post-training
par: Fatemi, Mehdi
Publié: (2026) -
Uncertainty Prioritized Experience Replay
par: Carrasco-Davis, Rodrigo, et autres
Publié: (2025) -
Enhancing LLM Agents for Code Generation with Possibility and Pass-rate Prioritized Experience Replay
par: Chen, Yuyang, et autres
Publié: (2024) -
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
par: Zhang, Hongzhi, et autres
Publié: (2025)