EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chen, Wei, Lai, Zhang, Yanzhi, Shao, Chenyang, Dan, Zedong, Huang, Weiran, Zhang, Yuzhi, Wang, Yue |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Targeted Exploration via Unified Entropy Control for Reinforcement Learning
par: Wang, Chen, et autres
Publié: (2026)
par: Wang, Chen, et autres
Publié: (2026)
Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start
par: Wei, Lai, et autres
Publié: (2025)
par: Wei, Lai, et autres
Publié: (2025)
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
par: Liu, Jinmei, et autres
Publié: (2024)
par: Liu, Jinmei, et autres
Publié: (2024)
A Neural Model for Contextual Biasing Score Learning and Filtering
par: Huang, Wanting, et autres
Publié: (2025)
par: Huang, Wanting, et autres
Publié: (2025)
Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning
par: Xie, Can, et autres
Publié: (2025)
par: Xie, Can, et autres
Publié: (2025)
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
par: Wei, Lai, et autres
Publié: (2025)
par: Wei, Lai, et autres
Publié: (2025)
SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration
par: Zhang, Xichen, et autres
Publié: (2025)
par: Zhang, Xichen, et autres
Publié: (2025)
Reasoning through Exploration: A Reinforcement Learning Framework for Robust Function Calling
par: Hao, Bingguang, et autres
Publié: (2025)
par: Hao, Bingguang, et autres
Publié: (2025)
Stateful Reasoning via Insight Replay
par: Lei, Bin, et autres
Publié: (2026)
par: Lei, Bin, et autres
Publié: (2026)
Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs
par: Zhang, Wenjian, et autres
Publié: (2026)
par: Zhang, Wenjian, et autres
Publié: (2026)
DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay
par: Li, Long, et autres
Publié: (2026)
par: Li, Long, et autres
Publié: (2026)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
par: Deng, Wenhao, et autres
Publié: (2025)
par: Deng, Wenhao, et autres
Publié: (2025)
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
par: Shi, Zhenning, et autres
Publié: (2026)
par: Shi, Zhenning, et autres
Publié: (2026)
IDER: IDempotent Experience Replay for Reliable Continual Learning
par: Liu, Zhanwang, et autres
Publié: (2026)
par: Liu, Zhanwang, et autres
Publié: (2026)
Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction
par: Xu, Chengzhi, et autres
Publié: (2025)
par: Xu, Chengzhi, et autres
Publié: (2025)
Efficient Diversity-based Experience Replay for Deep Reinforcement Learning
par: Zhao, Kaiyan, et autres
Publié: (2024)
par: Zhao, Kaiyan, et autres
Publié: (2024)
Reinforced Efficient Reasoning via Semantically Diverse Exploration
par: Zhao, Ziqi, et autres
Publié: (2026)
par: Zhao, Ziqi, et autres
Publié: (2026)
Automated Design and Optimization of Distributed Filtering Circuits via Reinforcement Learning
par: Gao, Peng, et autres
Publié: (2024)
par: Gao, Peng, et autres
Publié: (2024)
No Free Lunch: Rethinking Internal Feedback for LLM Reasoning
par: Zhang, Yanzhi, et autres
Publié: (2025)
par: Zhang, Yanzhi, et autres
Publié: (2025)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
par: Shao, Chenyang, et autres
Publié: (2025)
par: Shao, Chenyang, et autres
Publié: (2025)
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
par: Liu, Jinyi, et autres
Publié: (2023)
par: Liu, Jinyi, et autres
Publié: (2023)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
Deeper Insights into Learning Performance of Stochastic Configuration Networks
par: Yan, Xiufeng, et autres
Publié: (2024)
par: Yan, Xiufeng, et autres
Publié: (2024)
When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making
par: Liu, Jun, et autres
Publié: (2026)
par: Liu, Jun, et autres
Publié: (2026)
GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
par: Chu, Xiangxiang, et autres
Publié: (2025)
par: Chu, Xiangxiang, et autres
Publié: (2025)
See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
par: Wu, Zhiheng, et autres
Publié: (2026)
par: Wu, Zhiheng, et autres
Publié: (2026)
CIER: A Novel Experience Replay Approach with Causal Inference in Deep Reinforcement Learning
par: Wang, Jingwen, et autres
Publié: (2024)
par: Wang, Jingwen, et autres
Publié: (2024)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
par: Liu, Yue, et autres
Publié: (2025)
par: Liu, Yue, et autres
Publié: (2025)
TIMRL: A Novel Meta-Reinforcement Learning Framework for Non-Stationary and Multi-Task Environments
par: Qi, Chenyang, et autres
Publié: (2025)
par: Qi, Chenyang, et autres
Publié: (2025)
PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning
par: Guo, Weiran, et autres
Publié: (2025)
par: Guo, Weiran, et autres
Publié: (2025)
Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization
par: Hua, Xingyuan, et autres
Publié: (2026)
par: Hua, Xingyuan, et autres
Publié: (2026)
FedReplay: A Feature Replay Assisted Federated Transfer Learning Framework for Efficient and Privacy-Preserving Smart Agriculture
par: Li, Long, et autres
Publié: (2025)
par: Li, Long, et autres
Publié: (2025)
Brain-Like Replay Naturally Emerges in Reinforcement Learning Agents
par: Wang, Jiyi, et autres
Publié: (2024)
par: Wang, Jiyi, et autres
Publié: (2024)
Guardian: Decoupling Exploration from Safety in Reinforcement Learning
par: Cai, Kaitong, et autres
Publié: (2025)
par: Cai, Kaitong, et autres
Publié: (2025)
MEGG: Replay via Maximally Extreme GGscore in Incremental Learning for Neural Recommendation Models
par: Shi, Yunxiao, et autres
Publié: (2025)
par: Shi, Yunxiao, et autres
Publié: (2025)
Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning
par: Jiao, Zhengbo, et autres
Publié: (2026)
par: Jiao, Zhengbo, et autres
Publié: (2026)
Off-policy Reinforcement Learning with Model-based Exploration Augmentation
par: Wang, Likun, et autres
Publié: (2025)
par: Wang, Likun, et autres
Publié: (2025)
Experience Replay Addresses Loss of Plasticity in Continual Learning
par: Wang, Jiuqi, et autres
Publié: (2025)
par: Wang, Jiuqi, et autres
Publié: (2025)
Documents similaires
-
Targeted Exploration via Unified Entropy Control for Reinforcement Learning
par: Wang, Chen, et autres
Publié: (2026) -
Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start
par: Wei, Lai, et autres
Publié: (2025) -
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
par: Liu, Jinmei, et autres
Publié: (2024) -
A Neural Model for Contextual Biasing Score Learning and Filtering
par: Huang, Wanting, et autres
Publié: (2025) -
Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning
par: Xie, Can, et autres
Publié: (2025)