RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jinghao, Zheng, Naishan, Li, Ruilin, Cheng, Dongzhou, Liang, Zheming, Zhao, Feng, Wang, Jiaqi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
par: Zheng, Naishan, et autres
Publié: (2025)
par: Zheng, Naishan, et autres
Publié: (2025)
Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL
par: Zhou, Yixiao, et autres
Publié: (2026)
par: Zhou, Yixiao, et autres
Publié: (2026)
True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning
par: Tan, Weihao, et autres
Publié: (2024)
par: Tan, Weihao, et autres
Publié: (2024)
Mars: Situated Inductive Reasoning in an Open-World Environment
par: Tang, Xiaojuan, et autres
Publié: (2024)
par: Tang, Xiaojuan, et autres
Publié: (2024)
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
par: Zheng, Chujie, et autres
Publié: (2025)
par: Zheng, Chujie, et autres
Publié: (2025)
Reinforcement Learning Enhanced LLMs: A Survey
par: Wang, Shuhe, et autres
Publié: (2024)
par: Wang, Shuhe, et autres
Publié: (2024)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
par: Lin, Zicheng, et autres
Publié: (2024)
par: Lin, Zicheng, et autres
Publié: (2024)
Progressive Knowledge Graph Completion
par: Li, Jiayi, et autres
Publié: (2024)
par: Li, Jiayi, et autres
Publié: (2024)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
par: Zhang, Haozhen, et autres
Publié: (2025)
par: Zhang, Haozhen, et autres
Publié: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
par: Gao, Cheng, et autres
Publié: (2026)
par: Gao, Cheng, et autres
Publié: (2026)
Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach
par: Zhang, Xinnan, et autres
Publié: (2025)
par: Zhang, Xinnan, et autres
Publié: (2025)
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
par: Li, Junsong, et autres
Publié: (2025)
par: Li, Junsong, et autres
Publié: (2025)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
par: DeepSeek-AI, et autres
Publié: (2025)
par: DeepSeek-AI, et autres
Publié: (2025)
Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization
par: Li, Hanyu, et autres
Publié: (2025)
par: Li, Hanyu, et autres
Publié: (2025)
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
par: Zheng, Yuxiang, et autres
Publié: (2025)
par: Zheng, Yuxiang, et autres
Publié: (2025)
A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms
par: Li, Yingru, et autres
Publié: (2025)
par: Li, Yingru, et autres
Publié: (2025)
Position-Aware Parameter Efficient Fine-Tuning Approach for Reducing Positional Bias in LLMs
par: Zhang, Zheng, et autres
Publié: (2024)
par: Zhang, Zheng, et autres
Publié: (2024)
Probing to Refine: Reinforcement Distillation of LLMs via Explanatory Inversion
par: Tan, Zhen, et autres
Publié: (2026)
par: Tan, Zhen, et autres
Publié: (2026)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
par: Stojanovski, Zafir, et autres
Publié: (2025)
par: Stojanovski, Zafir, et autres
Publié: (2025)
Reinforcement Learning with Rubric Anchors
par: Huang, Zenan, et autres
Publié: (2025)
par: Huang, Zenan, et autres
Publié: (2025)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
par: Deng, Wenhao, et autres
Publié: (2025)
par: Deng, Wenhao, et autres
Publié: (2025)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
par: Wang, Zhaoyang, et autres
Publié: (2026)
par: Wang, Zhaoyang, et autres
Publié: (2026)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
par: Ma, Wenhan, et autres
Publié: (2025)
par: Ma, Wenhan, et autres
Publié: (2025)
Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxonomy, and Methods
par: Cao, Yuji, et autres
Publié: (2024)
par: Cao, Yuji, et autres
Publié: (2024)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
par: Yang, Wenjie, et autres
Publié: (2025)
par: Yang, Wenjie, et autres
Publié: (2025)
BgGPT 1.0: Extending English-centric LLMs to other languages
par: Alexandrov, Anton, et autres
Publié: (2024)
par: Alexandrov, Anton, et autres
Publié: (2024)
P1: Mastering Physics Olympiads with Reinforcement Learning
par: Chen, Jiacheng, et autres
Publié: (2025)
par: Chen, Jiacheng, et autres
Publié: (2025)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
par: Xu, Hongling, et autres
Publié: (2025)
par: Xu, Hongling, et autres
Publié: (2025)
AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning
par: Zhang, Jiayi, et autres
Publié: (2025)
par: Zhang, Jiayi, et autres
Publié: (2025)
AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs
par: Zheng, Haizhong, et autres
Publié: (2026)
par: Zheng, Haizhong, et autres
Publié: (2026)
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
par: Suvarna, Ashima, et autres
Publié: (2026)
par: Suvarna, Ashima, et autres
Publié: (2026)
RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
par: Wu, Jiaxing, et autres
Publié: (2024)
par: Wu, Jiaxing, et autres
Publié: (2024)
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
par: Khadangi, Afshin, et autres
Publié: (2025)
par: Khadangi, Afshin, et autres
Publié: (2025)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
par: Song, Kefan, et autres
Publié: (2025)
par: Song, Kefan, et autres
Publié: (2025)
GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
par: Yin, Shangjian, et autres
Publié: (2026)
par: Yin, Shangjian, et autres
Publié: (2026)
Documents similaires
-
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
par: Zheng, Naishan, et autres
Publié: (2025) -
Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL
par: Zhou, Yixiao, et autres
Publié: (2026) -
True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning
par: Tan, Weihao, et autres
Publié: (2024) -
Mars: Situated Inductive Reasoning in an Open-World Environment
par: Tang, Xiaojuan, et autres
Publié: (2024) -
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
par: Zheng, Chujie, et autres
Publié: (2025)