Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Liang, Jing, Tang, Hongyao, Ma, Yi, Liu, Jinyi, Zheng, Yan, Hu, Shuyue, Bai, Lei, Hao, Jianye |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning
by: Wu, Zihao, et al.
Published: (2026)
by: Wu, Zihao, et al.
Published: (2026)
ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles
by: Zhao, Kai, et al.
Published: (2023)
by: Zhao, Kai, et al.
Published: (2023)
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
by: Liu, Jinyi, et al.
Published: (2023)
by: Liu, Jinyi, et al.
Published: (2023)
Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies
by: Ma, Yi, et al.
Published: (2025)
by: Ma, Yi, et al.
Published: (2025)
Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback
by: Yuan, Yifu, et al.
Published: (2024)
by: Yuan, Yifu, et al.
Published: (2024)
MFE-ETP: A Comprehensive Evaluation Benchmark for Multi-modal Foundation Models on Embodied Task Planning
by: Zhang, Min, et al.
Published: (2024)
by: Zhang, Min, et al.
Published: (2024)
Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models
by: Liu, Jinyi, et al.
Published: (2024)
by: Liu, Jinyi, et al.
Published: (2024)
Molecular‐Squeeze Triggers Guest Desorption from Sponge‐Like Macrocycle Crystals
by: Linnan Zhang, et al.
Published: (2024)
by: Linnan Zhang, et al.
Published: (2024)
Molecular‐Squeeze Triggers Guest Desorption from Sponge‐Like Macrocycle Crystals
by: Linnan Zhang, et al.
Published: (2024)
by: Linnan Zhang, et al.
Published: (2024)
Succeed or Learn Slowly: Sample Efficient Off-Policy Reinforcement Learning for Mobile App Control
by: Papoudakis, Georgios, et al.
Published: (2025)
by: Papoudakis, Georgios, et al.
Published: (2025)
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
by: Yuan, Yifu, et al.
Published: (2025)
by: Yuan, Yifu, et al.
Published: (2025)
Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
by: Mukherjee, Sagnik, et al.
Published: (2025)
by: Mukherjee, Sagnik, et al.
Published: (2025)
MUVLA: Learning to Explore Object Navigation via Map Understanding
by: Han, Peilong, et al.
Published: (2025)
by: Han, Peilong, et al.
Published: (2025)
Improving Deep Reinforcement Learning by Reducing the Chain Effect of Value and Policy Churn
by: Tang, Hongyao, et al.
Published: (2024)
by: Tang, Hongyao, et al.
Published: (2024)
SheetAgent: Towards A Generalist Agent for Spreadsheet Reasoning and Manipulation via Large Language Models
by: Chen, Yibin, et al.
Published: (2024)
by: Chen, Yibin, et al.
Published: (2024)
From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models
by: Liu, Jinyi, et al.
Published: (2025)
by: Liu, Jinyi, et al.
Published: (2025)
Provably Efficient Information-Directed Sampling Algorithms for Multi-Agent Reinforcement Learning
by: Zhang, Qiaosheng, et al.
Published: (2024)
by: Zhang, Qiaosheng, et al.
Published: (2024)
Large Language Models to Diffusion Finetuning
by: Cetin, Edoardo, et al.
Published: (2025)
by: Cetin, Edoardo, et al.
Published: (2025)
Can We Optimize Deep RL Policy Weights as Trajectory Modeling?
by: Tang, Hongyao
Published: (2025)
by: Tang, Hongyao
Published: (2025)
Finetuning Large Language Model for Personalized Ranking
by: Bai, Zhuoxi, et al.
Published: (2024)
by: Bai, Zhuoxi, et al.
Published: (2024)
Mitigating Large Language Model Hallucination with Faithful Finetuning
by: Hu, Minda, et al.
Published: (2024)
by: Hu, Minda, et al.
Published: (2024)
Finetuning Large Language Model as an Effective Symbolic Regressor
by: Hua, Yingfan, et al.
Published: (2025)
by: Hua, Yingfan, et al.
Published: (2025)
Exploring Representation Invariance in Finetuning
by: Zu, Wenqiang, et al.
Published: (2025)
by: Zu, Wenqiang, et al.
Published: (2025)
PCToolkit: A Unified Plug-and-Play Prompt Compression Toolkit of Large Language Models
by: Li, Jinyi, et al.
Published: (2024)
by: Li, Jinyi, et al.
Published: (2024)
SigmaRL: A Sample-Efficient and Generalizable Multi-Agent Reinforcement Learning Framework for Motion Planning
by: Xu, Jianye, et al.
Published: (2024)
by: Xu, Jianye, et al.
Published: (2024)
CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
by: Li, Shuozhe, et al.
Published: (2026)
by: Li, Shuozhe, et al.
Published: (2026)
Scaling Agentic Capabilities, Not Context: Efficient Reinforcement Finetuning for Large Toolspaces
by: Gupta, Karan, et al.
Published: (2026)
by: Gupta, Karan, et al.
Published: (2026)
ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching
by: Zhang, Shuoheng, et al.
Published: (2026)
by: Zhang, Shuoheng, et al.
Published: (2026)
Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR
by: Bai, Junwen, et al.
Published: (2024)
by: Bai, Junwen, et al.
Published: (2024)
Nature-Inspired Population-Based Evolution of Large Language Models
by: Zhang, Yiqun, et al.
Published: (2025)
by: Zhang, Yiqun, et al.
Published: (2025)
Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models
by: Nguyen, Manh, et al.
Published: (2025)
by: Nguyen, Manh, et al.
Published: (2025)
An Empirical Study on Prompt Compression for Large Language Models
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
by: Yuan, Yifu, et al.
Published: (2024)
by: Yuan, Yifu, et al.
Published: (2024)
The Path of Self-Evolving Large Language Models: Achieving Data-Efficient Learning via Intrinsic Feedback
by: Zhang, Hangfan, et al.
Published: (2025)
by: Zhang, Hangfan, et al.
Published: (2025)
Large Language Models are Near-Optimal Decision-Makers with a Non-Human Learning Behavior
by: Li, Hao, et al.
Published: (2025)
by: Li, Hao, et al.
Published: (2025)
Vanishing Gradients in Reinforcement Finetuning of Language Models
by: Razin, Noam, et al.
Published: (2023)
by: Razin, Noam, et al.
Published: (2023)
MuonAll: Muon Variant for Efficient Finetuning of Large Language Models
by: Page, Saurabh, et al.
Published: (2025)
by: Page, Saurabh, et al.
Published: (2025)
MAPLE: Multilingual Evaluation of Parameter Efficient Finetuning of Large Language Models
by: Aggarwal, Divyanshu, et al.
Published: (2024)
by: Aggarwal, Divyanshu, et al.
Published: (2024)
Off-policy Evaluation with Deeply-abstracted States
by: Hao, Meiling, et al.
Published: (2024)
by: Hao, Meiling, et al.
Published: (2024)
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
by: Shi, Taiwei, et al.
Published: (2025)
by: Shi, Taiwei, et al.
Published: (2025)
Similar Items
-
The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning
by: Wu, Zihao, et al.
Published: (2026) -
ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles
by: Zhao, Kai, et al.
Published: (2023) -
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
by: Liu, Jinyi, et al.
Published: (2023) -
Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies
by: Ma, Yi, et al.
Published: (2025) -
Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback
by: Yuan, Yifu, et al.
Published: (2024)