Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Qin-Wen, Xie, Ming-Kun, Wang, Ye-Wen, Huang, Sheng-Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL
por: Luo, Qin-Wen, et al.
Publicado: (2025)
por: Luo, Qin-Wen, et al.
Publicado: (2025)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
por: Mark, Max Sobol, et al.
Publicado: (2024)
por: Mark, Max Sobol, et al.
Publicado: (2024)
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only
por: Xiao, Wei, et al.
Publicado: (2025)
por: Xiao, Wei, et al.
Publicado: (2025)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
por: Nakamoto, Mitsuhiko, et al.
Publicado: (2023)
por: Nakamoto, Mitsuhiko, et al.
Publicado: (2023)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
por: Mukherjee, Subhojyoti, et al.
Publicado: (2025)
por: Mukherjee, Subhojyoti, et al.
Publicado: (2025)
An Empirical Study on the Effectiveness of Incorporating Offline RL As Online RL Subroutines
por: Su, Jianhai, et al.
Publicado: (2025)
por: Su, Jianhai, et al.
Publicado: (2025)
Dirichlet-Based Prediction Calibration for Learning with Noisy Labels
por: Zong, Chen-Chen, et al.
Publicado: (2024)
por: Zong, Chen-Chen, et al.
Publicado: (2024)
Reflect-RL: Two-Player Online RL Fine-Tuning for LMs
por: Zhou, Runlong, et al.
Publicado: (2024)
por: Zhou, Runlong, et al.
Publicado: (2024)
Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL
por: Guo, Junyu, et al.
Publicado: (2025)
por: Guo, Junyu, et al.
Publicado: (2025)
Optimistic Interior Point Methods for Sequential Hypothesis Testing by Betting
por: Chen, Can, et al.
Publicado: (2025)
por: Chen, Can, et al.
Publicado: (2025)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
por: Wang, Qi, et al.
Publicado: (2023)
por: Wang, Qi, et al.
Publicado: (2023)
Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data
por: Zhou, Zhiyuan, et al.
Publicado: (2024)
por: Zhou, Zhiyuan, et al.
Publicado: (2024)
SOMBRL: Scalable and Optimistic Model-Based RL
por: Sukhija, Bhavya, et al.
Publicado: (2025)
por: Sukhija, Bhavya, et al.
Publicado: (2025)
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
por: He, Longxiang, et al.
Publicado: (2025)
por: He, Longxiang, et al.
Publicado: (2025)
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
por: Li, Huanyu, et al.
Publicado: (2026)
por: Li, Huanyu, et al.
Publicado: (2026)
COPlanner: Plan to Roll Out Conservatively but to Explore Optimistically for Model-Based RL
por: Wang, Xiyao, et al.
Publicado: (2023)
por: Wang, Xiyao, et al.
Publicado: (2023)
A Theory of Optimistically Universal Online Learnability for General Concept Classes
por: Hanneke, Steve, et al.
Publicado: (2025)
por: Hanneke, Steve, et al.
Publicado: (2025)
AdamO: A Collapse-Suppressed Optimizer for Offline RL
por: Qiao, Nan, et al.
Publicado: (2026)
por: Qiao, Nan, et al.
Publicado: (2026)
Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis
por: Huang, Ruiquan, et al.
Publicado: (2025)
por: Huang, Ruiquan, et al.
Publicado: (2025)
Less is More: Clustered Cross-Covariance Control for Offline RL
por: Qiao, Nan, et al.
Publicado: (2026)
por: Qiao, Nan, et al.
Publicado: (2026)
Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL
por: Rietz, Finn, et al.
Publicado: (2025)
por: Rietz, Finn, et al.
Publicado: (2025)
Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation
por: Chen, Ziru, et al.
Publicado: (2026)
por: Chen, Ziru, et al.
Publicado: (2026)
Wait-Less Offline Tuning and Re-solving for Online Decision Making
por: Sun, Jingruo, et al.
Publicado: (2024)
por: Sun, Jingruo, et al.
Publicado: (2024)
TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
por: Xie, Zhixin, et al.
Publicado: (2026)
por: Xie, Zhixin, et al.
Publicado: (2026)
Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning
por: Vassoyan, Jean, et al.
Publicado: (2025)
por: Vassoyan, Jean, et al.
Publicado: (2025)
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024)
por: Agnihotri, Akhil, et al.
Publicado: (2024)
MARFT: Multi-Agent Reinforcement Fine-Tuning
por: Liao, Junwei, et al.
Publicado: (2025)
por: Liao, Junwei, et al.
Publicado: (2025)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
por: Bozkurt, Alper Kamil, et al.
Publicado: (2026)
por: Bozkurt, Alper Kamil, et al.
Publicado: (2026)
Behavior-Adaptive Q-Learning: A Unifying Framework for Offline-to-Online RL
por: Zu, Lipeng, et al.
Publicado: (2025)
por: Zu, Lipeng, et al.
Publicado: (2025)
Bidirectional Uncertainty-Based Active Learning for Open Set Annotation
por: Zong, Chen-Chen, et al.
Publicado: (2024)
por: Zong, Chen-Chen, et al.
Publicado: (2024)
Towards Robust Offline-to-Online Reinforcement Learning via Uncertainty and Smoothness
por: Wen, Xiaoyu, et al.
Publicado: (2023)
por: Wen, Xiaoyu, et al.
Publicado: (2023)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
por: Chen, Kang, et al.
Publicado: (2025)
por: Chen, Kang, et al.
Publicado: (2025)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
por: Luo, Yu, et al.
Publicado: (2024)
por: Luo, Yu, et al.
Publicado: (2024)
Action-Free Offline-to-Online RL via Discretised State Policies
por: Neggatu, Natinael Solomon, et al.
Publicado: (2026)
por: Neggatu, Natinael Solomon, et al.
Publicado: (2026)
Semi-gradient DICE for Offline Constrained Reinforcement Learning
por: Kim, Woosung, et al.
Publicado: (2025)
por: Kim, Woosung, et al.
Publicado: (2025)
Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning
por: McCarthy, James, et al.
Publicado: (2025)
por: McCarthy, James, et al.
Publicado: (2025)
Optimistic Online Mirror Descent for Bridging Stochastic and Adversarial Online Convex Optimization
por: Chen, Sijia, et al.
Publicado: (2023)
por: Chen, Sijia, et al.
Publicado: (2023)
Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration
por: Li, Guopeng, et al.
Publicado: (2026)
por: Li, Guopeng, et al.
Publicado: (2026)
Decoupled Prioritized Resampling for Offline RL
por: Yue, Yang, et al.
Publicado: (2023)
por: Yue, Yang, et al.
Publicado: (2023)
Ejemplares similares
-
Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL
por: Luo, Qin-Wen, et al.
Publicado: (2025) -
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
por: Mark, Max Sobol, et al.
Publicado: (2024) -
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only
por: Xiao, Wei, et al.
Publicado: (2025) -
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
por: Nakamoto, Mitsuhiko, et al.
Publicado: (2023) -
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
por: Mukherjee, Subhojyoti, et al.
Publicado: (2025)