Offline RLAIF: Piloting VLM Feedback for RL via SFO
Fuente:
arXiv
Salvato in:
| Autore principale: | Beck, Jacob |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SFO: Learning PDE Operators via Spectral Filtering
di: Koren, Noam, et al.
Pubblicazione: (2026)
di: Koren, Noam, et al.
Pubblicazione: (2026)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
di: Lee, Harrison, et al.
Pubblicazione: (2023)
di: Lee, Harrison, et al.
Pubblicazione: (2023)
Why Does RLAIF Work At All?
di: Young, Robin
Pubblicazione: (2026)
di: Young, Robin
Pubblicazione: (2026)
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
di: Wang, Yufei, et al.
Pubblicazione: (2024)
di: Wang, Yufei, et al.
Pubblicazione: (2024)
Budgeting Counterfactual for Offline RL
di: Liu, Yao, et al.
Pubblicazione: (2023)
di: Liu, Yao, et al.
Pubblicazione: (2023)
Selective Uncertainty Propagation in Offline RL
di: Krishnamurthy, Sanath Kumar, et al.
Pubblicazione: (2023)
di: Krishnamurthy, Sanath Kumar, et al.
Pubblicazione: (2023)
Decoupled Prioritized Resampling for Offline RL
di: Yue, Yang, et al.
Pubblicazione: (2023)
di: Yue, Yang, et al.
Pubblicazione: (2023)
Augmenting Offline RL with Unlabeled Data
di: Wang, Zhao, et al.
Pubblicazione: (2024)
di: Wang, Zhao, et al.
Pubblicazione: (2024)
An Empirical Study on the Effectiveness of Incorporating Offline RL As Online RL Subroutines
di: Su, Jianhai, et al.
Pubblicazione: (2025)
di: Su, Jianhai, et al.
Pubblicazione: (2025)
Action-Free Offline-to-Online RL via Discretised State Policies
di: Neggatu, Natinael Solomon, et al.
Pubblicazione: (2026)
di: Neggatu, Natinael Solomon, et al.
Pubblicazione: (2026)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
Design Considerations in Offline Preference-based RL
di: Agarwal, Alekh, et al.
Pubblicazione: (2025)
di: Agarwal, Alekh, et al.
Pubblicazione: (2025)
A Tractable Inference Perspective of Offline RL
di: Liu, Xuejie, et al.
Pubblicazione: (2023)
di: Liu, Xuejie, et al.
Pubblicazione: (2023)
Are Expressive Models Truly Necessary for Offline RL?
di: Wang, Guan, et al.
Pubblicazione: (2024)
di: Wang, Guan, et al.
Pubblicazione: (2024)
OGBench: Benchmarking Offline Goal-Conditioned RL
di: Park, Seohong, et al.
Pubblicazione: (2024)
di: Park, Seohong, et al.
Pubblicazione: (2024)
FuzzingRL: Reinforcement Fuzz-Testing for Revealing VLM Failures
di: Xu, Jiajun, et al.
Pubblicazione: (2026)
di: Xu, Jiajun, et al.
Pubblicazione: (2026)
Yes, Q-learning Helps Offline In-Context RL
di: Tarasov, Denis, et al.
Pubblicazione: (2025)
di: Tarasov, Denis, et al.
Pubblicazione: (2025)
Scalable Offline Model-Based RL with Action Chunks
di: Park, Kwanyoung, et al.
Pubblicazione: (2025)
di: Park, Kwanyoung, et al.
Pubblicazione: (2025)
Offline Multi-task Transfer RL with Representational Penalization
di: Bose, Avinandan, et al.
Pubblicazione: (2024)
di: Bose, Avinandan, et al.
Pubblicazione: (2024)
Is Value Learning Really the Main Bottleneck in Offline RL?
di: Park, Seohong, et al.
Pubblicazione: (2024)
di: Park, Seohong, et al.
Pubblicazione: (2024)
The Role of Deep Learning Regularizations on Actors in Offline RL
di: Tarasov, Denis, et al.
Pubblicazione: (2024)
di: Tarasov, Denis, et al.
Pubblicazione: (2024)
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
di: Duan, Xintong, et al.
Pubblicazione: (2025)
di: Duan, Xintong, et al.
Pubblicazione: (2025)
Out-of-Distribution Adaptation in Offline RL: Counterfactual Reasoning via Causal Normalizing Flows
di: Cho, Minjae, et al.
Pubblicazione: (2024)
di: Cho, Minjae, et al.
Pubblicazione: (2024)
Dual Alignment Maximin Optimization for Offline Model-based RL
di: Zhou, Chi, et al.
Pubblicazione: (2025)
di: Zhou, Chi, et al.
Pubblicazione: (2025)
Integrating Domain Knowledge for handling Limited Data in Offline RL
di: Gangopadhyay, Briti, et al.
Pubblicazione: (2024)
di: Gangopadhyay, Briti, et al.
Pubblicazione: (2024)
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
di: Cheng, Jie, et al.
Pubblicazione: (2024)
di: Cheng, Jie, et al.
Pubblicazione: (2024)
ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation
di: Zhang, Songyuan, et al.
Pubblicazione: (2026)
di: Zhang, Songyuan, et al.
Pubblicazione: (2026)
STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order
di: Gu, Chengyang, et al.
Pubblicazione: (2026)
di: Gu, Chengyang, et al.
Pubblicazione: (2026)
Multi-Agent Path Finding via Offline RL and LLM Collaboration
di: Atasever, Merve, et al.
Pubblicazione: (2025)
di: Atasever, Merve, et al.
Pubblicazione: (2025)
Language-Conditioned Offline RL for Multi-Robot Navigation
di: Morad, Steven, et al.
Pubblicazione: (2024)
di: Morad, Steven, et al.
Pubblicazione: (2024)
Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood
di: Yao, Qingmao, et al.
Pubblicazione: (2025)
di: Yao, Qingmao, et al.
Pubblicazione: (2025)
Corruption Robust Offline Reinforcement Learning with Human Feedback
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
di: Wu, Xiefeng, et al.
Pubblicazione: (2025)
di: Wu, Xiefeng, et al.
Pubblicazione: (2025)
Scaling Offline RL via Efficient and Expressive Shortcut Models
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)
Toward Explainable Offline RL: Analyzing Representations in Intrinsically Motivated Decision Transformers
di: Guiducci, Leonardo, et al.
Pubblicazione: (2025)
di: Guiducci, Leonardo, et al.
Pubblicazione: (2025)
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
di: He, Longxiang, et al.
Pubblicazione: (2025)
di: He, Longxiang, et al.
Pubblicazione: (2025)
HIQL: Offline Goal-Conditioned RL with Latent States as Actions
di: Park, Seohong, et al.
Pubblicazione: (2023)
di: Park, Seohong, et al.
Pubblicazione: (2023)
Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL
di: Choi, Jinwoo, et al.
Pubblicazione: (2026)
di: Choi, Jinwoo, et al.
Pubblicazione: (2026)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
di: Lim, Yooseok, et al.
Pubblicazione: (2024)
di: Lim, Yooseok, et al.
Pubblicazione: (2024)
Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data
di: Zheng, Chongyi, et al.
Pubblicazione: (2023)
di: Zheng, Chongyi, et al.
Pubblicazione: (2023)
Documenti analoghi
-
SFO: Learning PDE Operators via Spectral Filtering
di: Koren, Noam, et al.
Pubblicazione: (2026) -
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
di: Lee, Harrison, et al.
Pubblicazione: (2023) -
Why Does RLAIF Work At All?
di: Young, Robin
Pubblicazione: (2026) -
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
di: Wang, Yufei, et al.
Pubblicazione: (2024) -
Budgeting Counterfactual for Offline RL
di: Liu, Yao, et al.
Pubblicazione: (2023)