In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Tu, Songjun, Sun, Jingbo, Zhang, Qichao, Zhang, Yaocheng, Liu, Jia, Chen, Ke, Zhao, Dongbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
di: Tu, Songjun, et al.
Pubblicazione: (2024)
di: Tu, Songjun, et al.
Pubblicazione: (2024)
Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2025)
di: Sun, Jingbo, et al.
Pubblicazione: (2025)
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2026)
di: Sun, Jingbo, et al.
Pubblicazione: (2026)
Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2026)
di: Sun, Jingbo, et al.
Pubblicazione: (2026)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
Dynamic Dual-Granularity Skill Bank for Agentic RL
di: Tu, Songjun, et al.
Pubblicazione: (2026)
di: Tu, Songjun, et al.
Pubblicazione: (2026)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
di: Zhang, Tianle, et al.
Pubblicazione: (2024)
di: Zhang, Tianle, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data
di: Jia, Zeyu, et al.
Pubblicazione: (2024)
di: Jia, Zeyu, et al.
Pubblicazione: (2024)
Learning Future Representation with Synthetic Observations for Sample-efficient Reinforcement Learning
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
di: Tu, Songjun, et al.
Pubblicazione: (2025)
di: Tu, Songjun, et al.
Pubblicazione: (2025)
Latent Adversarial Regularization for Offline Preference Optimization
di: Jiang, Enyi, et al.
Pubblicazione: (2026)
di: Jiang, Enyi, et al.
Pubblicazione: (2026)
Mildly Conservative Regularized Evaluation for Offline Reinforcement Learning
di: Chen, Haohui, et al.
Pubblicazione: (2025)
di: Chen, Haohui, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning with Generative Trajectory Policies
di: Feng, Xinsong, et al.
Pubblicazione: (2025)
di: Feng, Xinsong, et al.
Pubblicazione: (2025)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025)
Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning
di: Wang, Qingjun, et al.
Pubblicazione: (2026)
di: Wang, Qingjun, et al.
Pubblicazione: (2026)
DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching
di: Li, Guanghe, et al.
Pubblicazione: (2024)
di: Li, Guanghe, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning with Imbalanced Datasets
di: Jiang, Li, et al.
Pubblicazione: (2023)
di: Jiang, Li, et al.
Pubblicazione: (2023)
Dataset Distillation for Offline Reinforcement Learning
di: Light, Jonathan, et al.
Pubblicazione: (2024)
di: Light, Jonathan, et al.
Pubblicazione: (2024)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
di: Liu, Xiao-Yin, et al.
Pubblicazione: (2024)
di: Liu, Xiao-Yin, et al.
Pubblicazione: (2024)
Preference Elicitation for Offline Reinforcement Learning
di: Pace, Alizée, et al.
Pubblicazione: (2024)
di: Pace, Alizée, et al.
Pubblicazione: (2024)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
di: Choi, Heewoong, et al.
Pubblicazione: (2024)
di: Choi, Heewoong, et al.
Pubblicazione: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
di: Kang, Hyungkyu, et al.
Pubblicazione: (2025)
di: Kang, Hyungkyu, et al.
Pubblicazione: (2025)
Behavior Preference Regression for Offline Reinforcement Learning
di: Srinivasan, Padmanaba, et al.
Pubblicazione: (2025)
di: Srinivasan, Padmanaba, et al.
Pubblicazione: (2025)
Mutual Information Regularized Offline Reinforcement Learning
di: Ma, Xiao, et al.
Pubblicazione: (2022)
di: Ma, Xiao, et al.
Pubblicazione: (2022)
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
di: Sun, Chuanneng, et al.
Pubblicazione: (2024)
di: Sun, Chuanneng, et al.
Pubblicazione: (2024)
Entropy-Regularized Adjoint Matching for Offline Reinforcement Learning
di: Ghanem, Abdelghani, et al.
Pubblicazione: (2026)
di: Ghanem, Abdelghani, et al.
Pubblicazione: (2026)
Policy-Based Trajectory Clustering in Offline Reinforcement Learning
di: Hu, Hao, et al.
Pubblicazione: (2025)
di: Hu, Hao, et al.
Pubblicazione: (2025)
TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning
di: Sestini, Alessandro, et al.
Pubblicazione: (2025)
di: Sestini, Alessandro, et al.
Pubblicazione: (2025)
Offline Safe Reinforcement Learning Using Trajectory Classification
di: Gong, Ze, et al.
Pubblicazione: (2024)
di: Gong, Ze, et al.
Pubblicazione: (2024)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
di: Xu, Yinglun, et al.
Pubblicazione: (2023)
di: Xu, Yinglun, et al.
Pubblicazione: (2023)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
di: Liu, Tenglong, et al.
Pubblicazione: (2024)
di: Liu, Tenglong, et al.
Pubblicazione: (2024)
Cross-domain Random Pre-training with Prototypes for Reinforcement Learning
di: Liu, Xin, et al.
Pubblicazione: (2023)
di: Liu, Xin, et al.
Pubblicazione: (2023)
GTA: Generative Trajectory Augmentation with Guidance for Offline Reinforcement Learning
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
Robust Offline Reinforcement Learning with Linearly Structured f-Divergence Regularization
di: Tang, Cheng, et al.
Pubblicazione: (2024)
di: Tang, Cheng, et al.
Pubblicazione: (2024)
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
di: Liu, Jinmei, et al.
Pubblicazione: (2024)
di: Liu, Jinmei, et al.
Pubblicazione: (2024)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
di: Sun, Shengjie, et al.
Pubblicazione: (2025)
di: Sun, Shengjie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
di: Tu, Songjun, et al.
Pubblicazione: (2024) -
Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2025) -
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2026) -
Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2026) -
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
di: Yang, Yiqin, et al.
Pubblicazione: (2026)