PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Shengjie, Lyu, Jiafei, Liu, Runze, Yan, Mengbei, Liu, Bo, Ye, Deheng, Li, Xiu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SEABO: A Simple Search-Based Method for Offline Imitation Learning
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024)
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024)
Cross-Domain Offline Policy Adaptation via Selective Transition Correction
von: Yan, Mengbei, et al.
Veröffentlicht: (2026)
von: Yan, Mengbei, et al.
Veröffentlicht: (2026)
Mildly Conservative Q-Learning for Offline Reinforcement Learning
von: Lyu, Jiafei, et al.
Veröffentlicht: (2022)
von: Lyu, Jiafei, et al.
Veröffentlicht: (2022)
ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024)
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024)
VLP: Vision-Language Preference Learning for Embodied Manipulation
von: Liu, Runze, et al.
Veröffentlicht: (2025)
von: Liu, Runze, et al.
Veröffentlicht: (2025)
A Large Language Model-Driven Reward Design Framework via Dynamic Feedback for Reinforcement Learning
von: Sun, Shengjie, et al.
Veröffentlicht: (2024)
von: Sun, Shengjie, et al.
Veröffentlicht: (2024)
Mind the Model, Not the Agent: The Primacy Bias in Model-based RL
von: Qiao, Zhongjian, et al.
Veröffentlicht: (2023)
von: Qiao, Zhongjian, et al.
Veröffentlicht: (2023)
ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
von: Liu, Zeyuan, et al.
Veröffentlicht: (2025)
von: Liu, Zeyuan, et al.
Veröffentlicht: (2025)
A Two-stage Reinforcement Learning-based Approach for Multi-entity Task Allocation
von: Gong, Aicheng, et al.
Veröffentlicht: (2024)
von: Gong, Aicheng, et al.
Veröffentlicht: (2024)
PEARL: Zero-shot Cross-task Preference Alignment and Robust Reward Learning for Robotic Manipulation
von: Liu, Runze, et al.
Veröffentlicht: (2023)
von: Liu, Runze, et al.
Veröffentlicht: (2023)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
Understanding What Affects the Generalization Gap in Visual Reinforcement Learning: Theory and Empirical Evidence
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024)
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024)
Exploring and Addressing Reward Confusion in Offline Preference Learning
von: Chen, Xin, et al.
Veröffentlicht: (2024)
von: Chen, Xin, et al.
Veröffentlicht: (2024)
Debiased Model-based Representations for Sample-efficient Continuous Control
von: Lyu, Jiafei, et al.
Veröffentlicht: (2026)
von: Lyu, Jiafei, et al.
Veröffentlicht: (2026)
EntroPIC: Towards Stable Long-Term Training of LLMs via Entropy Stabilization with Proportional-Integral Control
von: Yang, Kai, et al.
Veröffentlicht: (2025)
von: Yang, Kai, et al.
Veröffentlicht: (2025)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
Offline Imitation Learning with Model-based Reverse Augmentation
von: Shao, Jie-Jing, et al.
Veröffentlicht: (2024)
von: Shao, Jie-Jing, et al.
Veröffentlicht: (2024)
SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories
von: Burnwal, Returaj, et al.
Veröffentlicht: (2025)
von: Burnwal, Returaj, et al.
Veröffentlicht: (2025)
CROP: Conservative Reward for Model-based Offline Policy Optimization
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
Rectifying Shortcut Behaviors in Preference-based Reward Learning
von: Ye, Wenqian, et al.
Veröffentlicht: (2025)
von: Ye, Wenqian, et al.
Veröffentlicht: (2025)
How to Leverage Diverse Demonstrations in Offline Imitation Learning
von: Yue, Sheng, et al.
Veröffentlicht: (2024)
von: Yue, Sheng, et al.
Veröffentlicht: (2024)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Balance Equation-based Distributionally Robust Offline Imitation Learning
von: Agrawal, Rishabh, et al.
Veröffentlicht: (2025)
von: Agrawal, Rishabh, et al.
Veröffentlicht: (2025)
Boosting Vulnerability Detection of LLMs via Curriculum Preference Optimization with Synthetic Reasoning Data
von: Wen, Xin-Cheng, et al.
Veröffentlicht: (2025)
von: Wen, Xin-Cheng, et al.
Veröffentlicht: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
Diffusion-Reward Adversarial Imitation Learning
von: Lai, Chun-Mao, et al.
Veröffentlicht: (2024)
von: Lai, Chun-Mao, et al.
Veröffentlicht: (2024)
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
von: He, Longxiang, et al.
Veröffentlicht: (2025)
von: He, Longxiang, et al.
Veröffentlicht: (2025)
Reward Learning From Preference With Ties
von: Liu, Jinsong, et al.
Veröffentlicht: (2024)
von: Liu, Jinsong, et al.
Veröffentlicht: (2024)
Robust Offline Imitation Learning Through State-level Trajectory Stitching
von: Wang, Shuze, et al.
Veröffentlicht: (2025)
von: Wang, Shuze, et al.
Veröffentlicht: (2025)
DITTO: Offline Imitation Learning with World Models
von: DeMoss, Branton, et al.
Veröffentlicht: (2023)
von: DeMoss, Branton, et al.
Veröffentlicht: (2023)
ProAct: Agentic Lookahead in Interactive Environments
von: Yu, Yangbin, et al.
Veröffentlicht: (2026)
von: Yu, Yangbin, et al.
Veröffentlicht: (2026)
Cross-Domain Policy Adaptation by Capturing Representation Mismatch
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024)
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024)
Temporal Difference Learning with Constrained Initial Representations
von: Lyu, Jiafei, et al.
Veröffentlicht: (2026)
von: Lyu, Jiafei, et al.
Veröffentlicht: (2026)
WALL-E: World Alignment by Rule Learning Improves World Model-based LLM Agents
von: Zhou, Siyu, et al.
Veröffentlicht: (2024)
von: Zhou, Siyu, et al.
Veröffentlicht: (2024)
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only
von: Xiao, Wei, et al.
Veröffentlicht: (2025)
von: Xiao, Wei, et al.
Veröffentlicht: (2025)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
von: Chen, Sirui, et al.
Veröffentlicht: (2025)
von: Chen, Sirui, et al.
Veröffentlicht: (2025)
The Stackelberg Speaker: Optimizing Persuasive Communication in Social Deduction Games
von: Zheng, Zhang, et al.
Veröffentlicht: (2025)
von: Zheng, Zhang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SEABO: A Simple Search-Based Method for Offline Imitation Learning
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024) -
Cross-Domain Offline Policy Adaptation via Selective Transition Correction
von: Yan, Mengbei, et al.
Veröffentlicht: (2026) -
Mildly Conservative Q-Learning for Offline Reinforcement Learning
von: Lyu, Jiafei, et al.
Veröffentlicht: (2022) -
ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
von: Lyu, Jiafei, et al.
Veröffentlicht: (2024) -
VLP: Vision-Language Preference Learning for Embodied Manipulation
von: Liu, Runze, et al.
Veröffentlicht: (2025)