Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Yinglun, Suresh, Tarun, Gumaste, Rohan, Zhu, David, Li, Ruirui, Wang, Zhengyang, Jiang, Haoming, Tang, Xianfeng, Yin, Qingyu, Cheng, Monica Xiao, Zeng, Qi, Zhang, Chao, Singh, Gagandeep |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
IterGen: Iterative Semantic-aware Structured LLM Generation with Backtracking
von: Ugare, Shubham, et al.
Veröffentlicht: (2024)
von: Ugare, Shubham, et al.
Veröffentlicht: (2024)
Learning a Pessimistic Reward Model in RLHF
von: Xu, Yinglun, et al.
Veröffentlicht: (2025)
von: Xu, Yinglun, et al.
Veröffentlicht: (2025)
DINGO: Constrained Inference for Diffusion LLMs
von: Suresh, Tarun, et al.
Veröffentlicht: (2025)
von: Suresh, Tarun, et al.
Veröffentlicht: (2025)
SuperCoder: Assembly Program Superoptimization with Large Language Models
von: Wei, Anjiang, et al.
Veröffentlicht: (2025)
von: Wei, Anjiang, et al.
Veröffentlicht: (2025)
Robust Thompson Sampling Algorithms Against Reward Poisoning Attacks
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
BEAVER: An Efficient Deterministic LLM Verifier
von: Suresh, Tarun, et al.
Veröffentlicht: (2025)
von: Suresh, Tarun, et al.
Veröffentlicht: (2025)
Is The Watermarking Of LLM-Generated Code Robust?
von: Suresh, Tarun, et al.
Veröffentlicht: (2024)
von: Suresh, Tarun, et al.
Veröffentlicht: (2024)
SynCode: LLM Generation with Grammar Augmentation
von: Ugare, Shubham, et al.
Veröffentlicht: (2024)
von: Ugare, Shubham, et al.
Veröffentlicht: (2024)
CRANE: Reasoning with constrained LLM generation
von: Banerjee, Debangshu, et al.
Veröffentlicht: (2025)
von: Banerjee, Debangshu, et al.
Veröffentlicht: (2025)
Incremental Randomized Smoothing Certification
von: Ugare, Shubham, et al.
Veröffentlicht: (2023)
von: Ugare, Shubham, et al.
Veröffentlicht: (2023)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
BlendFilter: Advancing Retrieval-Augmented Large Language Models via Query Generation Blending and Knowledge Filtering
von: Wang, Haoyu, et al.
Veröffentlicht: (2024)
von: Wang, Haoyu, et al.
Veröffentlicht: (2024)
Latent Adversarial Regularization for Offline Preference Optimization
von: Jiang, Enyi, et al.
Veröffentlicht: (2026)
von: Jiang, Enyi, et al.
Veröffentlicht: (2026)
Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond
von: Wei, Tianxin, et al.
Veröffentlicht: (2024)
von: Wei, Tianxin, et al.
Veröffentlicht: (2024)
DLL: A Risk‐Aware Backup Algorithm for Offline Reinforcement Learning
von: Yinglun Hui, et al.
Veröffentlicht: (2026)
von: Yinglun Hui, et al.
Veröffentlicht: (2026)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
PROTOCOL: Late Interaction Retrieval for Protein Homolog Search
von: Cohn, Gabrielle, et al.
Veröffentlicht: (2026)
von: Cohn, Gabrielle, et al.
Veröffentlicht: (2026)
Constrained Latent Action Policies for Model-Based Offline Reinforcement Learning
von: Alles, Marvin, et al.
Veröffentlicht: (2024)
von: Alles, Marvin, et al.
Veröffentlicht: (2024)
TRAP: Targeted Redirecting of Agentic Preferences
von: Kang, Hangoo, et al.
Veröffentlicht: (2025)
von: Kang, Hangoo, et al.
Veröffentlicht: (2025)
VERCEL: Verification and Rectification of Configuration Errors with Least Squares
von: Singh, Abhiram, et al.
Veröffentlicht: (2024)
von: Singh, Abhiram, et al.
Veröffentlicht: (2024)
Unlocking Efficient, Scalable, and Continual Knowledge Editing with Basis-Level Representation Fine-Tuning
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
Offline Constrained RLHF with Multiple Preference Oracles
von: Latham, Brenden, et al.
Veröffentlicht: (2026)
von: Latham, Brenden, et al.
Veröffentlicht: (2026)
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
von: Lin, Qian, et al.
Veröffentlicht: (2024)
von: Lin, Qian, et al.
Veröffentlicht: (2024)
Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning
von: Mao, Yixiu, et al.
Veröffentlicht: (2025)
von: Mao, Yixiu, et al.
Veröffentlicht: (2025)
Diffusion Classifier-Driven Reward for Offline Preference-based Reinforcement Learning
von: Pang, Teng, et al.
Veröffentlicht: (2025)
von: Pang, Teng, et al.
Veröffentlicht: (2025)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
State-Constrained Offline Reinforcement Learning
von: Hepburn, Charles A., et al.
Veröffentlicht: (2024)
von: Hepburn, Charles A., et al.
Veröffentlicht: (2024)
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
von: Jiayang, Cheng, et al.
Veröffentlicht: (2026)
von: Jiayang, Cheng, et al.
Veröffentlicht: (2026)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Behavior Preference Regression for Offline Reinforcement Learning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
Sequential Quadratic Optimization for Solving Expectation Equality Constrained Stochastic Optimization Problems
von: Shen, Haoming, et al.
Veröffentlicht: (2025)
von: Shen, Haoming, et al.
Veröffentlicht: (2025)
Data Shifts Hurt CoT: A Theoretical Study
von: Yin, Lang, et al.
Veröffentlicht: (2025)
von: Yin, Lang, et al.
Veröffentlicht: (2025)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
von: Wang, Qi, et al.
Veröffentlicht: (2023)
von: Wang, Qi, et al.
Veröffentlicht: (2023)
Effective Sorting of Fractional Optical Vortex Modes
von: Mao, Zhengyang, et al.
Veröffentlicht: (2024)
von: Mao, Zhengyang, et al.
Veröffentlicht: (2024)
Mildly Constrained Evaluation Policy for Offline Reinforcement Learning
von: Xu, Linjie, et al.
Veröffentlicht: (2023)
von: Xu, Linjie, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024) -
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024) -
IterGen: Iterative Semantic-aware Structured LLM Generation with Backtracking
von: Ugare, Shubham, et al.
Veröffentlicht: (2024) -
Learning a Pessimistic Reward Model in RLHF
von: Xu, Yinglun, et al.
Veröffentlicht: (2025) -
DINGO: Constrained Inference for Diffusion LLMs
von: Suresh, Tarun, et al.
Veröffentlicht: (2025)