Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Jifeng, Huang, Sili, Yang, Zhejian, Hu, Shengchao, Shen, Li, Chen, Hechang, Sun, Lichao, Chang, Yi, Tao, Dacheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
por: Hu, Jifeng, et al.
Publicado: (2024)
por: Hu, Jifeng, et al.
Publicado: (2024)
Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces
por: Hu, Jifeng, et al.
Publicado: (2024)
por: Hu, Jifeng, et al.
Publicado: (2024)
A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning
por: Guo, Siyuan, et al.
Publicado: (2023)
por: Guo, Siyuan, et al.
Publicado: (2023)
Decision Flow Policy Optimization
por: Hu, Jifeng, et al.
Publicado: (2025)
por: Hu, Jifeng, et al.
Publicado: (2025)
In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
por: Huang, Sili, et al.
Publicado: (2024)
por: Huang, Sili, et al.
Publicado: (2024)
Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling
por: Huang, Sili, et al.
Publicado: (2024)
por: Huang, Sili, et al.
Publicado: (2024)
Continual Task Learning through Adaptive Policy Self-Composition
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
por: Fan, Ziqing, et al.
Publicado: (2024)
por: Fan, Ziqing, et al.
Publicado: (2024)
Solving Continual Offline Reinforcement Learning with Decision Transformer
por: Huang, Kaixin, et al.
Publicado: (2024)
por: Huang, Kaixin, et al.
Publicado: (2024)
Q-value Regularized Transformer for Offline Reinforcement Learning
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning
por: Chen, Rufeng, et al.
Publicado: (2026)
por: Chen, Rufeng, et al.
Publicado: (2026)
FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning
por: Alles, Marvin, et al.
Publicado: (2025)
por: Alles, Marvin, et al.
Publicado: (2025)
QPO: Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning
por: Kong, Yilun, et al.
Publicado: (2024)
por: Kong, Yilun, et al.
Publicado: (2024)
Policy-Based Trajectory Clustering in Offline Reinforcement Learning
por: Hu, Hao, et al.
Publicado: (2025)
por: Hu, Hao, et al.
Publicado: (2025)
Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models
por: Fu, Shi, et al.
Publicado: (2026)
por: Fu, Shi, et al.
Publicado: (2026)
Is Mamba Compatible with Trajectory Optimization in Offline Reinforcement Learning?
por: Dai, Yang, et al.
Publicado: (2024)
por: Dai, Yang, et al.
Publicado: (2024)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
por: Gao, Chen-Xiao, et al.
Publicado: (2025)
por: Gao, Chen-Xiao, et al.
Publicado: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024)
por: Zhang, Tianle, et al.
Publicado: (2024)
Grid-Mapping Pseudo-Count Constraint for Offline Reinforcement Learning
por: Shen, Yi, et al.
Publicado: (2024)
por: Shen, Yi, et al.
Publicado: (2024)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
por: Liu, Tenglong, et al.
Publicado: (2024)
por: Liu, Tenglong, et al.
Publicado: (2024)
TGSBM: Transformer-Guided Stochastic Block Model for Link Prediction
por: Yang, Zhejian, et al.
Publicado: (2026)
por: Yang, Zhejian, et al.
Publicado: (2026)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
por: Zhan, Simon Sinong, et al.
Publicado: (2025)
por: Zhan, Simon Sinong, et al.
Publicado: (2025)
Learning Multi-Agent Communication from Graph Modeling Perspective
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Communication Learning in Multi-Agent Systems from Graph Modeling Perspective
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
por: Zhao, Ziqi, et al.
Publicado: (2024)
por: Zhao, Ziqi, et al.
Publicado: (2024)
Pessimistic Auxiliary Policy for Offline Reinforcement Learning
por: Zhang, Fan, et al.
Publicado: (2026)
por: Zhang, Fan, et al.
Publicado: (2026)
Offline Behavior Distillation
por: Lei, Shiye, et al.
Publicado: (2024)
por: Lei, Shiye, et al.
Publicado: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
por: Kang, Hyungkyu, et al.
Publicado: (2025)
por: Kang, Hyungkyu, et al.
Publicado: (2025)
CausalGDP: Causality-Guided Diffusion Policies for Reinforcement Learning
por: Xiao, Xiaofeng, et al.
Publicado: (2026)
por: Xiao, Xiaofeng, et al.
Publicado: (2026)
Offline Reinforcement Learning with Generative Trajectory Policies
por: Feng, Xinsong, et al.
Publicado: (2025)
por: Feng, Xinsong, et al.
Publicado: (2025)
Offline Behavioral Data Selection
por: Lei, Shiye, et al.
Publicado: (2025)
por: Lei, Shiye, et al.
Publicado: (2025)
Dataset Distillation for Offline Reinforcement Learning
por: Light, Jonathan, et al.
Publicado: (2024)
por: Light, Jonathan, et al.
Publicado: (2024)
Offline Policy Optimization with Posterior Sampling
por: Lin, Hongqiang, et al.
Publicado: (2026)
por: Lin, Hongqiang, et al.
Publicado: (2026)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
por: Ma, Yunchang, et al.
Publicado: (2025)
por: Ma, Yunchang, et al.
Publicado: (2025)
ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization
por: Chen, Yifei, et al.
Publicado: (2026)
por: Chen, Yifei, et al.
Publicado: (2026)
Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
por: Tiofack, Franki Nguimatsia, et al.
Publicado: (2025)
por: Tiofack, Franki Nguimatsia, et al.
Publicado: (2025)
Hypercube Policy Regularization Framework for Offline Reinforcement Learning
por: Shen, Yi, et al.
Publicado: (2024)
por: Shen, Yi, et al.
Publicado: (2024)
HELP: HyperNode Expansion and Logical Path-Guided Evidence Localization for Accurate and Efficient GraphRAG
por: Huang, Yuqi, et al.
Publicado: (2026)
por: Huang, Yuqi, et al.
Publicado: (2026)
Ejemplares similares
-
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
por: Hu, Jifeng, et al.
Publicado: (2024) -
Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces
por: Hu, Jifeng, et al.
Publicado: (2024) -
A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning
por: Guo, Siyuan, et al.
Publicado: (2023) -
Decision Flow Policy Optimization
por: Hu, Jifeng, et al.
Publicado: (2025) -
In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
por: Huang, Sili, et al.
Publicado: (2024)