Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Ambadkar, Tanmay, Panda, Sourav, Kale, Shreyash, Dodge, Jonathan, Verma, Abhinav |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scaling Strategy, Not Compute: A Stand-Alone, Open-Source StarCraft II Benchmark for Accessible Reinforcement Learning Research
por: Panda, Sourav, et al.
Publicado: (2026)
por: Panda, Sourav, et al.
Publicado: (2026)
Automating the Refinement of Reinforcement Learning Specifications
por: Ambadkar, Tanmay, et al.
Publicado: (2025)
por: Ambadkar, Tanmay, et al.
Publicado: (2025)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
por: Shianifar, Jonaid, et al.
Publicado: (2026)
por: Shianifar, Jonaid, et al.
Publicado: (2026)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
por: Xu, Wenzhe, et al.
Publicado: (2026)
por: Xu, Wenzhe, et al.
Publicado: (2026)
Meta-Learning Objectives for Preference Optimization
por: Alfano, Carlo, et al.
Publicado: (2024)
por: Alfano, Carlo, et al.
Publicado: (2024)
Safety Optimized Reinforcement Learning via Multi-Objective Policy Optimization
por: Honari, Homayoun, et al.
Publicado: (2024)
por: Honari, Homayoun, et al.
Publicado: (2024)
Interactive Hyperparameter Optimization in Multi-Objective Problems via Preference Learning
por: Giovanelli, Joseph, et al.
Publicado: (2023)
por: Giovanelli, Joseph, et al.
Publicado: (2023)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024)
por: Zhang, Tianle, et al.
Publicado: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
por: Kang, Hyungkyu, et al.
Publicado: (2025)
por: Kang, Hyungkyu, et al.
Publicado: (2025)
Joint Optimization of Multi-Objective Reinforcement Learning with Policy Gradient Based Algorithm
por: Bai, Qinbo, et al.
Publicado: (2021)
por: Bai, Qinbo, et al.
Publicado: (2021)
Preference-Guided Diffusion for Multi-Objective Offline Optimization
por: Annadani, Yashas, et al.
Publicado: (2025)
por: Annadani, Yashas, et al.
Publicado: (2025)
Navigating Trade-offs: Policy Summarization for Multi-Objective Reinforcement Learning
por: Osika, Zuzanna, et al.
Publicado: (2024)
por: Osika, Zuzanna, et al.
Publicado: (2024)
FairDICE: Fairness-Driven Offline Multi-Objective Reinforcement Learning
por: Kim, Woosung, et al.
Publicado: (2025)
por: Kim, Woosung, et al.
Publicado: (2025)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
por: Harland, Hadassah, et al.
Publicado: (2024)
por: Harland, Hadassah, et al.
Publicado: (2024)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
por: Yuan, Yifu, et al.
Publicado: (2024)
por: Yuan, Yifu, et al.
Publicado: (2024)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
por: Zhou, Zhanhui, et al.
Publicado: (2023)
por: Zhou, Zhanhui, et al.
Publicado: (2023)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
por: Yao, Yihang, et al.
Publicado: (2023)
por: Yao, Yihang, et al.
Publicado: (2023)
Combining Multi-Objective Bayesian Optimization with Reinforcement Learning for TinyML
por: Deutel, Mark, et al.
Publicado: (2023)
por: Deutel, Mark, et al.
Publicado: (2023)
Protein-Conditioned Multi-Objective Reinforcement Learning for Full-Length mRNA Design
por: Shao, Zixi, et al.
Publicado: (2026)
por: Shao, Zixi, et al.
Publicado: (2026)
Pareto Front-Diverse Batch Multi-Objective Bayesian Optimization
por: Ahmadianshalchi, Alaleh, et al.
Publicado: (2024)
por: Ahmadianshalchi, Alaleh, et al.
Publicado: (2024)
Deep Multi-Objective Reinforcement Learning for Utility-Based Infrastructural Maintenance Optimization
por: van Remmerden, Jesse, et al.
Publicado: (2024)
por: van Remmerden, Jesse, et al.
Publicado: (2024)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
por: Wang, Ziqing, et al.
Publicado: (2025)
por: Wang, Ziqing, et al.
Publicado: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
Pareto-Conditioned Diffusion Models for Offline Multi-Objective Optimization
por: Shrestha, Jatan, et al.
Publicado: (2026)
por: Shrestha, Jatan, et al.
Publicado: (2026)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
por: Ma, Yunchang, et al.
Publicado: (2025)
por: Ma, Yunchang, et al.
Publicado: (2025)
Multi-Objective Reinforcement Learning for Water Management
por: Osika, Zuzanna, et al.
Publicado: (2025)
por: Osika, Zuzanna, et al.
Publicado: (2025)
Demonstration Guided Multi-Objective Reinforcement Learning
por: Lu, Junlin, et al.
Publicado: (2024)
por: Lu, Junlin, et al.
Publicado: (2024)
Context-aware Diversity Enhancement for Neural Multi-Objective Combinatorial Optimization
por: Lu, Yongfan, et al.
Publicado: (2024)
por: Lu, Yongfan, et al.
Publicado: (2024)
Selective Reincarnation: Offline-to-Online Multi-Agent Reinforcement Learning
por: Formanek, Claude, et al.
Publicado: (2023)
por: Formanek, Claude, et al.
Publicado: (2023)
Interactive Multi-Objective Probabilistic Preference Learning with Soft and Hard Bounds
por: Chen, Edward, et al.
Publicado: (2025)
por: Chen, Edward, et al.
Publicado: (2025)
Proposing Hierarchical Goal-Conditioned Policy Planning in Multi-Goal Reinforcement Learning
por: Rens, Gavin B.
Publicado: (2025)
por: Rens, Gavin B.
Publicado: (2025)
TREX: Trajectory Explanations for Multi-Objective Reinforcement Learning
por: Rajapakse, Dilina, et al.
Publicado: (2026)
por: Rajapakse, Dilina, et al.
Publicado: (2026)
Interpretability by Design for Efficient Multi-Objective Reinforcement Learning
por: Xia, Qiyue, et al.
Publicado: (2025)
por: Xia, Qiyue, et al.
Publicado: (2025)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
por: Zhang, Xikai, et al.
Publicado: (2026)
por: Zhang, Xikai, et al.
Publicado: (2026)
Learning Pareto-Optimal Rewards from Noisy Preferences: A Framework for Multi-Objective Inverse Reinforcement Learning
por: Cherukuri, Kalyan, et al.
Publicado: (2025)
por: Cherukuri, Kalyan, et al.
Publicado: (2025)
Fine-tuning Behavioral Cloning Policies with Preference-Based Reinforcement Learning
por: Macuglia, Maël, et al.
Publicado: (2025)
por: Macuglia, Maël, et al.
Publicado: (2025)
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
por: Lin, Qian, et al.
Publicado: (2024)
por: Lin, Qian, et al.
Publicado: (2024)
In Search for Architectures and Loss Functions in Multi-Objective Reinforcement Learning
por: Terekhov, Mikhail, et al.
Publicado: (2024)
por: Terekhov, Mikhail, et al.
Publicado: (2024)
C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs
por: Gao, Rui, et al.
Publicado: (2026)
por: Gao, Rui, et al.
Publicado: (2026)
Proximal Policy Gradient Arborescence for Quality Diversity Reinforcement Learning
por: Batra, Sumeet, et al.
Publicado: (2023)
por: Batra, Sumeet, et al.
Publicado: (2023)
Ejemplares similares
-
Scaling Strategy, Not Compute: A Stand-Alone, Open-Source StarCraft II Benchmark for Accessible Reinforcement Learning Research
por: Panda, Sourav, et al.
Publicado: (2026) -
Automating the Refinement of Reinforcement Learning Specifications
por: Ambadkar, Tanmay, et al.
Publicado: (2025) -
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
por: Shianifar, Jonaid, et al.
Publicado: (2026) -
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
por: Xu, Wenzhe, et al.
Publicado: (2026) -
Meta-Learning Objectives for Preference Optimization
por: Alfano, Carlo, et al.
Publicado: (2024)