Learning Pareto-Optimal Rewards from Noisy Preferences: A Framework for Multi-Objective Inverse Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Cherukuri, Kalyan, Lala, Aarav |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quantum-Evolutionary Neural Networks for Multi-Agent Federated Learning
by: Lala, Aarav, et al.
Published: (2025)
by: Lala, Aarav, et al.
Published: (2025)
Q-Policy: Quantum-Enhanced Policy Evaluation for Scalable Reinforcement Learning
by: Cherukuri, Kalyan, et al.
Published: (2025)
by: Cherukuri, Kalyan, et al.
Published: (2025)
Low-Rank Matrix Approximation for Neural Network Compression
by: Cherukuri, Kalyan, et al.
Published: (2025)
by: Cherukuri, Kalyan, et al.
Published: (2025)
Pareto-Optimal Learning from Preferences with Hidden Context
by: Bahlous-Boldi, Ryan, et al.
Published: (2024)
by: Bahlous-Boldi, Ryan, et al.
Published: (2024)
Optimal Transport for LLM Reward Modeling from Noisy Preference
by: Pan, Licheng, et al.
Published: (2026)
by: Pan, Licheng, et al.
Published: (2026)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
by: Shianifar, Jonaid, et al.
Published: (2026)
by: Shianifar, Jonaid, et al.
Published: (2026)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
by: Cheng, Ruoxi, et al.
Published: (2025)
by: Cheng, Ruoxi, et al.
Published: (2025)
Neural Lyapunov Function Approximation with Self-Supervised Reinforcement Learning
by: McCutcheon, Luc, et al.
Published: (2025)
by: McCutcheon, Luc, et al.
Published: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
by: Wang, Haoxiang, et al.
Published: (2024)
by: Wang, Haoxiang, et al.
Published: (2024)
Pareto Multi-Objective Alignment for Language Models
by: He, Qiang, et al.
Published: (2025)
by: He, Qiang, et al.
Published: (2025)
Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards
by: Rad, Ali, et al.
Published: (2026)
by: Rad, Ali, et al.
Published: (2026)
Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach
by: Kim, Kihyun, et al.
Published: (2026)
by: Kim, Kihyun, et al.
Published: (2026)
PA2D-MORL: Pareto Ascent Directional Decomposition based Multi-Objective Reinforcement Learning
by: Hu, Tianmeng, et al.
Published: (2026)
by: Hu, Tianmeng, et al.
Published: (2026)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
by: Cheng, Jie, et al.
Published: (2024)
by: Cheng, Jie, et al.
Published: (2024)
Reinforcement Learning with LTL and $ω$-Regular Objectives via Optimality-Preserving Translation to Average Rewards
by: Le, Xuan-Bach, et al.
Published: (2024)
by: Le, Xuan-Bach, et al.
Published: (2024)
Learning Pareto Set for Multi-Objective Continuous Robot Control
by: Shu, Tianye, et al.
Published: (2024)
by: Shu, Tianye, et al.
Published: (2024)
Message Detouring: A Simple Yet Effective Cycle Representation for Expressive Graph Learning
by: Wei, Ziquan, et al.
Published: (2024)
by: Wei, Ziquan, et al.
Published: (2024)
EMP: Effective Multidimensional Persistence for Graph Representation Learning
by: Segovia-Dominguez, Ignacio, et al.
Published: (2024)
by: Segovia-Dominguez, Ignacio, et al.
Published: (2024)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
by: Cai, Xin-Qiang, et al.
Published: (2025)
by: Cai, Xin-Qiang, et al.
Published: (2025)
POMONAG: Pareto-Optimal Many-Objective Neural Architecture Generator
by: Lomurno, Eugenio, et al.
Published: (2024)
by: Lomurno, Eugenio, et al.
Published: (2024)
Topology-Preserving Neural Operator Learning via Hodge Decomposition
by: Zheng, Dongzhe, et al.
Published: (2026)
by: Zheng, Dongzhe, et al.
Published: (2026)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
by: Ambadkar, Tanmay, et al.
Published: (2026)
by: Ambadkar, Tanmay, et al.
Published: (2026)
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
by: Lin, Qian, et al.
Published: (2024)
by: Lin, Qian, et al.
Published: (2024)
Safe and Balanced: A Framework for Constrained Multi-Objective Reinforcement Learning
by: Gu, Shangding, et al.
Published: (2024)
by: Gu, Shangding, et al.
Published: (2024)
Preference Poisoning Attacks on Reward Model Learning
by: Wu, Junlin, et al.
Published: (2024)
by: Wu, Junlin, et al.
Published: (2024)
From Theory to Throughput: CUDA-Optimized APML for Large-Batch 3D Learning
by: Sharifipour, Sasan, et al.
Published: (2025)
by: Sharifipour, Sasan, et al.
Published: (2025)
Reinforcement learning for automatic quadrilateral mesh generation: a soft actor-critic approach
by: Pan, Jie, et al.
Published: (2022)
by: Pan, Jie, et al.
Published: (2022)
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
by: Hou, Xiaoyang, et al.
Published: (2026)
by: Hou, Xiaoyang, et al.
Published: (2026)
Learning Rewards, Not Labels: Adversarial Inverse Reinforcement Learning for Machinery Fault Detection
by: Neupane, Dhiraj, et al.
Published: (2026)
by: Neupane, Dhiraj, et al.
Published: (2026)
Is Optimal Transport Necessary for Inverse Reinforcement Learning?
by: Dong, Zixuan, et al.
Published: (2025)
by: Dong, Zixuan, et al.
Published: (2025)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
by: Choi, Heewoong, et al.
Published: (2024)
by: Choi, Heewoong, et al.
Published: (2024)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
by: Harland, Hadassah, et al.
Published: (2024)
by: Harland, Hadassah, et al.
Published: (2024)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
by: Yuan, Yifu, et al.
Published: (2024)
by: Yuan, Yifu, et al.
Published: (2024)
Residual Reward Models for Preference-based Reinforcement Learning
by: Cao, Chenyang, et al.
Published: (2025)
by: Cao, Chenyang, et al.
Published: (2025)
Hindsight PRIORs for Reward Learning from Human Preferences
by: Verma, Mudit, et al.
Published: (2024)
by: Verma, Mudit, et al.
Published: (2024)
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
by: Schlaginhaufen, Andreas, et al.
Published: (2024)
by: Schlaginhaufen, Andreas, et al.
Published: (2024)
TW-CRL: Time-Weighted Contrastive Reward Learning for Efficient Inverse Reinforcement Learning
by: Li, Yuxuan, et al.
Published: (2025)
by: Li, Yuxuan, et al.
Published: (2025)
Learning Robust Reward Machines from Noisy Labels
by: Parac, Roko, et al.
Published: (2024)
by: Parac, Roko, et al.
Published: (2024)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
by: Sun, Zetian, et al.
Published: (2025)
by: Sun, Zetian, et al.
Published: (2025)
Reinforcement Learning with Conditional Expectation Reward
by: Xiao, Changyi, et al.
Published: (2026)
by: Xiao, Changyi, et al.
Published: (2026)
Similar Items
-
Quantum-Evolutionary Neural Networks for Multi-Agent Federated Learning
by: Lala, Aarav, et al.
Published: (2025) -
Q-Policy: Quantum-Enhanced Policy Evaluation for Scalable Reinforcement Learning
by: Cherukuri, Kalyan, et al.
Published: (2025) -
Low-Rank Matrix Approximation for Neural Network Compression
by: Cherukuri, Kalyan, et al.
Published: (2025) -
Pareto-Optimal Learning from Preferences with Hidden Context
by: Bahlous-Boldi, Ryan, et al.
Published: (2024) -
Optimal Transport for LLM Reward Modeling from Noisy Preference
by: Pan, Licheng, et al.
Published: (2026)