PrefPoE: Advantage-Guided Preference Fusion for Learning Where to Explore
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Zhihao, Wu, Lin, Tian, Zhen, Lan, Jianglin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Conflicts-free, Speed-lossless KAN-based Reinforcement Learning Decision System for Interactive Driving in Roundabouts
by: Lin, Zhihao, et al.
Published: (2024)
by: Lin, Zhihao, et al.
Published: (2024)
FedPref: Federated Learning Across Heterogeneous Multi-objective Preferences
by: Hartmann, Maria, et al.
Published: (2025)
by: Hartmann, Maria, et al.
Published: (2025)
Pref-GUIDE Dataset
by: Ji, Zhengran
Published: (2025)
by: Ji, Zhengran
Published: (2025)
Efficient model predictive control for nonlinear systems modelled by deep neural networks
by: Lan, Jianglin
Published: (2024)
by: Lan, Jianglin
Published: (2024)
Crowd-PrefRL: Preference-Based Reward Learning from Crowds
by: Chhan, David, et al.
Published: (2024)
by: Chhan, David, et al.
Published: (2024)
Pref-GUIDE: Continual Policy Learning from Real-Time Human Feedback via Preference-Based Learning
by: Ji, Zhengran, et al.
Published: (2025)
by: Ji, Zhengran, et al.
Published: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
by: Liu, Tenglong, et al.
Published: (2024)
by: Liu, Tenglong, et al.
Published: (2024)
Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment
by: Cho, Youngjae, et al.
Published: (2026)
by: Cho, Youngjae, et al.
Published: (2026)
Real-Time Safe Control of Neural Network Dynamic Models with Sound Approximation
by: Hu, Hanjiang, et al.
Published: (2024)
by: Hu, Hanjiang, et al.
Published: (2024)
ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning
by: Ren, Qingnan, et al.
Published: (2026)
by: Ren, Qingnan, et al.
Published: (2026)
PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations
by: Lei, Yingjie
Published: (2026)
by: Lei, Yingjie
Published: (2026)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
by: Fei, Wu, et al.
Published: (2025)
by: Fei, Wu, et al.
Published: (2025)
Preference-Guided Reinforcement Learning for Efficient Exploration
by: Wang, Guojian, et al.
Published: (2024)
by: Wang, Guojian, et al.
Published: (2024)
Taming OOD Actions for Offline Reinforcement Learning: An Advantage-Based Approach
by: Chen, Xuyang, et al.
Published: (2025)
by: Chen, Xuyang, et al.
Published: (2025)
Advantage-Guided Diffusion for Model-Based Reinforcement Learning
by: Foffano, Daniele, et al.
Published: (2026)
by: Foffano, Daniele, et al.
Published: (2026)
Runtime Monitoring and Fault Detection for Neural Network-Controlled Systems
by: Lan, Jianglin, et al.
Published: (2024)
by: Lan, Jianglin, et al.
Published: (2024)
Operator-Guided Invariance Learning for Continuous Reinforcement Learning
by: Zhang, Zuyuan, et al.
Published: (2026)
by: Zhang, Zuyuan, et al.
Published: (2026)
An Advantage-based Optimization Method for Reinforcement Learning in Large Action Space
by: Lin, Hai, et al.
Published: (2024)
by: Lin, Hai, et al.
Published: (2024)
Memory-Based Advantage Shaping for LLM-Guided Reinforcement Learning
by: Nourzad, Narjes, et al.
Published: (2026)
by: Nourzad, Narjes, et al.
Published: (2026)
Grower-in-the-Loop Interactive Reinforcement Learning for Greenhouse Climate Control
by: Xiao, Maxiu, et al.
Published: (2025)
by: Xiao, Maxiu, et al.
Published: (2025)
Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time
by: Lan, Yifan, et al.
Published: (2025)
by: Lan, Yifan, et al.
Published: (2025)
Enhanced Visual SLAM for Collision-free Driving with Lightweight Autonomous Cars
by: Lin, Zhihao, et al.
Published: (2024)
by: Lin, Zhihao, et al.
Published: (2024)
Where to Mask: Structure-Guided Masking for Graph Masked Autoencoders
by: Liu, Chuang, et al.
Published: (2024)
by: Liu, Chuang, et al.
Published: (2024)
E2E Learning Massive MIMO for Multimodal Semantic Non-Orthogonal Transmission and Fusion
by: Wu, Minghui, et al.
Published: (2025)
by: Wu, Minghui, et al.
Published: (2025)
InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization
by: Li, Yu, et al.
Published: (2025)
by: Li, Yu, et al.
Published: (2025)
AVP-Fusion: Adaptive Multi-Modal Fusion and Contrastive Learning for Two-Stage Antiviral Peptide Identification
by: Wen, Xinru, et al.
Published: (2025)
by: Wen, Xinru, et al.
Published: (2025)
Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning
by: Fang, Yangyi, et al.
Published: (2026)
by: Fang, Yangyi, et al.
Published: (2026)
SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph
by: Li, Jiazheng, et al.
Published: (2025)
by: Li, Jiazheng, et al.
Published: (2025)
Provably Robust and Plausible Counterfactual Explanations for Neural Networks via Robust Optimisation
by: Jiang, Junqi, et al.
Published: (2023)
by: Jiang, Junqi, et al.
Published: (2023)
Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences
by: Liu, Ziang, et al.
Published: (2024)
by: Liu, Ziang, et al.
Published: (2024)
Where to Build Food Banks and Pantries: A Two-Level Machine Learning Approach
by: Ruan, Gavin, et al.
Published: (2024)
by: Ruan, Gavin, et al.
Published: (2024)
Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning
by: Diwan, Nirav, et al.
Published: (2025)
by: Diwan, Nirav, et al.
Published: (2025)
Decoding Motor Behavior Using Deep Learning and Reservoir Computing
by: Lan, Tian
Published: (2025)
by: Lan, Tian
Published: (2025)
Where to Steer: Input-Dependent Layer Selection for Steering Improves LLM Alignment
by: Gadgil, Soham, et al.
Published: (2026)
by: Gadgil, Soham, et al.
Published: (2026)
Private PoEtry: Private In-Context Learning via Product of Experts
by: Romijnders, Rob, et al.
Published: (2026)
by: Romijnders, Rob, et al.
Published: (2026)
Path Learning with Trajectory Advantage Regression
by: Miyaguchi, Kohei
Published: (2025)
by: Miyaguchi, Kohei
Published: (2025)
LAD: Learning Advantage Distribution for Reasoning
by: Li, Wendi, et al.
Published: (2026)
by: Li, Wendi, et al.
Published: (2026)
Knowledge Gradient for Preference Learning
by: Wu, Kaiwen, et al.
Published: (2026)
by: Wu, Kaiwen, et al.
Published: (2026)
PoCo: Policy Composition from and for Heterogeneous Robot Learning
by: Wang, Lirui, et al.
Published: (2024)
by: Wang, Lirui, et al.
Published: (2024)
Your Group-Relative Advantage Is Biased
by: Yang, Fengkai, et al.
Published: (2026)
by: Yang, Fengkai, et al.
Published: (2026)
Similar Items
-
A Conflicts-free, Speed-lossless KAN-based Reinforcement Learning Decision System for Interactive Driving in Roundabouts
by: Lin, Zhihao, et al.
Published: (2024) -
FedPref: Federated Learning Across Heterogeneous Multi-objective Preferences
by: Hartmann, Maria, et al.
Published: (2025) -
Pref-GUIDE Dataset
by: Ji, Zhengran
Published: (2025) -
Efficient model predictive control for nonlinear systems modelled by deep neural networks
by: Lan, Jianglin
Published: (2024) -
Crowd-PrefRL: Preference-Based Reward Learning from Crowds
by: Chhan, David, et al.
Published: (2024)