Fairness Begins with State: Purifying Latent Preferences for Hierarchical Reinforcement Learning in Interactive Recommendation
Fuente:
arXiv
Saved in:
| Main Authors: | Lu, Yun, Shi, Xiaoyu, Xie, Hong, Zhao, Xiangyu, Shang, Mingsheng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Revisiting Fairness-aware Interactive Recommendation: Item Lifecycle as a Control Knob
by: Lu, Yun, et al.
Published: (2025)
by: Lu, Yun, et al.
Published: (2025)
Proactive Guiding Strategy for Item-side Fairness in Interactive Recommendation
by: Xia, Chongjun, et al.
Published: (2026)
by: Xia, Chongjun, et al.
Published: (2026)
PRISM: Purified Representation and Integrated Semantic Modeling for Generative Sequential Recommendation
by: Fang, Dengzhao, et al.
Published: (2026)
by: Fang, Dengzhao, et al.
Published: (2026)
Deep Reinforcement Learning from Hierarchical Preference Design
by: Bukharin, Alexander, et al.
Published: (2023)
by: Bukharin, Alexander, et al.
Published: (2023)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
by: Hong, Ilgee, et al.
Published: (2024)
by: Hong, Ilgee, et al.
Published: (2024)
Adapting Job Recommendations to User Preference Drift with Behavioral-Semantic Fusion Learning
by: Han, Xiao, et al.
Published: (2024)
by: Han, Xiao, et al.
Published: (2024)
SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization
by: Li, Jiashun, et al.
Published: (2026)
by: Li, Jiashun, et al.
Published: (2026)
FairPO: Robust Preference Optimization for Fair Multi-Label Learning
by: Mondal, Soumen Kumar, et al.
Published: (2025)
by: Mondal, Soumen Kumar, et al.
Published: (2025)
RLVR-World: Training World Models with Reinforcement Learning
by: Wu, Jialong, et al.
Published: (2025)
by: Wu, Jialong, et al.
Published: (2025)
Hierarchical Reinforcement Learning for Temporal Abstraction of Listwise Recommendation
by: Ji, Luo, et al.
Published: (2024)
by: Ji, Luo, et al.
Published: (2024)
Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids
by: Xiao, Qingyu, et al.
Published: (2025)
by: Xiao, Qingyu, et al.
Published: (2025)
Purifying Shampoo: Investigating Shampoo's Heuristics by Decomposing its Preconditioner
by: Eschenhagen, Runa, et al.
Published: (2025)
by: Eschenhagen, Runa, et al.
Published: (2025)
From Efficiency to Equity: Measuring Fairness in Preference Learning
by: Gowaikar, Shreeyash, et al.
Published: (2024)
by: Gowaikar, Shreeyash, et al.
Published: (2024)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
by: Gao, Chen-Xiao, et al.
Published: (2024)
by: Gao, Chen-Xiao, et al.
Published: (2024)
Striking a Balance in Fairness for Dynamic Systems Through Reinforcement Learning
by: Hu, Yaowei, et al.
Published: (2024)
by: Hu, Yaowei, et al.
Published: (2024)
Do LLMs Recognize Your Latent Preferences? A Benchmark for Latent Information Discovery in Personalized Interaction
by: Tsaknakis, Ioannis, et al.
Published: (2025)
by: Tsaknakis, Ioannis, et al.
Published: (2025)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
by: Gao, Xiancheng, et al.
Published: (2025)
by: Gao, Xiancheng, et al.
Published: (2025)
Semantic-guided Representation Learning for Multi-Label Recognition
by: Zhang, Ruhui, et al.
Published: (2025)
by: Zhang, Ruhui, et al.
Published: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
by: Qu, Yun, et al.
Published: (2024)
by: Qu, Yun, et al.
Published: (2024)
Efficient and Generalized end-to-end Autonomous Driving System with Latent Deep Reinforcement Learning and Demonstrations
by: Tang, Zuojin, et al.
Published: (2024)
by: Tang, Zuojin, et al.
Published: (2024)
Learning Discrete Concepts in Latent Hierarchical Models
by: Kong, Lingjing, et al.
Published: (2024)
by: Kong, Lingjing, et al.
Published: (2024)
Fair In-Context Learning via Latent Concept Variables
by: Bhaila, Karuna, et al.
Published: (2024)
by: Bhaila, Karuna, et al.
Published: (2024)
Preference Elicitation for Offline Reinforcement Learning
by: Pace, Alizée, et al.
Published: (2024)
by: Pace, Alizée, et al.
Published: (2024)
FairDICE: Fairness-Driven Offline Multi-Objective Reinforcement Learning
by: Kim, Woosung, et al.
Published: (2025)
by: Kim, Woosung, et al.
Published: (2025)
APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
by: Srewa, Mahmoud, et al.
Published: (2026)
by: Srewa, Mahmoud, et al.
Published: (2026)
Exploring the Edges of Latent State Clusters for Goal-Conditioned Reinforcement Learning
by: Duan, Yuanlin, et al.
Published: (2024)
by: Duan, Yuanlin, et al.
Published: (2024)
Group Fairness in Multi-Task Reinforcement Learning
by: Song, Kefan, et al.
Published: (2025)
by: Song, Kefan, et al.
Published: (2025)
Offline Reinforcement Learning in Large State Spaces: Algorithms and Guarantees
by: Jiang, Nan, et al.
Published: (2025)
by: Jiang, Nan, et al.
Published: (2025)
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
by: Lu, Yuxiao, et al.
Published: (2023)
by: Lu, Yuxiao, et al.
Published: (2023)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
by: Zhang, Tianle, et al.
Published: (2024)
by: Zhang, Tianle, et al.
Published: (2024)
Hierarchical Reinforcement Learning for Swarm Confrontation with High Uncertainty
by: Wu, Qizhen, et al.
Published: (2024)
by: Wu, Qizhen, et al.
Published: (2024)
Behavior Preference Regression for Offline Reinforcement Learning
by: Srinivasan, Padmanaba, et al.
Published: (2025)
by: Srinivasan, Padmanaba, et al.
Published: (2025)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
by: Tu, Songjun, et al.
Published: (2024)
by: Tu, Songjun, et al.
Published: (2024)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
by: Shianifar, Jonaid, et al.
Published: (2026)
by: Shianifar, Jonaid, et al.
Published: (2026)
Self-Supervised Spatial-Temporal Normality Learning for Time Series Anomaly Detection
by: Chen, Yutong, et al.
Published: (2024)
by: Chen, Yutong, et al.
Published: (2024)
What Do Latent Action Models Actually Learn?
by: Zhang, Chuheng, et al.
Published: (2025)
by: Zhang, Chuheng, et al.
Published: (2025)
BPL: Bias-adaptive Preference Distillation Learning for Recommender System
by: Kang, SeongKu, et al.
Published: (2025)
by: Kang, SeongKu, et al.
Published: (2025)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
by: Cheng, Jie, et al.
Published: (2024)
by: Cheng, Jie, et al.
Published: (2024)
Constructing Fair Latent Space for Intersection of Fairness and Explainability
by: Joo, Hyungjun, et al.
Published: (2024)
by: Joo, Hyungjun, et al.
Published: (2024)
Similar Items
-
Revisiting Fairness-aware Interactive Recommendation: Item Lifecycle as a Control Knob
by: Lu, Yun, et al.
Published: (2025) -
Proactive Guiding Strategy for Item-side Fairness in Interactive Recommendation
by: Xia, Chongjun, et al.
Published: (2026) -
PRISM: Purified Representation and Integrated Semantic Modeling for Generative Sequential Recommendation
by: Fang, Dengzhao, et al.
Published: (2026) -
Deep Reinforcement Learning from Hierarchical Preference Design
by: Bukharin, Alexander, et al.
Published: (2023) -
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
by: Hong, Ilgee, et al.
Published: (2024)