STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Luan, Yao, Mu, Ni, Yang, Yiqin, Xu, Bo, Jia, Qing-Shan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Preference-based Multi-Objective Reinforcement Learning
by: Mu, Ni, et al.
Published: (2025)
by: Mu, Ni, et al.
Published: (2025)
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
by: Mu, Ni, et al.
Published: (2025)
by: Mu, Ni, et al.
Published: (2025)
COLLIE: Guiding Skill Discovery in Semantically Coherent Latent Space
by: Luan, Yao, et al.
Published: (2026)
by: Luan, Yao, et al.
Published: (2026)
Query-Policy Misalignment in Preference-Based Reinforcement Learning
by: Hu, Xiao, et al.
Published: (2023)
by: Hu, Xiao, et al.
Published: (2023)
S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning
by: Mu, Ni, et al.
Published: (2024)
by: Mu, Ni, et al.
Published: (2024)
SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks
by: Shen, Pengbo, et al.
Published: (2025)
by: Shen, Pengbo, et al.
Published: (2025)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
MrCoM: A Meta-Regularized World-Model Generalizing Across Multi-Scenarios
by: Xiong, Xuantang, et al.
Published: (2025)
by: Xiong, Xuantang, et al.
Published: (2025)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
by: Bai, Fengshuo, et al.
Published: (2024)
by: Bai, Fengshuo, et al.
Published: (2024)
Reinforcement Learning from Diverse Human Preferences
by: Xue, Wanqi, et al.
Published: (2023)
by: Xue, Wanqi, et al.
Published: (2023)
Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences
by: Liu, Ziang, et al.
Published: (2024)
by: Liu, Ziang, et al.
Published: (2024)
Beyond Prior Limits: Addressing Distribution Misalignment in Particle Filtering
by: Shi, Yiwei, et al.
Published: (2025)
by: Shi, Yiwei, et al.
Published: (2025)
Imitation Learning from a Single Temporally Misaligned Video
by: Huey, William, et al.
Published: (2025)
by: Huey, William, et al.
Published: (2025)
Forward KL Regularized Preference Optimization for Aligning Diffusion Policies
by: Shan, Zhao, et al.
Published: (2024)
by: Shan, Zhao, et al.
Published: (2024)
Towards Precise Action Spotting: Addressing Temporal Misalignment in Labels with Dynamic Label Assignment
by: Tamura, Masato
Published: (2025)
by: Tamura, Masato
Published: (2025)
LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation
by: Tan, Heng, et al.
Published: (2025)
by: Tan, Heng, et al.
Published: (2025)
Fewer May Be Better: Enhancing Offline Reinforcement Learning with Reduced Dataset
by: Yang, Yiqin, et al.
Published: (2025)
by: Yang, Yiqin, et al.
Published: (2025)
Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
by: Nguyen, Thanh Thi, et al.
Published: (2025)
by: Nguyen, Thanh Thi, et al.
Published: (2025)
TARDIS: Mitigating Temporal Misalignment via Representation Steering
by: Shin, Changho, et al.
Published: (2025)
by: Shin, Changho, et al.
Published: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
by: Gao, Chen-Xiao, et al.
Published: (2024)
by: Gao, Chen-Xiao, et al.
Published: (2024)
Temporal Misalignment Attacks against Multimodal Perception in Autonomous Driving
by: Shahriar, Md Hasan, et al.
Published: (2025)
by: Shahriar, Md Hasan, et al.
Published: (2025)
DPMT: Dual Process Multi-scale Theory of Mind Framework for Real-time Human-AI Collaboration
by: Li, Xiyun, et al.
Published: (2025)
by: Li, Xiyun, et al.
Published: (2025)
PAF-Net: Phase-Aligned Frequency Decoupling Network for Multi-Process Manufacturing Quality Prediction
by: Luo, Yang, et al.
Published: (2025)
by: Luo, Yang, et al.
Published: (2025)
Exploring and Addressing Reward Confusion in Offline Preference Learning
by: Chen, Xin, et al.
Published: (2024)
by: Chen, Xin, et al.
Published: (2024)
Episodic Novelty Through Temporal Distance
by: Jiang, Yuhua, et al.
Published: (2025)
by: Jiang, Yuhua, et al.
Published: (2025)
SHAP-Guided Kernel Actor-Critic for Explainable Reinforcement Learning
by: Li, Na, et al.
Published: (2025)
by: Li, Na, et al.
Published: (2025)
From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning
by: Yang, Jun-Jie, et al.
Published: (2026)
by: Yang, Jun-Jie, et al.
Published: (2026)
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
by: Yang, Ningyuan, et al.
Published: (2026)
by: Yang, Ningyuan, et al.
Published: (2026)
Representation Learning Enhanced Deep Reinforcement Learning for Optimal Operation of Hydrogen-based Multi-Energy Systems
by: Pu, Zhenyu, et al.
Published: (2026)
by: Pu, Zhenyu, et al.
Published: (2026)
Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropy
by: Jeong, Wooseong, et al.
Published: (2026)
by: Jeong, Wooseong, et al.
Published: (2026)
Combinatorial Reinforcement Learning with Preference Feedback
by: Lee, Joongkyu, et al.
Published: (2025)
by: Lee, Joongkyu, et al.
Published: (2025)
Target-Aligned Reinforcement Learning
by: Pleiss, Leonard S., et al.
Published: (2026)
by: Pleiss, Leonard S., et al.
Published: (2026)
Addressing Rotational Learning Dynamics in Multi-Agent Reinforcement Learning
by: Sidahmed, Baraah A. M., et al.
Published: (2024)
by: Sidahmed, Baraah A. M., et al.
Published: (2024)
Active Advantage-Aligned Online Reinforcement Learning with Offline Data
by: Liu, Xuefeng, et al.
Published: (2025)
by: Liu, Xuefeng, et al.
Published: (2025)
Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning
by: Zhou, Qin, et al.
Published: (2026)
by: Zhou, Qin, et al.
Published: (2026)
VAO: Validation-Aligned Optimization for Cross-Task Generative Auto-Bidding
by: Lv, Yiqin, et al.
Published: (2025)
by: Lv, Yiqin, et al.
Published: (2025)
Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning
by: Ghosh, Udita, et al.
Published: (2025)
by: Ghosh, Udita, et al.
Published: (2025)
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
by: Hu, Hao, et al.
Published: (2024)
by: Hu, Hao, et al.
Published: (2024)
RTLSeek: Boosting the LLM-Based RTL Generation with Multi-Stage Diversity-Oriented Reinforcement Learning
by: Zhang, Xinyu, et al.
Published: (2026)
by: Zhang, Xinyu, et al.
Published: (2026)
General Preference Reinforcement Learning
by: Umer, Muhammad, et al.
Published: (2026)
by: Umer, Muhammad, et al.
Published: (2026)
Similar Items
-
Preference-based Multi-Objective Reinforcement Learning
by: Mu, Ni, et al.
Published: (2025) -
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
by: Mu, Ni, et al.
Published: (2025) -
COLLIE: Guiding Skill Discovery in Semantically Coherent Latent Space
by: Luan, Yao, et al.
Published: (2026) -
Query-Policy Misalignment in Preference-Based Reinforcement Learning
by: Hu, Xiao, et al.
Published: (2023) -
S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning
by: Mu, Ni, et al.
Published: (2024)