S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Mu, Ni, Luan, Yao, Yang, Yiqin, Xu, Bo, Jia, Qing-shan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
by: Luan, Yao, et al.
Published: (2025)
by: Luan, Yao, et al.
Published: (2025)
Preference-based Multi-Objective Reinforcement Learning
by: Mu, Ni, et al.
Published: (2025)
by: Mu, Ni, et al.
Published: (2025)
DAIL: Beyond Task Ambiguity for Language-Conditioned Reinforcement Learning
by: Xie, Runpeng, et al.
Published: (2025)
by: Xie, Runpeng, et al.
Published: (2025)
COLLIE: Guiding Skill Discovery in Semantically Coherent Latent Space
by: Luan, Yao, et al.
Published: (2026)
by: Luan, Yao, et al.
Published: (2026)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
by: Mu, Ni, et al.
Published: (2025)
by: Mu, Ni, et al.
Published: (2025)
MrCoM: A Meta-Regularized World-Model Generalizing Across Multi-Scenarios
by: Xiong, Xuantang, et al.
Published: (2025)
by: Xiong, Xuantang, et al.
Published: (2025)
ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning
by: Wang, Jinpeng, et al.
Published: (2025)
by: Wang, Jinpeng, et al.
Published: (2025)
GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution
by: Yang, Yutao, et al.
Published: (2026)
by: Yang, Yutao, et al.
Published: (2026)
Learning Reward for Robot Skills Using Large Language Models via Self-Alignment
by: Zeng, Yuwei, et al.
Published: (2024)
by: Zeng, Yuwei, et al.
Published: (2024)
Breaking the Symmetries of Indistinguishable Objects
by: Akgun, Ozgur, et al.
Published: (2025)
by: Akgun, Ozgur, et al.
Published: (2025)
Bypassing DARCY Defense: Indistinguishable Universal Adversarial Triggers
by: Peng, Zuquan, et al.
Published: (2024)
by: Peng, Zuquan, et al.
Published: (2024)
End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
by: Chen, Guanzhong, et al.
Published: (2025)
by: Chen, Guanzhong, et al.
Published: (2025)
Learning to Align Human Code Preferences
by: Yin, Xin, et al.
Published: (2025)
by: Yin, Xin, et al.
Published: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
by: Gao, Chen-Xiao, et al.
Published: (2024)
by: Gao, Chen-Xiao, et al.
Published: (2024)
Reinforcement Learning for Self-Improving Agent with Skill Library
by: Wang, Jiongxiao, et al.
Published: (2025)
by: Wang, Jiongxiao, et al.
Published: (2025)
Constructive Conflict-Driven Multi-Agent Reinforcement Learning for Strategic Diversity
by: Mai, Yuxiang, et al.
Published: (2025)
by: Mai, Yuxiang, et al.
Published: (2025)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
by: Gao, Longxi, et al.
Published: (2025)
by: Gao, Longxi, et al.
Published: (2025)
Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning
by: Chen, Chishui, et al.
Published: (2026)
by: Chen, Chishui, et al.
Published: (2026)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
by: Bai, Fengshuo, et al.
Published: (2024)
by: Bai, Fengshuo, et al.
Published: (2024)
SkillEvolver: Skill Learning as a Meta-Skill
by: Zhang, Genrui, et al.
Published: (2026)
by: Zhang, Genrui, et al.
Published: (2026)
Learning to Plan & Schedule with Reinforcement-Learned Bimanual Robot Skills
by: Wan, Weikang, et al.
Published: (2025)
by: Wan, Weikang, et al.
Published: (2025)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
by: Xu, Yinglun, et al.
Published: (2023)
by: Xu, Yinglun, et al.
Published: (2023)
MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
by: Huang, Kun, et al.
Published: (2025)
by: Huang, Kun, et al.
Published: (2025)
Skill-Critic: Refining Learned Skills for Hierarchical Reinforcement Learning
by: Hao, Ce, et al.
Published: (2023)
by: Hao, Ce, et al.
Published: (2023)
PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
by: Driss, Brahim, et al.
Published: (2025)
by: Driss, Brahim, et al.
Published: (2025)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
by: Gao, Xiancheng, et al.
Published: (2025)
by: Gao, Xiancheng, et al.
Published: (2025)
StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
by: Zhang, Yanfei, et al.
Published: (2026)
by: Zhang, Yanfei, et al.
Published: (2026)
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
by: Shi, Yaorui, et al.
Published: (2026)
by: Shi, Yaorui, et al.
Published: (2026)
SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks
by: Wen, Yongyan, et al.
Published: (2024)
by: Wen, Yongyan, et al.
Published: (2024)
LRHP: Learning Representations for Human Preferences via Preference Pairs
by: Wang, Chenglong, et al.
Published: (2024)
by: Wang, Chenglong, et al.
Published: (2024)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
by: Ambadkar, Tanmay, et al.
Published: (2026)
by: Ambadkar, Tanmay, et al.
Published: (2026)
Kernel-Based Distributed Q-Learning: A Scalable Reinforcement Learning Approach for Dynamic Treatment Regimes
by: Wang, Di, et al.
Published: (2023)
by: Wang, Di, et al.
Published: (2023)
PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments
by: Liu, Shuochen, et al.
Published: (2026)
by: Liu, Shuochen, et al.
Published: (2026)
AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model
by: Dong, Zibin, et al.
Published: (2023)
by: Dong, Zibin, et al.
Published: (2023)
When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning?
by: Mu, Tongzhou, et al.
Published: (2024)
by: Mu, Tongzhou, et al.
Published: (2024)
Phase Transitions as the Breakdown of Statistical Indistinguishability
by: Narita, Taiyo, et al.
Published: (2026)
by: Narita, Taiyo, et al.
Published: (2026)
Provable Reward-Agnostic Preference-Based Reinforcement Learning
by: Zhan, Wenhao, et al.
Published: (2023)
by: Zhan, Wenhao, et al.
Published: (2023)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
by: Tu, Songjun, et al.
Published: (2024)
by: Tu, Songjun, et al.
Published: (2024)
Similar Items
-
STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
by: Luan, Yao, et al.
Published: (2025) -
Preference-based Multi-Objective Reinforcement Learning
by: Mu, Ni, et al.
Published: (2025) -
DAIL: Beyond Task Ambiguity for Language-Conditioned Reinforcement Learning
by: Xie, Runpeng, et al.
Published: (2025) -
COLLIE: Guiding Skill Discovery in Semantically Coherent Latent Space
by: Luan, Yao, et al.
Published: (2026) -
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
by: Yang, Yiqin, et al.
Published: (2026)