Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
Fuente:
arXiv
Saved in:
| Main Authors: | Bai, Fengshuo, Zhao, Rui, Zhang, Hongming, Cui, Sijia, Wen, Ying, Yang, Yaodong, Xu, Bo, Han, Lei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Model-agnostic Alignment via Bayesian Persuasion
by: Bai, Fengshuo, et al.
Published: (2024)
by: Bai, Fengshuo, et al.
Published: (2024)
Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall
by: Cui, Sijia, et al.
Published: (2025)
by: Cui, Sijia, et al.
Published: (2025)
ValueDCG: Measuring Comprehensive Human Value Understanding Ability of Language Models
by: Zhang, Zhaowei, et al.
Published: (2023)
by: Zhang, Zhaowei, et al.
Published: (2023)
RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors
by: Bai, Fengshuo, et al.
Published: (2024)
by: Bai, Fengshuo, et al.
Published: (2024)
Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs
by: Zhang, Zhaowei, et al.
Published: (2025)
by: Zhang, Zhaowei, et al.
Published: (2025)
AlignSum: Data Pyramid Hierarchical Fine-tuning for Aligning with Human Summarization Preference
by: Han, Yang, et al.
Published: (2024)
by: Han, Yang, et al.
Published: (2024)
Evaluating and Aligning CodeLLMs on Human Preference
by: Yang, Jian, et al.
Published: (2024)
by: Yang, Jian, et al.
Published: (2024)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
by: Wang, Hao, et al.
Published: (2026)
by: Wang, Hao, et al.
Published: (2026)
Preference Distillation via Value based Reinforcement Learning
by: Kwon, Minchan, et al.
Published: (2025)
by: Kwon, Minchan, et al.
Published: (2025)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
by: Liao, Huan, et al.
Published: (2024)
by: Liao, Huan, et al.
Published: (2024)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
by: Xia, Han, et al.
Published: (2024)
by: Xia, Han, et al.
Published: (2024)
StoryLens: Preference-Aligned Story Rewriting via Context-Aware Narrative Enrichment
by: Cui, Hanwen, et al.
Published: (2026)
by: Cui, Hanwen, et al.
Published: (2026)
PLOT: Enhancing Preference Learning via Optimal Transport
by: Zhu, Liang, et al.
Published: (2026)
by: Zhu, Liang, et al.
Published: (2026)
Panacea: Pareto Alignment via Preference Adaptation for LLMs
by: Zhong, Yifan, et al.
Published: (2024)
by: Zhong, Yifan, et al.
Published: (2024)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
by: Liu, Yantao, et al.
Published: (2024)
by: Liu, Yantao, et al.
Published: (2024)
Minority-Aware Satisfaction Estimation in Dialogue Systems via Preference-Adaptive Reinforcement Learning
by: Fu, Yahui, et al.
Published: (2025)
by: Fu, Yahui, et al.
Published: (2025)
M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization
by: Bai, Bizhe, et al.
Published: (2025)
by: Bai, Bizhe, et al.
Published: (2025)
Aligning LLMs through Multi-perspective User Preference Ranking-based Feedback for Programming Question Answering
by: Yang, Hongyu, et al.
Published: (2024)
by: Yang, Hongyu, et al.
Published: (2024)
SimulPL: Aligning Human Preferences in Simultaneous Machine Translation
by: Yu, Donglei, et al.
Published: (2025)
by: Yu, Donglei, et al.
Published: (2025)
$β$-DQN: Improving Deep Q-Learning By Evolving the Behavior
by: Zhang, Hongming, et al.
Published: (2025)
by: Zhang, Hongming, et al.
Published: (2025)
Not All Preference Pairs Are Created Equal: A Recipe for Annotation-Efficient Iterative Preference Learning
by: Yang, Sen, et al.
Published: (2024)
by: Yang, Sen, et al.
Published: (2024)
Retrieval Dexterity: Efficient Object Retrieval in Clutters with Dexterous Hand
by: Bai, Fengshuo, et al.
Published: (2025)
by: Bai, Fengshuo, et al.
Published: (2025)
Tool Retrieval Bridge: Aligning Vague Instructions with Retriever Preferences via Bridge Model
by: Chen, Kunfeng, et al.
Published: (2026)
by: Chen, Kunfeng, et al.
Published: (2026)
Aligning Agentic World Models via Knowledgeable Experience Learning
by: Ren, Baochang, et al.
Published: (2026)
by: Ren, Baochang, et al.
Published: (2026)
TUMS: Enhancing Tool-use Abilities of LLMs with Multi-structure Handlers
by: He, Aiyao, et al.
Published: (2025)
by: He, Aiyao, et al.
Published: (2025)
Empowering LLMs with Parameterized Skills for Adversarial Long-Horizon Planning
by: Cui, Sijia, et al.
Published: (2025)
by: Cui, Sijia, et al.
Published: (2025)
From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning
by: zhang, Ranxu, et al.
Published: (2026)
by: zhang, Ranxu, et al.
Published: (2026)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
by: Bu, Yuyan, et al.
Published: (2026)
by: Bu, Yuyan, et al.
Published: (2026)
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
by: Zheng, Tong, et al.
Published: (2025)
by: Zheng, Tong, et al.
Published: (2025)
Aligning to Thousands of Preferences via System Message Generalization
by: Lee, Seongyun, et al.
Published: (2024)
by: Lee, Seongyun, et al.
Published: (2024)
Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes
by: Gong, Zhuocheng, et al.
Published: (2025)
by: Gong, Zhuocheng, et al.
Published: (2025)
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
by: Yang, Ningyuan, et al.
Published: (2026)
by: Yang, Ningyuan, et al.
Published: (2026)
Aligning Paralinguistic Understanding and Generation in Speech LLMs via Multi-Task Reinforcement Learning
by: Chen, Jingxiang, et al.
Published: (2026)
by: Chen, Jingxiang, et al.
Published: (2026)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
by: Zhou, Yiyang, et al.
Published: (2024)
by: Zhou, Yiyang, et al.
Published: (2024)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
by: Shen, Jingyan, et al.
Published: (2025)
by: Shen, Jingyan, et al.
Published: (2025)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
by: Lou, Hantao, et al.
Published: (2025)
by: Lou, Hantao, et al.
Published: (2025)
From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning
by: Zhang, Shihao, et al.
Published: (2026)
by: Zhang, Shihao, et al.
Published: (2026)
Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning
by: Ma, Weiyu, et al.
Published: (2026)
by: Ma, Weiyu, et al.
Published: (2026)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
by: Deng, Qiyuan, et al.
Published: (2025)
by: Deng, Qiyuan, et al.
Published: (2025)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
by: Zhu, Wenhong, et al.
Published: (2024)
by: Zhu, Wenhong, et al.
Published: (2024)
Similar Items
-
Efficient Model-agnostic Alignment via Bayesian Persuasion
by: Bai, Fengshuo, et al.
Published: (2024) -
Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall
by: Cui, Sijia, et al.
Published: (2025) -
ValueDCG: Measuring Comprehensive Human Value Understanding Ability of Language Models
by: Zhang, Zhaowei, et al.
Published: (2023) -
RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors
by: Bai, Fengshuo, et al.
Published: (2024) -
Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs
by: Zhang, Zhaowei, et al.
Published: (2025)