Gespeichert in:
| Hauptverfasser: | Li, Long-Fei, Qian, Yu-Yang, Zhao, Peng, Zhou, Zhi-Hua |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2502.07193 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Provably Efficient Reinforcement Learning with Multinomial Logit Function Approximation
von: Li, Long-Fei, et al.
Veröffentlicht: (2024)
von: Li, Long-Fei, et al.
Veröffentlicht: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
Heavy-Tailed Linear Bandits: Huber Regression with One-Pass Update
von: Wang, Jing, et al.
Veröffentlicht: (2025)
von: Wang, Jing, et al.
Veröffentlicht: (2025)
Greedy Sampling Is Provably Efficient for RLHF
von: Wu, Di, et al.
Veröffentlicht: (2025)
von: Wu, Di, et al.
Veröffentlicht: (2025)
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs
von: Li, Long-Fei, et al.
Veröffentlicht: (2024)
von: Li, Long-Fei, et al.
Veröffentlicht: (2024)
Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit Feedback and Unknown Transition
von: Li, Long-Fei, et al.
Veröffentlicht: (2024)
von: Li, Long-Fei, et al.
Veröffentlicht: (2024)
Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
von: Zhao, Kangwen, et al.
Veröffentlicht: (2025)
von: Zhao, Kangwen, et al.
Veröffentlicht: (2025)
Efficient Methods for Non-stationary Online Learning
von: Zhao, Peng, et al.
Veröffentlicht: (2023)
von: Zhao, Peng, et al.
Veröffentlicht: (2023)
Reward-Robust RLHF in LLMs
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
Optimal Design for Reward Modeling in RLHF
von: Scheid, Antoine, et al.
Veröffentlicht: (2024)
von: Scheid, Antoine, et al.
Veröffentlicht: (2024)
Universal Online Learning with Gradient Variations: A Multi-layer Online Ensemble Approach
von: Yan, Yu-Hu, et al.
Veröffentlicht: (2023)
von: Yan, Yu-Hu, et al.
Veröffentlicht: (2023)
A Simple, Optimal and Efficient Algorithm for Online Exp-Concave Optimization
von: Wang, Yi-Han, et al.
Veröffentlicht: (2025)
von: Wang, Yi-Han, et al.
Veröffentlicht: (2025)
Policy Filtration for RLHF to Mitigate Noise in Reward Models
von: Zhang, Chuheng, et al.
Veröffentlicht: (2024)
von: Zhang, Chuheng, et al.
Veröffentlicht: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
How to Evaluate Reward Models for RLHF
von: Frick, Evan, et al.
Veröffentlicht: (2024)
von: Frick, Evan, et al.
Veröffentlicht: (2024)
Factored Causal Representation Learning for Robust Reward Modeling in RLHF
von: Yang, Yupei, et al.
Veröffentlicht: (2026)
von: Yang, Yupei, et al.
Veröffentlicht: (2026)
Optimistic Online-to-Batch Conversions for Accelerated Convergence and Universality
von: Yan, Yu-Hu, et al.
Veröffentlicht: (2025)
von: Yan, Yu-Hu, et al.
Veröffentlicht: (2025)
Learning a Pessimistic Reward Model in RLHF
von: Xu, Yinglun, et al.
Veröffentlicht: (2025)
von: Xu, Yinglun, et al.
Veröffentlicht: (2025)
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
von: Dai, Juntao, et al.
Veröffentlicht: (2025)
von: Dai, Juntao, et al.
Veröffentlicht: (2025)
Reward Model Overoptimisation in Iterated RLHF
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
Can RLHF be More Efficient with Imperfect Reward Models? A Policy Coverage Perspective
von: Huang, Jiawei, et al.
Veröffentlicht: (2025)
von: Huang, Jiawei, et al.
Veröffentlicht: (2025)
TreeLoRA: Efficient Continual Learning via Layer-Wise LoRAs Guided by a Hierarchical Gradient-Similarity Tree
von: Qian, Yu-Yang, et al.
Veröffentlicht: (2025)
von: Qian, Yu-Yang, et al.
Veröffentlicht: (2025)
Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
von: Miao, Yuchun, et al.
Veröffentlicht: (2025)
von: Miao, Yuchun, et al.
Veröffentlicht: (2025)
Adaptivity and Non-stationarity: Problem-dependent Dynamic Regret for Online Convex Optimization
von: Zhao, Peng, et al.
Veröffentlicht: (2021)
von: Zhao, Peng, et al.
Veröffentlicht: (2021)
Adaptivity and Universality: Problem-dependent Universal Regret for Online Convex Optimization
von: Zhao, Peng, et al.
Veröffentlicht: (2025)
von: Zhao, Peng, et al.
Veröffentlicht: (2025)
One-Step Bellman Alignment Enables Provably Efficient Transfer in Online RL
von: Chen, Elynn, et al.
Veröffentlicht: (2026)
von: Chen, Elynn, et al.
Veröffentlicht: (2026)
Reward Generalization in RLHF: A Topological Perspective
von: Qiu, Tianyi, et al.
Veröffentlicht: (2024)
von: Qiu, Tianyi, et al.
Veröffentlicht: (2024)
Quantile Regression for Distributional Reward Models in RLHF
von: Dorka, Nicolai
Veröffentlicht: (2024)
von: Dorka, Nicolai
Veröffentlicht: (2024)
Gradient-Variation Online Learning under Generalized Smoothness
von: Xie, Yan-Feng, et al.
Veröffentlicht: (2024)
von: Xie, Yan-Feng, et al.
Veröffentlicht: (2024)
BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF
von: Duan, Kaiwen, et al.
Veröffentlicht: (2025)
von: Duan, Kaiwen, et al.
Veröffentlicht: (2025)
Accelerating RLHF Training with Reward Variance Increase
von: Yang, Zonglin, et al.
Veröffentlicht: (2025)
von: Yang, Zonglin, et al.
Veröffentlicht: (2025)
It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF
von: Lu, Taiming, et al.
Veröffentlicht: (2024)
von: Lu, Taiming, et al.
Veröffentlicht: (2024)
Provably Efficient Interactive-Grounded Learning with Personalized Reward
von: Zhang, Mengxiao, et al.
Veröffentlicht: (2024)
von: Zhang, Mengxiao, et al.
Veröffentlicht: (2024)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
von: Chen, Lichang, et al.
Veröffentlicht: (2024)
von: Chen, Lichang, et al.
Veröffentlicht: (2024)
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
von: Yang, Zhiqin, et al.
Veröffentlicht: (2026)
von: Yang, Zhiqin, et al.
Veröffentlicht: (2026)
A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization
von: Xu, Wenyuan, et al.
Veröffentlicht: (2025)
von: Xu, Wenyuan, et al.
Veröffentlicht: (2025)
Generalized Linear Bandits: Almost Optimal Regret with One-Pass Update
von: Zhang, Yu-Jie, et al.
Veröffentlicht: (2025)
von: Zhang, Yu-Jie, et al.
Veröffentlicht: (2025)
Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer
von: Liu, Zhihan, et al.
Veröffentlicht: (2024)
von: Liu, Zhihan, et al.
Veröffentlicht: (2024)
Robust Length Prediction: A Perspective from Heavy-Tailed Prompt-Conditioned Distributions
von: Wang, Jing, et al.
Veröffentlicht: (2026)
von: Wang, Jing, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Provably Efficient Reinforcement Learning with Multinomial Logit Function Approximation
von: Li, Long-Fei, et al.
Veröffentlicht: (2024) -
RLHF Workflow: From Reward Modeling to Online RLHF
von: Dong, Hanze, et al.
Veröffentlicht: (2024) -
Heavy-Tailed Linear Bandits: Huber Regression with One-Pass Update
von: Wang, Jing, et al.
Veröffentlicht: (2025) -
Greedy Sampling Is Provably Efficient for RLHF
von: Wu, Di, et al.
Veröffentlicht: (2025) -
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)