Thompson Sampling in Online RLHF with General Function Approximation
Fuente:
arXiv
Guardado en:
| Autores principales: | Feng, Songtao, Fu, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift
por: Li, Bochao, et al.
Publicado: (2026)
por: Li, Bochao, et al.
Publicado: (2026)
Online Learning of Decision Trees with Thompson Sampling
por: Chaouki, Ayman, et al.
Publicado: (2024)
por: Chaouki, Ayman, et al.
Publicado: (2024)
Thompson Sampling in Function Spaces via Neural Operators
por: Oliveira, Rafael, et al.
Publicado: (2025)
por: Oliveira, Rafael, et al.
Publicado: (2025)
Accelerating Approximate Thompson Sampling with Underdamped Langevin Monte Carlo
por: Zheng, Haoyang, et al.
Publicado: (2024)
por: Zheng, Haoyang, et al.
Publicado: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
por: Dong, Hanze, et al.
Publicado: (2024)
por: Dong, Hanze, et al.
Publicado: (2024)
Regularized Online RLHF with Generalized Bilinear Preferences
por: Lee, Junghyun, et al.
Publicado: (2026)
por: Lee, Junghyun, et al.
Publicado: (2026)
Rethinking Langevin Thompson Sampling from A Stochastic Approximation Perspective
por: Wang, Weixin, et al.
Publicado: (2025)
por: Wang, Weixin, et al.
Publicado: (2025)
Fast Online Learning with Gaussian Prior-Driven Hierarchical Unimodal Thompson Sampling
por: Zhao, Tianchi, et al.
Publicado: (2026)
por: Zhao, Tianchi, et al.
Publicado: (2026)
On The Global Convergence Of Online RLHF With Neural Parametrization
por: Gaur, Mudit, et al.
Publicado: (2024)
por: Gaur, Mudit, et al.
Publicado: (2024)
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
por: Xie, Tengyang, et al.
Publicado: (2024)
por: Xie, Tengyang, et al.
Publicado: (2024)
Online Robust Reinforcement Learning with General Function Approximation
por: Ghosh, Debamita, et al.
Publicado: (2025)
por: Ghosh, Debamita, et al.
Publicado: (2025)
Thompson Sampling for Repeated Newsvendor
por: Chen, Li, et al.
Publicado: (2025)
por: Chen, Li, et al.
Publicado: (2025)
Constrained Linear Thompson Sampling
por: Gangrade, Aditya, et al.
Publicado: (2025)
por: Gangrade, Aditya, et al.
Publicado: (2025)
Approximate Thompson Sampling for Learning Linear Quadratic Regulators with $O(\sqrt{T})$ Regret
por: Kim, Yeoneung, et al.
Publicado: (2024)
por: Kim, Yeoneung, et al.
Publicado: (2024)
Distilled Thompson Sampling: Practical and Efficient Thompson Sampling via Imitation Learning
por: Namkoong, Hongseok, et al.
Publicado: (2020)
por: Namkoong, Hongseok, et al.
Publicado: (2020)
Diffusion Approximations for Thompson Sampling in the Small Gap Regime
por: Fan, Lin, et al.
Publicado: (2021)
por: Fan, Lin, et al.
Publicado: (2021)
Regenerative Particle Thompson Sampling
por: Zhou, Zeyu, et al.
Publicado: (2022)
por: Zhou, Zeyu, et al.
Publicado: (2022)
Adaptive Data Augmentation for Thompson Sampling
por: Kim, Wonyoung
Publicado: (2025)
por: Kim, Wonyoung
Publicado: (2025)
A Broader View of Thompson Sampling
por: Qu, Yanlin, et al.
Publicado: (2025)
por: Qu, Yanlin, et al.
Publicado: (2025)
Contextual Thompson Sampling via Generation of Missing Data
por: Zhang, Kelly W., et al.
Publicado: (2025)
por: Zhang, Kelly W., et al.
Publicado: (2025)
Provably Efficient Online RLHF with One-Pass Reward Modeling
por: Li, Long-Fei, et al.
Publicado: (2025)
por: Li, Long-Fei, et al.
Publicado: (2025)
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024)
por: Agnihotri, Akhil, et al.
Publicado: (2024)
Graph Neural Thompson Sampling
por: Wu, Shuang, et al.
Publicado: (2024)
por: Wu, Shuang, et al.
Publicado: (2024)
Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation
por: Li, Shangzhe, et al.
Publicado: (2026)
por: Li, Shangzhe, et al.
Publicado: (2026)
Greedy Sampling Is Provably Efficient for RLHF
por: Wu, Di, et al.
Publicado: (2025)
por: Wu, Di, et al.
Publicado: (2025)
The Sample Complexity of Approximate Rejection Sampling with Applications to Smoothed Online Learning
por: Block, Adam, et al.
Publicado: (2023)
por: Block, Adam, et al.
Publicado: (2023)
Fast, Precise Thompson Sampling for Bayesian Optimization
por: Sweet, David
Publicado: (2024)
por: Sweet, David
Publicado: (2024)
Thompson Sampling in Partially Observable Contextual Bandits
por: Park, Hongju, et al.
Publicado: (2024)
por: Park, Hongju, et al.
Publicado: (2024)
On Regret Bounds of Thompson Sampling for Bayesian Optimization
por: Takeno, Shion, et al.
Publicado: (2026)
por: Takeno, Shion, et al.
Publicado: (2026)
Thompson Sampling For Combinatorial Bandits: Polynomial Regret and Mismatched Sampling Paradox
por: Zhang, Raymond, et al.
Publicado: (2024)
por: Zhang, Raymond, et al.
Publicado: (2024)
Towards a Theoretical Understanding to the Generalization of RLHF
por: Li, Zhaochun, et al.
Publicado: (2026)
por: Li, Zhaochun, et al.
Publicado: (2026)
Offline and Online KL-Regularized RLHF under Differential Privacy
por: Wu, Yulian, et al.
Publicado: (2025)
por: Wu, Yulian, et al.
Publicado: (2025)
Active Preference Optimization for Sample Efficient RLHF
por: Das, Nirjhar, et al.
Publicado: (2024)
por: Das, Nirjhar, et al.
Publicado: (2024)
Thompson Sampling for Multi-Objective Linear Contextual Bandit
por: Park, Somangchan, et al.
Publicado: (2025)
por: Park, Somangchan, et al.
Publicado: (2025)
On Thompson Sampling and Bilateral Uncertainty in Additive Bayesian Optimization
por: Wycoff, Nathan
Publicado: (2025)
por: Wycoff, Nathan
Publicado: (2025)
Thompson Sampling-like Algorithms for Stochastic Rising Bandits
por: Fiandri, Marco, et al.
Publicado: (2025)
por: Fiandri, Marco, et al.
Publicado: (2025)
Stochastically Constrained Best Arm Identification with Thompson Sampling
por: Yang, Le, et al.
Publicado: (2025)
por: Yang, Le, et al.
Publicado: (2025)
An Information-Theoretic Analysis of Thompson Sampling for Logistic Bandits
por: Gouverneur, Amaury, et al.
Publicado: (2024)
por: Gouverneur, Amaury, et al.
Publicado: (2024)
Sliding-Window Thompson Sampling for Non-Stationary Settings
por: Fiandri, Marco, et al.
Publicado: (2024)
por: Fiandri, Marco, et al.
Publicado: (2024)
VITS : Variational Inference Thompson Sampling for contextual bandits
por: Clavier, Pierre, et al.
Publicado: (2023)
por: Clavier, Pierre, et al.
Publicado: (2023)
Ejemplares similares
-
Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift
por: Li, Bochao, et al.
Publicado: (2026) -
Online Learning of Decision Trees with Thompson Sampling
por: Chaouki, Ayman, et al.
Publicado: (2024) -
Thompson Sampling in Function Spaces via Neural Operators
por: Oliveira, Rafael, et al.
Publicado: (2025) -
Accelerating Approximate Thompson Sampling with Underdamped Langevin Monte Carlo
por: Zheng, Haoyang, et al.
Publicado: (2024) -
RLHF Workflow: From Reward Modeling to Online RLHF
por: Dong, Hanze, et al.
Publicado: (2024)