Salvato in:
| Autori principali: | Liu, Pangpang, Shi, Chengchun, Sun, Will Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2604.02507 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dual Active Learning for Reinforcement Learning from Human Feedback
di: Liu, Pangpang, et al.
Pubblicazione: (2024)
di: Liu, Pangpang, et al.
Pubblicazione: (2024)
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
di: Liu, Pangpang, et al.
Pubblicazione: (2025)
di: Liu, Pangpang, et al.
Pubblicazione: (2025)
Statistical Inference in Reinforcement Learning: A Selective Survey
di: Shi, Chengchun
Pubblicazione: (2025)
di: Shi, Chengchun
Pubblicazione: (2025)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
di: Ye, Kai, et al.
Pubblicazione: (2025)
di: Ye, Kai, et al.
Pubblicazione: (2025)
Fairness-aware Contextual Dynamic Pricing with Strategic Buyers
di: Liu, Pangpang, et al.
Pubblicazione: (2025)
di: Liu, Pangpang, et al.
Pubblicazione: (2025)
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
di: Wang, Danyang, et al.
Pubblicazione: (2024)
di: Wang, Danyang, et al.
Pubblicazione: (2024)
Counterfactually Safe Reinforcement Learning
di: Li, Jingyi, et al.
Pubblicazione: (2026)
di: Li, Jingyi, et al.
Pubblicazione: (2026)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
di: Lee, Seong Jin, et al.
Pubblicazione: (2024)
di: Lee, Seong Jin, et al.
Pubblicazione: (2024)
Testing Stationarity and Change Point Detection in Reinforcement Learning
di: Li, Mengbing, et al.
Pubblicazione: (2022)
di: Li, Mengbing, et al.
Pubblicazione: (2022)
Contextual Dynamic Pricing with Strategic Buyers
di: Liu, Pangpang, et al.
Pubblicazione: (2023)
di: Liu, Pangpang, et al.
Pubblicazione: (2023)
Doubly Inhomogeneous Reinforcement Learning
di: Hu, Liyuan, et al.
Pubblicazione: (2022)
di: Hu, Liyuan, et al.
Pubblicazione: (2022)
Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
di: Cho, Young Hyun, et al.
Pubblicazione: (2026)
di: Cho, Young Hyun, et al.
Pubblicazione: (2026)
Reinforcement Learning from Human Feedback
di: Lambert, Nathan
Pubblicazione: (2025)
di: Lambert, Nathan
Pubblicazione: (2025)
Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback
di: Liu, Qiang, et al.
Pubblicazione: (2026)
di: Liu, Qiang, et al.
Pubblicazione: (2026)
Dense Reward for Free in Reinforcement Learning from Human Feedback
di: Chan, Alex J., et al.
Pubblicazione: (2024)
di: Chan, Alex J., et al.
Pubblicazione: (2024)
Designing Time Series Experiments in A/B Testing with Transformer Reinforcement Learning
di: Wu, Xiangkun, et al.
Pubblicazione: (2026)
di: Wu, Xiangkun, et al.
Pubblicazione: (2026)
Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning
di: Yu, Shuguang, et al.
Pubblicazione: (2024)
di: Yu, Shuguang, et al.
Pubblicazione: (2024)
Strategyproof Reinforcement Learning from Human Feedback
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2025)
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2025)
Sequential Knockoffs for Variable Selection in Reinforcement Learning
di: Ma, Tao, et al.
Pubblicazione: (2023)
di: Ma, Tao, et al.
Pubblicazione: (2023)
Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning
di: Gong, Shijin, et al.
Pubblicazione: (2026)
di: Gong, Shijin, et al.
Pubblicazione: (2026)
From Authors to Reviewers: Leveraging Rankings to Improve Peer Review
di: Wang, Weichen, et al.
Pubblicazione: (2025)
di: Wang, Weichen, et al.
Pubblicazione: (2025)
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
di: Swamy, Gokul, et al.
Pubblicazione: (2024)
di: Swamy, Gokul, et al.
Pubblicazione: (2024)
Semi-pessimistic Reinforcement Learning
di: Zhu, Jin, et al.
Pubblicazione: (2025)
di: Zhu, Jin, et al.
Pubblicazione: (2025)
Robust Reinforcement Learning from Corrupted Human Feedback
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
di: Zhu, Jin, et al.
Pubblicazione: (2023)
di: Zhu, Jin, et al.
Pubblicazione: (2023)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
di: Ye, Chenlu, et al.
Pubblicazione: (2024)
di: Ye, Chenlu, et al.
Pubblicazione: (2024)
Infrared Spectra Prediction for Diazo Groups Utilizing a Machine Learning Approach with Structural Attention Mechanism
di: Liu, Chengchun, et al.
Pubblicazione: (2024)
di: Liu, Chengchun, et al.
Pubblicazione: (2024)
Double Fairness Policy Learning: Integrating Action Fairness and Outcome Fairness in Decision-making
di: Bian, Zeyu, et al.
Pubblicazione: (2026)
di: Bian, Zeyu, et al.
Pubblicazione: (2026)
A Survey of Reinforcement Learning from Human Feedback
di: Kaufmann, Timo, et al.
Pubblicazione: (2023)
di: Kaufmann, Timo, et al.
Pubblicazione: (2023)
Reinforcement Learning from Multi-level and Episodic Human Feedback
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
Multi-turn Reinforcement Learning from Preference Human Feedback
di: Shani, Lior, et al.
Pubblicazione: (2024)
di: Shani, Lior, et al.
Pubblicazione: (2024)
Counterfactually Fair Reinforcement Learning via Sequential Data Preprocessing
di: Wang, Jitao, et al.
Pubblicazione: (2025)
di: Wang, Jitao, et al.
Pubblicazione: (2025)
Parameter Efficient Reinforcement Learning from Human Feedback
di: Sidahmed, Hakim, et al.
Pubblicazione: (2024)
di: Sidahmed, Hakim, et al.
Pubblicazione: (2024)
Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic
di: Zhou, Hongyi, et al.
Pubblicazione: (2026)
di: Zhou, Hongyi, et al.
Pubblicazione: (2026)
The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback
di: Chen, Ruitao, et al.
Pubblicazione: (2024)
di: Chen, Ruitao, et al.
Pubblicazione: (2024)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2026)
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2026)
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback
di: Lambert, Nathan, et al.
Pubblicazione: (2023)
di: Lambert, Nathan, et al.
Pubblicazione: (2023)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
di: Zhang, Qining, et al.
Pubblicazione: (2025)
di: Zhang, Qining, et al.
Pubblicazione: (2025)
Reinforcing Human Behavior Simulation via Verbal Feedback
di: Sun, Weiwei, et al.
Pubblicazione: (2026)
di: Sun, Weiwei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Dual Active Learning for Reinforcement Learning from Human Feedback
di: Liu, Pangpang, et al.
Pubblicazione: (2024) -
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
di: Liu, Pangpang, et al.
Pubblicazione: (2025) -
Statistical Inference in Reinforcement Learning: A Selective Survey
di: Shi, Chengchun
Pubblicazione: (2025) -
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
di: Ye, Kai, et al.
Pubblicazione: (2025) -
Fairness-aware Contextual Dynamic Pricing with Strategic Buyers
di: Liu, Pangpang, et al.
Pubblicazione: (2025)