Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Wei, Liu, Guanlin, Wu, Zheng, Zhu, Ruofei, Yang, Qingping, Xin, Chao, Yue, Yu, Yan, Lin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
di: Shen, Wei, et al.
Pubblicazione: (2024)
di: Shen, Wei, et al.
Pubblicazione: (2024)
Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
Leveraging Knowledge Distillation for Efficient Deep Reinforcement Learning in Resource-Constrained Environments
di: Meng, Guanlin
Pubblicazione: (2023)
di: Meng, Guanlin
Pubblicazione: (2023)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
di: Yu, Qiying, et al.
Pubblicazione: (2025)
di: Yu, Qiying, et al.
Pubblicazione: (2025)
What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret
di: Yuan, Yufeng, et al.
Pubblicazione: (2025)
di: Yuan, Yufeng, et al.
Pubblicazione: (2025)
Dual Active Learning for Reinforcement Learning from Human Feedback
di: Liu, Pangpang, et al.
Pubblicazione: (2024)
di: Liu, Pangpang, et al.
Pubblicazione: (2024)
Multimodal Query Suggestion with Multi-Agent Reinforcement Learning from Human Feedback
di: Wang, Zheng, et al.
Pubblicazione: (2024)
di: Wang, Zheng, et al.
Pubblicazione: (2024)
Parameter Efficient Reinforcement Learning from Human Feedback
di: Sidahmed, Hakim, et al.
Pubblicazione: (2024)
di: Sidahmed, Hakim, et al.
Pubblicazione: (2024)
Reinforcement Learning from Human Feedback: A Statistical Perspective
di: Liu, Pangpang, et al.
Pubblicazione: (2026)
di: Liu, Pangpang, et al.
Pubblicazione: (2026)
Curiosity-Driven Reinforcement Learning from Human Feedback
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2026)
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2026)
Bayesian Model Selection via Composite Likelihood for High‐dimensional Data Integration
di: Guanlin Zhang, et al.
Pubblicazione: (2024)
di: Guanlin Zhang, et al.
Pubblicazione: (2024)
Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
di: Peng, Xiyue, et al.
Pubblicazione: (2024)
di: Peng, Xiyue, et al.
Pubblicazione: (2024)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
di: Lee, Harrison, et al.
Pubblicazione: (2023)
di: Lee, Harrison, et al.
Pubblicazione: (2023)
Recent Progress of the Application of Electropolymerization in Batteries and Supercapacitors: Specific Design of Functions in Electrodes
di: Shengxuan Lin, et al.
Pubblicazione: (2024)
di: Shengxuan Lin, et al.
Pubblicazione: (2024)
Passive Acoustic Monitoring of Underwater Well Leakages with Machine Learning: A Review
di: Zhu, Guanlin, et al.
Pubblicazione: (2025)
di: Zhu, Guanlin, et al.
Pubblicazione: (2025)
RELAX: Reinforcement Learning Enabled 2D-LiDAR Autonomous System for Parsimonious UAVs
di: Wu, Guanlin, et al.
Pubblicazione: (2023)
di: Wu, Guanlin, et al.
Pubblicazione: (2023)
Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback
di: Li, Gen, et al.
Pubblicazione: (2025)
di: Li, Gen, et al.
Pubblicazione: (2025)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
di: Lee, Seong Jin, et al.
Pubblicazione: (2024)
di: Lee, Seong Jin, et al.
Pubblicazione: (2024)
ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks
di: Xu, Tianxiang, et al.
Pubblicazione: (2026)
di: Xu, Tianxiang, et al.
Pubblicazione: (2026)
Learning Personalized Driving Styles via Reinforcement Learning from Human Feedback
di: Li, Derun, et al.
Pubblicazione: (2025)
di: Li, Derun, et al.
Pubblicazione: (2025)
VickreyFeedback: Cost-efficient Data Construction for Reinforcement Learning from Human Feedback
di: Zhang, Guoxi, et al.
Pubblicazione: (2024)
di: Zhang, Guoxi, et al.
Pubblicazione: (2024)
Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays
di: Wu, Qingyuan, et al.
Pubblicazione: (2024)
di: Wu, Qingyuan, et al.
Pubblicazione: (2024)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
di: Huang, Jiawei, et al.
Pubblicazione: (2026)
di: Huang, Jiawei, et al.
Pubblicazione: (2026)
MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions
di: Chai, Yekun, et al.
Pubblicazione: (2024)
di: Chai, Yekun, et al.
Pubblicazione: (2024)
Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback
di: Yuan, Yifu, et al.
Pubblicazione: (2024)
di: Yuan, Yifu, et al.
Pubblicazione: (2024)
Deep Reinforcement Learning-Based Decision-Making Strategy Considering User Satisfaction Feedback in Demand Response Program
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks
di: Yue, Yu, et al.
Pubblicazione: (2025)
di: Yue, Yu, et al.
Pubblicazione: (2025)
AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning
di: Lou, Chenwei, et al.
Pubblicazione: (2025)
di: Lou, Chenwei, et al.
Pubblicazione: (2025)
Reinforcement Learning from Human Feedback
di: Lambert, Nathan
Pubblicazione: (2025)
di: Lambert, Nathan
Pubblicazione: (2025)
Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback
di: Liu, Qiang, et al.
Pubblicazione: (2026)
di: Liu, Qiang, et al.
Pubblicazione: (2026)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2023)
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2023)
Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning
di: Xu, Zelai, et al.
Pubblicazione: (2026)
di: Xu, Zelai, et al.
Pubblicazione: (2026)
RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
di: Wu, Jiaxing, et al.
Pubblicazione: (2024)
di: Wu, Jiaxing, et al.
Pubblicazione: (2024)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
di: Swamy, Gokul, et al.
Pubblicazione: (2024)
di: Swamy, Gokul, et al.
Pubblicazione: (2024)
Cross-cultural Deployment of Autonomous Vehicles Using Data-light Inverse Reinforcement Learning
di: Lu, Hongliang, et al.
Pubblicazione: (2025)
di: Lu, Hongliang, et al.
Pubblicazione: (2025)
Beyond Human Preferences: Exploring Reinforcement Learning Trajectory Evaluation and Improvement through LLMs
di: Shen, Zichao, et al.
Pubblicazione: (2024)
di: Shen, Zichao, et al.
Pubblicazione: (2024)
Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning
di: Wang, Futing, et al.
Pubblicazione: (2026)
di: Wang, Futing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
di: Shen, Wei, et al.
Pubblicazione: (2024) -
Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization
di: Ji, Kaixuan, et al.
Pubblicazione: (2024) -
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
di: Hong, Ilgee, et al.
Pubblicazione: (2024) -
Leveraging Knowledge Distillation for Efficient Deep Reinforcement Learning in Resource-Constrained Environments
di: Meng, Guanlin
Pubblicazione: (2023) -
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
di: Yu, Qiying, et al.
Pubblicazione: (2025)