Reinforcement Learning from User Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Eric, Chen, Jun, Sankararaman, Karthik Abinav, Peng, Xiaoliang, Xu, Tengyu, Helenowski, Eryk, Peng, Kaiyan, Kumar, Mrinal, Wang, Sinong, Fang, Han, Talebzadeh, Arya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Generalized Parallel Scaling with Interdependent Generations
par: Dong, Harry, et autres
Publié: (2025)
par: Dong, Harry, et autres
Publié: (2025)
Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization
par: Yu, Zishun, et autres
Publié: (2025)
par: Yu, Zishun, et autres
Publié: (2025)
Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form Generation
par: Qin, Chengwei, et autres
Publié: (2025)
par: Qin, Chengwei, et autres
Publié: (2025)
The Perfect Blend: Redefining RLHF with Mixture of Judges
par: Xu, Tengyu, et autres
Publié: (2024)
par: Xu, Tengyu, et autres
Publié: (2024)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
par: He, Yun, et autres
Publié: (2024)
par: He, Yun, et autres
Publié: (2024)
Controllable Discovery of Intents: Incremental Deep Clustering Using Semi-Supervised Contrastive Learning
par: Rawat, Mrinal, et autres
Publié: (2024)
par: Rawat, Mrinal, et autres
Publié: (2024)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
par: Wu, Bo, et autres
Publié: (2025)
par: Wu, Bo, et autres
Publié: (2025)
Contextual Bandits with Packing and Covering Constraints: A Modular Lagrangian Approach via Regression
par: Slivkins, Aleksandrs, et autres
Publié: (2022)
par: Slivkins, Aleksandrs, et autres
Publié: (2022)
Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback
par: Lin, Yen-Ting, et autres
Publié: (2025)
par: Lin, Yen-Ting, et autres
Publié: (2025)
On the Equivalence of Graph Convolution and Mixup
par: Han, Xiaotian, et autres
Publié: (2023)
par: Han, Xiaotian, et autres
Publié: (2023)
Towards User-level Private Reinforcement Learning with Human Feedback
par: Zhang, Jiaming, et autres
Publié: (2025)
par: Zhang, Jiaming, et autres
Publié: (2025)
Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays
par: Wu, Qingyuan, et autres
Publié: (2024)
par: Wu, Qingyuan, et autres
Publié: (2024)
Preference Optimization with Multi-Sample Comparisons
par: Wang, Chaoqi, et autres
Publié: (2024)
par: Wang, Chaoqi, et autres
Publié: (2024)
LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models
par: Han, Chi, et autres
Publié: (2023)
par: Han, Chi, et autres
Publié: (2023)
Boosting LLM Reasoning via Spontaneous Self-Correction
par: Zhao, Xutong, et autres
Publié: (2025)
par: Zhao, Xutong, et autres
Publié: (2025)
RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
par: Wu, Jiaxing, et autres
Publié: (2024)
par: Wu, Jiaxing, et autres
Publié: (2024)
Do Understanding and Generation Fight? A Diagnostic Study of DPO for Unified Multimodal Models
par: Rao, Abinav, et autres
Publié: (2026)
par: Rao, Abinav, et autres
Publié: (2026)
LLM-Enhanced Reinforcement Learning for Long-Term User Satisfaction in Interactive Recommendation
par: Xia, Chongjun, et autres
Publié: (2026)
par: Xia, Chongjun, et autres
Publié: (2026)
Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback
par: Yuan, Wenzhen, et autres
Publié: (2025)
par: Yuan, Wenzhen, et autres
Publié: (2025)
Fine-Tuning Hybrid Physics-Informed Neural Networks for Vehicle Dynamics Model Estimation
par: Fang, Shiming, et autres
Publié: (2024)
par: Fang, Shiming, et autres
Publié: (2024)
BQSched: A Non-intrusive Scheduler for Batch Concurrent Queries via Reinforcement Learning
par: Xu, Chenhao, et autres
Publié: (2025)
par: Xu, Chenhao, et autres
Publié: (2025)
ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement Learning
par: Chen, Zhirong, et autres
Publié: (2025)
par: Chen, Zhirong, et autres
Publié: (2025)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
par: Zhang, Xikai, et autres
Publié: (2026)
par: Zhang, Xikai, et autres
Publié: (2026)
LearningFlow: Automated Policy Learning Workflow for Urban Driving with Large Language Models
par: Peng, Zengqi, et autres
Publié: (2025)
par: Peng, Zengqi, et autres
Publié: (2025)
RL-ACRGNet: Reinforcement Learning-Based Chest Radiology Report Generation Network
par: Meena, Yogesh Kumar, et autres
Publié: (2026)
par: Meena, Yogesh Kumar, et autres
Publié: (2026)
NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning
par: Miao, Zhongtao, et autres
Publié: (2026)
par: Miao, Zhongtao, et autres
Publié: (2026)
Improving Arithmetic Reasoning Ability of Large Language Models through Relation Tuples, Verification and Dynamic Feedback
par: Miao, Zhongtao, et autres
Publié: (2024)
par: Miao, Zhongtao, et autres
Publié: (2024)
Graph Hopfield Networks: Energy-Based Node Classification with Associative Memory
par: Rao, Abinav, et autres
Publié: (2026)
par: Rao, Abinav, et autres
Publié: (2026)
Adviser-Actor-Critic: Eliminating Steady-State Error in Reinforcement Learning Control
par: Chen, Donghe, et autres
Publié: (2025)
par: Chen, Donghe, et autres
Publié: (2025)
Closing the Loop: Coordinating Inventory and Recommendation via Deep Reinforcement Learning on Multiple Timescales
par: Jiang, Jinyang, et autres
Publié: (2025)
par: Jiang, Jinyang, et autres
Publié: (2025)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
par: Ji, Jiaming, et autres
Publié: (2025)
par: Ji, Jiaming, et autres
Publié: (2025)
Efficient Diversity-based Experience Replay for Deep Reinforcement Learning
par: Zhao, Kaiyan, et autres
Publié: (2024)
par: Zhao, Kaiyan, et autres
Publié: (2024)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
par: Zhan, Simon Sinong, et autres
Publié: (2025)
par: Zhan, Simon Sinong, et autres
Publié: (2025)
Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
par: Su, Huikang, et autres
Publié: (2025)
par: Su, Huikang, et autres
Publié: (2025)
Reinforcement Learning with Token-level Feedback for Controllable Text Generation
par: Li, Wendi, et autres
Publié: (2024)
par: Li, Wendi, et autres
Publié: (2024)
HRLAIF: Improvements in Helpfulness and Harmlessness in Open-domain Reinforcement Learning From AI Feedback
par: Li, Ang, et autres
Publié: (2024)
par: Li, Ang, et autres
Publié: (2024)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
par: Jiang, Zhizheng, et autres
Publié: (2026)
par: Jiang, Zhizheng, et autres
Publié: (2026)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
par: Zhan, Simon Sinong, et autres
Publié: (2024)
par: Zhan, Simon Sinong, et autres
Publié: (2024)
TeLL-Drive: Enhancing Autonomous Driving with Teacher LLM-Guided Deep Reinforcement Learning
par: Xu, Chengkai, et autres
Publié: (2025)
par: Xu, Chengkai, et autres
Publié: (2025)
Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
par: Peng, Xiyue, et autres
Publié: (2024)
par: Peng, Xiyue, et autres
Publié: (2024)
Documents similaires
-
Generalized Parallel Scaling with Interdependent Generations
par: Dong, Harry, et autres
Publié: (2025) -
Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization
par: Yu, Zishun, et autres
Publié: (2025) -
Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form Generation
par: Qin, Chengwei, et autres
Publié: (2025) -
The Perfect Blend: Redefining RLHF with Mixture of Judges
par: Xu, Tengyu, et autres
Publié: (2024) -
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
par: He, Yun, et autres
Publié: (2024)