RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Zhilin, Zeng, Jiaqi, Delalleau, Olivier, Evans, Ellie, Egert, Daniel, Shin, Hoo-Chang, Soares, Felipe, Dong, Yi, Kuchaiev, Oleksii |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks
by: Wang, Zhilin, et al.
Published: (2025)
by: Wang, Zhilin, et al.
Published: (2025)
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
by: Wang, Zhilin, et al.
Published: (2025)
by: Wang, Zhilin, et al.
Published: (2025)
HelpSteer2-Preference: Complementing Ratings with Preferences
by: Wang, Zhilin, et al.
Published: (2024)
by: Wang, Zhilin, et al.
Published: (2024)
Think Twice: Branch-and-Rethink Reasoning Reward Model
by: Jiao, Yizhu, et al.
Published: (2025)
by: Jiao, Yizhu, et al.
Published: (2025)
HelpSteer2: Open-source dataset for training top-performing reward models
by: Wang, Zhilin, et al.
Published: (2024)
by: Wang, Zhilin, et al.
Published: (2024)
Adversarial Training of Reward Models
by: Bukharin, Alexander, et al.
Published: (2025)
by: Bukharin, Alexander, et al.
Published: (2025)
NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment
by: Shen, Gerald, et al.
Published: (2024)
by: Shen, Gerald, et al.
Published: (2024)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
by: Sun, Shengyang, et al.
Published: (2025)
by: Sun, Shengyang, et al.
Published: (2025)
GPT vs RETRO: Exploring the Intersection of Retrieval and Parameter-Efficient Fine-Tuning
by: Ficek, Aleksander, et al.
Published: (2024)
by: Ficek, Aleksander, et al.
Published: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
by: Ackermann, Johannes, et al.
Published: (2026)
by: Ackermann, Johannes, et al.
Published: (2026)
Tied-Lora: Enhancing parameter efficiency of LoRA with weight tying
by: Renduchintala, Adithya, et al.
Published: (2023)
by: Renduchintala, Adithya, et al.
Published: (2023)
Test-Time Adaptation with Binary Feedback
by: Lee, Taeckyung, et al.
Published: (2025)
by: Lee, Taeckyung, et al.
Published: (2025)
Feedback Is Not Enough: Why Organized Methods Fail Under Partial Reduction through Adaptive Reduction Theory
by: Grakov, Oleksii
Published: (2026)
by: Grakov, Oleksii
Published: (2026)
Adaptive Querying for Reward Learning from Human Feedback
by: Anand, Yashwanthi, et al.
Published: (2024)
by: Anand, Yashwanthi, et al.
Published: (2024)
Reward Modeling from Natural Language Human Feedback
by: Wang, Zongqi, et al.
Published: (2026)
by: Wang, Zongqi, et al.
Published: (2026)
Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback
by: Afsharrad, Amirhossein, et al.
Published: (2026)
by: Afsharrad, Amirhossein, et al.
Published: (2026)
Fusing Reward and Dueling Feedback in Stochastic Bandits
by: Wang, Xuchuang, et al.
Published: (2025)
by: Wang, Xuchuang, et al.
Published: (2025)
Dense Reward for Free in Reinforcement Learning from Human Feedback
by: Chan, Alex J., et al.
Published: (2024)
by: Chan, Alex J., et al.
Published: (2024)
REvolve: Reward Evolution with Large Language Models using Human Feedback
by: Hazra, Rishi, et al.
Published: (2024)
by: Hazra, Rishi, et al.
Published: (2024)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
by: Shen, Wei, et al.
Published: (2024)
by: Shen, Wei, et al.
Published: (2024)
The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement
by: Wang, Xiaobo, et al.
Published: (2026)
by: Wang, Xiaobo, et al.
Published: (2026)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
by: Hatgis-Kessell, Stephane, et al.
Published: (2025)
by: Hatgis-Kessell, Stephane, et al.
Published: (2025)
Reward-Forcing: Autoregressive Video Generation with Reward Feedback
by: Zhang, Jingran, et al.
Published: (2026)
by: Zhang, Jingran, et al.
Published: (2026)
The FABRIC Strategy for Verifying Neural Feedback Systems
by: Akinwande, Samuel I., et al.
Published: (2026)
by: Akinwande, Samuel I., et al.
Published: (2026)
Zero-Shot LLMs in Human-in-the-Loop RL: Replacing Human Feedback for Reward Shaping
by: Nazir, Mohammad Saif, et al.
Published: (2025)
by: Nazir, Mohammad Saif, et al.
Published: (2025)
Code Aesthetics with Agentic Reward Feedback
by: Xiao, Bang, et al.
Published: (2025)
by: Xiao, Bang, et al.
Published: (2025)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
by: Zhou, Jiayi, et al.
Published: (2024)
by: Zhou, Jiayi, et al.
Published: (2024)
RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution
by: Li, Jiahui, et al.
Published: (2024)
by: Li, Jiahui, et al.
Published: (2024)
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
by: Wang, Zhilin, et al.
Published: (2025)
by: Wang, Zhilin, et al.
Published: (2025)
TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
by: Yoon, Eunseop, et al.
Published: (2024)
by: Yoon, Eunseop, et al.
Published: (2024)
Inverse Learning-Based Output Feedback Control of Nonlinear Systems with Verifiable Guarantees
by: Jang, Yeongjun, et al.
Published: (2026)
by: Jang, Yeongjun, et al.
Published: (2026)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
by: Ackermann, Johannes, et al.
Published: (2025)
by: Ackermann, Johannes, et al.
Published: (2025)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
by: Zhang, Shun, et al.
Published: (2024)
by: Zhang, Shun, et al.
Published: (2024)
Aligning Crowd Feedback via Distributional Preference Reward Modeling
by: Li, Dexun, et al.
Published: (2024)
by: Li, Dexun, et al.
Published: (2024)
RLNVR: Reinforcement Learning from Non-Verified Real-World Rewards
by: Krishnan, Rohit, et al.
Published: (2025)
by: Krishnan, Rohit, et al.
Published: (2025)
Aligning Humans and Robots via Reinforcement Learning from Implicit Human Feedback
by: Kim, Suzie, et al.
Published: (2025)
by: Kim, Suzie, et al.
Published: (2025)
Reward Learning from Multiple Feedback Types
by: Metz, Yannick, et al.
Published: (2025)
by: Metz, Yannick, et al.
Published: (2025)
Reward Modeling with Ordinal Feedback: Wisdom of the Crowd
by: Liu, Shang, et al.
Published: (2024)
by: Liu, Shang, et al.
Published: (2024)
Flexible Blood Glucose Control: Offline Reinforcement Learning from Human Feedback
by: Emerson, Harry, et al.
Published: (2025)
by: Emerson, Harry, et al.
Published: (2025)
Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
by: Cho, Young Hyun, et al.
Published: (2026)
by: Cho, Young Hyun, et al.
Published: (2026)
Similar Items
-
HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks
by: Wang, Zhilin, et al.
Published: (2025) -
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
by: Wang, Zhilin, et al.
Published: (2025) -
HelpSteer2-Preference: Complementing Ratings with Preferences
by: Wang, Zhilin, et al.
Published: (2024) -
Think Twice: Branch-and-Rethink Reasoning Reward Model
by: Jiao, Yizhu, et al.
Published: (2025) -
HelpSteer2: Open-source dataset for training top-performing reward models
by: Wang, Zhilin, et al.
Published: (2024)