How to Evaluate Reward Models for RLHF
Fuente:
arXiv
Salvato in:
| Autori principali: | Frick, Evan, Li, Tianle, Chen, Connor, Chiang, Wei-Lin, Angelopoulos, Anastasios N., Jiao, Jiantao, Zhu, Banghua, Gonzalez, Joseph E., Stoica, Ion |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prompt-to-Leaderboard
di: Frick, Evan, et al.
Pubblicazione: (2025)
di: Frick, Evan, et al.
Pubblicazione: (2025)
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
di: Li, Tianle, et al.
Pubblicazione: (2024)
di: Li, Tianle, et al.
Pubblicazione: (2024)
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
di: Chiang, Wei-Lin, et al.
Pubblicazione: (2024)
di: Chiang, Wei-Lin, et al.
Pubblicazione: (2024)
Taming Overconfidence in LLMs: Reward Calibration in RLHF
di: Leng, Jixuan, et al.
Pubblicazione: (2024)
di: Leng, Jixuan, et al.
Pubblicazione: (2024)
Efficient Prompt Caching via Embedding Similarity
di: Zhu, Hanlin, et al.
Pubblicazione: (2024)
di: Zhu, Hanlin, et al.
Pubblicazione: (2024)
Generative AI Security: Challenges and Countermeasures
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
Specifications: The missing link to making the development of LLM systems an engineering discipline
di: Stoica, Ion, et al.
Pubblicazione: (2024)
di: Stoica, Ion, et al.
Pubblicazione: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
di: Dong, Hanze, et al.
Pubblicazione: (2024)
di: Dong, Hanze, et al.
Pubblicazione: (2024)
Search Arena: Analyzing Search-Augmented LLMs
di: Miroyan, Mihran, et al.
Pubblicazione: (2025)
di: Miroyan, Mihran, et al.
Pubblicazione: (2025)
Reward Model Overoptimisation in Iterated RLHF
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
RouteLLM: Learning to Route LLMs with Preference Data
di: Ong, Isaac, et al.
Pubblicazione: (2024)
di: Ong, Isaac, et al.
Pubblicazione: (2024)
LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset
di: Zheng, Lianmin, et al.
Pubblicazione: (2023)
di: Zheng, Lianmin, et al.
Pubblicazione: (2023)
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
di: Chen, Yanjun, et al.
Pubblicazione: (2024)
di: Chen, Yanjun, et al.
Pubblicazione: (2024)
Quantile Regression for Distributional Reward Models in RLHF
di: Dorka, Nicolai
Pubblicazione: (2024)
di: Dorka, Nicolai
Pubblicazione: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
Reward-Robust RLHF in LLMs
di: Yan, Yuzi, et al.
Pubblicazione: (2024)
di: Yan, Yuzi, et al.
Pubblicazione: (2024)
Principled Reinforcement Learning with Human Feedback from Pairwise or $K$-wise Comparisons
di: Zhu, Banghua, et al.
Pubblicazione: (2023)
di: Zhu, Banghua, et al.
Pubblicazione: (2023)
Post-Training Sparse Attention with Double Sparsity
di: Yang, Shuo, et al.
Pubblicazione: (2024)
di: Yang, Shuo, et al.
Pubblicazione: (2024)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
di: Chen, Lichang, et al.
Pubblicazione: (2024)
di: Chen, Lichang, et al.
Pubblicazione: (2024)
AutoEval Done Right: Using Synthetic Data for Model Evaluation
di: Boyeau, Pierre, et al.
Pubblicazione: (2024)
di: Boyeau, Pierre, et al.
Pubblicazione: (2024)
Towards Optimal Statistical Watermarking
di: Huang, Baihe, et al.
Pubblicazione: (2023)
di: Huang, Baihe, et al.
Pubblicazione: (2023)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
di: Yin, Yueqin, et al.
Pubblicazione: (2025)
di: Yin, Yueqin, et al.
Pubblicazione: (2025)
Sleep-time Compute: Beyond Inference Scaling at Test-time
di: Lin, Kevin, et al.
Pubblicazione: (2025)
di: Lin, Kevin, et al.
Pubblicazione: (2025)
Prototypical Reward Network for Data-Efficient RLHF
di: Zhang, Jinghan, et al.
Pubblicazione: (2024)
di: Zhang, Jinghan, et al.
Pubblicazione: (2024)
RAFT: Adapting Language Model to Domain Specific RAG
di: Zhang, Tianjun, et al.
Pubblicazione: (2024)
di: Zhang, Tianjun, et al.
Pubblicazione: (2024)
dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning
di: Chen, Shirui, et al.
Pubblicazione: (2025)
di: Chen, Shirui, et al.
Pubblicazione: (2025)
The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement
di: Wang, Xiaobo, et al.
Pubblicazione: (2026)
di: Wang, Xiaobo, et al.
Pubblicazione: (2026)
It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF
di: Lu, Taiming, et al.
Pubblicazione: (2024)
di: Lu, Taiming, et al.
Pubblicazione: (2024)
Copilot Arena: A Platform for Code LLM Evaluation in the Wild
di: Chi, Wayne, et al.
Pubblicazione: (2025)
di: Chi, Wayne, et al.
Pubblicazione: (2025)
Information-Theoretic Reward Decomposition for Generalizable RLHF
di: Mao, Liyuan, et al.
Pubblicazione: (2025)
di: Mao, Liyuan, et al.
Pubblicazione: (2025)
Reward Difference Optimization For Sample Reweighting In Offline RLHF
di: Wang, Shiqi, et al.
Pubblicazione: (2024)
di: Wang, Shiqi, et al.
Pubblicazione: (2024)
Group Robust Preference Optimization in Reward-free RLHF
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation
di: Zhu, Alan, et al.
Pubblicazione: (2025)
di: Zhu, Alan, et al.
Pubblicazione: (2025)
Fairness in Serving Large Language Models
di: Sheng, Ying, et al.
Pubblicazione: (2023)
di: Sheng, Ying, et al.
Pubblicazione: (2023)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Reward Generalization in RLHF: A Topological Perspective
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
di: Wu, Tianhao, et al.
Pubblicazione: (2024)
di: Wu, Tianhao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Prompt-to-Leaderboard
di: Frick, Evan, et al.
Pubblicazione: (2025) -
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
di: Li, Tianle, et al.
Pubblicazione: (2024) -
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
di: Zhu, Banghua, et al.
Pubblicazione: (2024) -
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
di: Chiang, Wei-Lin, et al.
Pubblicazione: (2024) -
Taming Overconfidence in LLMs: Reward Calibration in RLHF
di: Leng, Jixuan, et al.
Pubblicazione: (2024)