CHARM: Calibrating Reward Models With Chatbot Arena Scores
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Xiao, Tan, Chenmien, Chen, Pinzhen, Sennrich, Rico, Wang, Huiming, Zhang, Yanlin, Hu, Hanxu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
di: Zhu, Xiao, et al.
Pubblicazione: (2026)
di: Zhu, Xiao, et al.
Pubblicazione: (2026)
Investigating Multi-Pivot Ensembling with Massively Multilingual Machine Translation Models
di: Mohammadshahi, Alireza, et al.
Pubblicazione: (2023)
di: Mohammadshahi, Alireza, et al.
Pubblicazione: (2023)
Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena
di: Luo, Haipeng, et al.
Pubblicazione: (2024)
di: Luo, Haipeng, et al.
Pubblicazione: (2024)
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
di: Min, Rui, et al.
Pubblicazione: (2025)
di: Min, Rui, et al.
Pubblicazione: (2025)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
di: Wang, Chaoqi, et al.
Pubblicazione: (2025)
di: Wang, Chaoqi, et al.
Pubblicazione: (2025)
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
di: Ma, Rachel, et al.
Pubblicazione: (2026)
di: Ma, Rachel, et al.
Pubblicazione: (2026)
CalArena: A Large-Scale Post-Hoc Calibration Benchmark
di: Berta, Eugène, et al.
Pubblicazione: (2026)
di: Berta, Eugène, et al.
Pubblicazione: (2026)
Pairwise Calibrated Rewards for Pluralistic Alignment
di: Halpern, Daniel, et al.
Pubblicazione: (2025)
di: Halpern, Daniel, et al.
Pubblicazione: (2025)
Know What You Don't Know: Uncertainty Calibration of Process Reward Models
di: Park, Young-Jin, et al.
Pubblicazione: (2025)
di: Park, Young-Jin, et al.
Pubblicazione: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
di: Li, Siyuan, et al.
Pubblicazione: (2023)
di: Li, Siyuan, et al.
Pubblicazione: (2023)
Reward Models in Deep Reinforcement Learning: A Survey
di: Yu, Rui, et al.
Pubblicazione: (2025)
di: Yu, Rui, et al.
Pubblicazione: (2025)
XL-Suite: Cross-Lingual Synthetic Training and Evaluation Data for Open-Ended Generation
di: Iyer, Vivek, et al.
Pubblicazione: (2025)
di: Iyer, Vivek, et al.
Pubblicazione: (2025)
Learning a Diffusion Model Policy from Rewards via Q-Score Matching
di: Psenka, Michael, et al.
Pubblicazione: (2023)
di: Psenka, Michael, et al.
Pubblicazione: (2023)
Planning-Augmented Sampling with Early Guidance for High-Reward Discovery
di: Zhu, Rui, et al.
Pubblicazione: (2025)
di: Zhu, Rui, et al.
Pubblicazione: (2025)
Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
CROP: Conservative Reward for Model-based Offline Policy Optimization
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
di: Deng, Yongxin, et al.
Pubblicazione: (2024)
di: Deng, Yongxin, et al.
Pubblicazione: (2024)
Beyond Semantic Manipulation: Token-Space Attacks on Reward Models
di: Zhang, Yuheng, et al.
Pubblicazione: (2026)
di: Zhang, Yuheng, et al.
Pubblicazione: (2026)
Self-Generated Critiques Boost Reward Modeling for Language Models
di: Yu, Yue, et al.
Pubblicazione: (2024)
di: Yu, Yue, et al.
Pubblicazione: (2024)
Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach
di: Xiao, Jiancong, et al.
Pubblicazione: (2025)
di: Xiao, Jiancong, et al.
Pubblicazione: (2025)
IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models
di: Song, Haonan, et al.
Pubblicazione: (2026)
di: Song, Haonan, et al.
Pubblicazione: (2026)
Reward-Directed Score-Based Diffusion Models via q-Learning
di: Gao, Xuefeng, et al.
Pubblicazione: (2024)
di: Gao, Xuefeng, et al.
Pubblicazione: (2024)
Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning
di: Xing, Jingyu, et al.
Pubblicazione: (2025)
di: Xing, Jingyu, et al.
Pubblicazione: (2025)
Preference Poisoning Attacks on Reward Model Learning
di: Wu, Junlin, et al.
Pubblicazione: (2024)
di: Wu, Junlin, et al.
Pubblicazione: (2024)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
di: Zhang, Qiang, et al.
Pubblicazione: (2026)
di: Zhang, Qiang, et al.
Pubblicazione: (2026)
K-Score: Kalman Filter as a Principled Alternative to Reward Normalization in Reinforcement Learning
di: Xia, Zixuan, et al.
Pubblicazione: (2026)
di: Xia, Zixuan, et al.
Pubblicazione: (2026)
Massive Editing for Large Language Models via Meta Learning
di: Tan, Chenmien, et al.
Pubblicazione: (2023)
di: Tan, Chenmien, et al.
Pubblicazione: (2023)
Complex Logical Query Answering by Calibrating Knowledge Graph Completion Models
di: Xiao, Changyi, et al.
Pubblicazione: (2024)
di: Xiao, Changyi, et al.
Pubblicazione: (2024)
Saliency-Aware Regularized Quantization Calibration for Large Language Models
di: Zhao, Yanlong, et al.
Pubblicazione: (2026)
di: Zhao, Yanlong, et al.
Pubblicazione: (2026)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
di: Miao, Yuchun, et al.
Pubblicazione: (2024)
di: Miao, Yuchun, et al.
Pubblicazione: (2024)
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
di: Liu, Jincheng, et al.
Pubblicazione: (2025)
di: Liu, Jincheng, et al.
Pubblicazione: (2025)
Enhancing Uplift Modeling in Multi-Treatment Marketing Campaigns: Leveraging Score Ranking and Calibration Techniques
di: Park, Yoon Tae, et al.
Pubblicazione: (2024)
di: Park, Yoon Tae, et al.
Pubblicazione: (2024)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
di: Xie, Lipeng, et al.
Pubblicazione: (2025)
di: Xie, Lipeng, et al.
Pubblicazione: (2025)
Finite-time Convergence Analysis of Actor-Critic with Evolving Reward
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
RewardAnything: Generalizable Principle-Following Reward Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models
di: Lee, Jeongjae, et al.
Pubblicazione: (2026)
di: Lee, Jeongjae, et al.
Pubblicazione: (2026)
Automatically Finding Reward Model Biases
di: Wang, Atticus, et al.
Pubblicazione: (2026)
di: Wang, Atticus, et al.
Pubblicazione: (2026)
Intra-Trajectory Consistency for Reward Modeling
di: Zhou, Chaoyang, et al.
Pubblicazione: (2025)
di: Zhou, Chaoyang, et al.
Pubblicazione: (2025)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
di: Beigi, Mohammad, et al.
Pubblicazione: (2026)
di: Beigi, Mohammad, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
di: Zhu, Xiao, et al.
Pubblicazione: (2026) -
Investigating Multi-Pivot Ensembling with Massively Multilingual Machine Translation Models
di: Mohammadshahi, Alireza, et al.
Pubblicazione: (2023) -
Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena
di: Luo, Haipeng, et al.
Pubblicazione: (2024) -
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
di: Min, Rui, et al.
Pubblicazione: (2025) -
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
di: Wang, Chaoqi, et al.
Pubblicazione: (2025)