ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xiaomin, Chen, Xupeng, Fan, Jingxuan, Jiang, Eric Hanchen, Gao, Mingye |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Data-adaptive Safety Rules for Training Reward Models
di: Li, Xiaomin, et al.
Pubblicazione: (2025)
di: Li, Xiaomin, et al.
Pubblicazione: (2025)
CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs
di: Chen, Sijia, et al.
Pubblicazione: (2025)
di: Chen, Sijia, et al.
Pubblicazione: (2025)
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
Entropy-Regularized Process Reward Model
di: Zhang, Hanning, et al.
Pubblicazione: (2024)
di: Zhang, Hanning, et al.
Pubblicazione: (2024)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
di: Shi, Wei, et al.
Pubblicazione: (2025)
di: Shi, Wei, et al.
Pubblicazione: (2025)
Enhancing LLM Reasoning with Reward-guided Tree Search
di: Jiang, Jinhao, et al.
Pubblicazione: (2024)
di: Jiang, Jinhao, et al.
Pubblicazione: (2024)
Exploring Reasoning Reward Model for Agents
di: Fan, Kaixuan, et al.
Pubblicazione: (2026)
di: Fan, Kaixuan, et al.
Pubblicazione: (2026)
RRM: Robust Reward Model Training Mitigates Reward Hacking
di: Liu, Tianqi, et al.
Pubblicazione: (2024)
di: Liu, Tianqi, et al.
Pubblicazione: (2024)
Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
The Bidirectional Process Reward Model
di: Zhang, Lingyin, et al.
Pubblicazione: (2025)
di: Zhang, Lingyin, et al.
Pubblicazione: (2025)
Aligning Language Models Using Follow-up Likelihood as Reward Signal
di: Zhang, Chen, et al.
Pubblicazione: (2024)
di: Zhang, Chen, et al.
Pubblicazione: (2024)
MedGUIDE: Benchmarking Clinical Decision-Making in Large Language Models
di: Li, Xiaomin, et al.
Pubblicazione: (2025)
di: Li, Xiaomin, et al.
Pubblicazione: (2025)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
di: Elle
Pubblicazione: (2025)
di: Elle
Pubblicazione: (2025)
More Bang for the Buck: Process Reward Modeling with Entropy-Driven Uncertainty
di: Cao, Lang, et al.
Pubblicazione: (2025)
di: Cao, Lang, et al.
Pubblicazione: (2025)
Reward Reasoning Model
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
RewardBench 2: Advancing Reward Model Evaluation
di: Malik, Saumya, et al.
Pubblicazione: (2025)
di: Malik, Saumya, et al.
Pubblicazione: (2025)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
di: Ma, Qiyao, et al.
Pubblicazione: (2026)
di: Ma, Qiyao, et al.
Pubblicazione: (2026)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
Discriminative Policy Optimization for Token-Level Reward Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2025)
di: Chen, Hongzhan, et al.
Pubblicazione: (2025)
Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
Enhancing Large Language Models with Reward-guided Tree Search for Knowledge Graph Question and Answering
di: Long, Xiao, et al.
Pubblicazione: (2025)
di: Long, Xiao, et al.
Pubblicazione: (2025)
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
di: Li, Xiaomin, et al.
Pubblicazione: (2024)
di: Li, Xiaomin, et al.
Pubblicazione: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
di: Men, Tianyi, et al.
Pubblicazione: (2025)
di: Men, Tianyi, et al.
Pubblicazione: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
di: Huang, Hui, et al.
Pubblicazione: (2026)
di: Huang, Hui, et al.
Pubblicazione: (2026)
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
di: Wu, Keming, et al.
Pubblicazione: (2025)
di: Wu, Keming, et al.
Pubblicazione: (2025)
Tool-Augmented Reward Modeling
di: Li, Lei, et al.
Pubblicazione: (2023)
di: Li, Lei, et al.
Pubblicazione: (2023)
Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling
di: Guo, Jizhou, et al.
Pubblicazione: (2025)
di: Guo, Jizhou, et al.
Pubblicazione: (2025)
ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
di: Xiong, Xuan, et al.
Pubblicazione: (2026)
di: Xiong, Xuan, et al.
Pubblicazione: (2026)
GRAM: A Generative Foundation Reward Model for Reward Generalization
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
di: Chen, Peter, et al.
Pubblicazione: (2025)
di: Chen, Peter, et al.
Pubblicazione: (2025)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
di: Tejaswi, Atula, et al.
Pubblicazione: (2026)
di: Tejaswi, Atula, et al.
Pubblicazione: (2026)
SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness
di: Lu, Jingyu, et al.
Pubblicazione: (2026)
di: Lu, Jingyu, et al.
Pubblicazione: (2026)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
PARM: Pipeline-Adapted Reward Model
di: Fan, Xingyu, et al.
Pubblicazione: (2026)
di: Fan, Xingyu, et al.
Pubblicazione: (2026)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
di: Peng, Hao, et al.
Pubblicazione: (2026)
di: Peng, Hao, et al.
Pubblicazione: (2026)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
di: Zang, Yuhang, et al.
Pubblicazione: (2025)
di: Zang, Yuhang, et al.
Pubblicazione: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026)
di: Bai, Yang, et al.
Pubblicazione: (2026)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Tailoring Self-Rationalizers with Multi-Reward Distillation
di: Ramnath, Sahana, et al.
Pubblicazione: (2023)
di: Ramnath, Sahana, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Data-adaptive Safety Rules for Training Reward Models
di: Li, Xiaomin, et al.
Pubblicazione: (2025) -
CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs
di: Chen, Sijia, et al.
Pubblicazione: (2025) -
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025) -
Entropy-Regularized Process Reward Model
di: Zhang, Hanning, et al.
Pubblicazione: (2024) -
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)