Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
Fuente:
arXiv
Guardado en:
| Autores principales: | Zang, Jianxiang, Wei, Yongda, Bai, Ruxue, Jiang, Shiyu, Mo, Nijia, Li, Binhong, Sun, Qiang, Liu, Hui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
por: Zang, Jianxiang, et al.
Publicado: (2025)
por: Zang, Jianxiang, et al.
Publicado: (2025)
S2Sent: Nested Selectivity Aware Sentence Representation Learning
por: Zang, Jianxiang, et al.
Publicado: (2025)
por: Zang, Jianxiang, et al.
Publicado: (2025)
Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation
por: Zang, Jianxiang
Publicado: (2025)
por: Zang, Jianxiang
Publicado: (2025)
Explanation based Bias Decoupling Regularization for Natural Language Inference
por: Zang, Jianxiang, et al.
Publicado: (2024)
por: Zang, Jianxiang, et al.
Publicado: (2024)
Modeling Selective Feature Attention for Representation-based Siamese Text Matching
por: Zang, Jianxiang, et al.
Publicado: (2024)
por: Zang, Jianxiang, et al.
Publicado: (2024)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
por: Huang, Hui, et al.
Publicado: (2026)
por: Huang, Hui, et al.
Publicado: (2026)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
por: Men, Tianyi, et al.
Publicado: (2025)
por: Men, Tianyi, et al.
Publicado: (2025)
Inference-Time Scaling for Generalist Reward Modeling
por: Liu, Zijun, et al.
Publicado: (2025)
por: Liu, Zijun, et al.
Publicado: (2025)
Small Reward Models via Backward Inference
por: Wang, Yike, et al.
Publicado: (2026)
por: Wang, Yike, et al.
Publicado: (2026)
RRM: Robust Reward Model Training Mitigates Reward Hacking
por: Liu, Tianqi, et al.
Publicado: (2024)
por: Liu, Tianqi, et al.
Publicado: (2024)
Consolidating Rewarded Perturbations for LLM Post-Training
por: Zhang, Zheyu, et al.
Publicado: (2026)
por: Zhang, Zheyu, et al.
Publicado: (2026)
Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling
por: Li, Jiachun, et al.
Publicado: (2025)
por: Li, Jiachun, et al.
Publicado: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
por: Elle
Publicado: (2025)
por: Elle
Publicado: (2025)
Reward Reasoning Model
por: Guo, Jiaxin, et al.
Publicado: (2025)
por: Guo, Jiaxin, et al.
Publicado: (2025)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
por: Zhou, Hongli, et al.
Publicado: (2026)
por: Zhou, Hongli, et al.
Publicado: (2026)
ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models
por: Li, Xiaomin, et al.
Publicado: (2025)
por: Li, Xiaomin, et al.
Publicado: (2025)
Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning
por: Mo, Shentong
Publicado: (2026)
por: Mo, Shentong
Publicado: (2026)
Reward Prediction with Factorized World States
por: Shen, Yijun, et al.
Publicado: (2026)
por: Shen, Yijun, et al.
Publicado: (2026)
On the Power of (Approximate) Reward Models for Inference-Time Scaling
por: Zhu, Youheng, et al.
Publicado: (2026)
por: Zhu, Youheng, et al.
Publicado: (2026)
RewardBench 2: Advancing Reward Model Evaluation
por: Malik, Saumya, et al.
Publicado: (2025)
por: Malik, Saumya, et al.
Publicado: (2025)
Tool-Augmented Reward Modeling
por: Li, Lei, et al.
Publicado: (2023)
por: Li, Lei, et al.
Publicado: (2023)
RewardAnything: Generalizable Principle-Following Reward Models
por: Yu, Zhuohao, et al.
Publicado: (2025)
por: Yu, Zhuohao, et al.
Publicado: (2025)
Libra: Assessing and Improving Reward Model by Learning to Think
por: Zhou, Meng, et al.
Publicado: (2025)
por: Zhou, Meng, et al.
Publicado: (2025)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
por: Pathmanathan, Pankayaraj, et al.
Publicado: (2025)
por: Pathmanathan, Pankayaraj, et al.
Publicado: (2025)
PARM: Pipeline-Adapted Reward Model
por: Fan, Xingyu, et al.
Publicado: (2026)
por: Fan, Xingyu, et al.
Publicado: (2026)
DocReward: A Document Reward Model for Structuring and Stylizing
por: Liu, Junpeng, et al.
Publicado: (2025)
por: Liu, Junpeng, et al.
Publicado: (2025)
GRAM: A Generative Foundation Reward Model for Reward Generalization
por: Wang, Chenglong, et al.
Publicado: (2025)
por: Wang, Chenglong, et al.
Publicado: (2025)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
por: Sun, Mengyuan, et al.
Publicado: (2026)
por: Sun, Mengyuan, et al.
Publicado: (2026)
Dynamic and Generalizable Process Reward Modeling
por: Yin, Zhangyue, et al.
Publicado: (2025)
por: Yin, Zhangyue, et al.
Publicado: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
por: Bai, Yang, et al.
Publicado: (2026)
por: Bai, Yang, et al.
Publicado: (2026)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
por: Zang, Yuhang, et al.
Publicado: (2025)
por: Zang, Yuhang, et al.
Publicado: (2025)
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
por: Wu, Keming, et al.
Publicado: (2025)
por: Wu, Keming, et al.
Publicado: (2025)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
por: Jiang, Yuxin, et al.
Publicado: (2026)
por: Jiang, Yuxin, et al.
Publicado: (2026)
Inference Time Alignment with Reward-Guided Tree Search
por: Hung, Chia-Yu, et al.
Publicado: (2024)
por: Hung, Chia-Yu, et al.
Publicado: (2024)
Towards Real-world Scenario: Imbalanced New Intent Discovery
por: Zhang, Shun, et al.
Publicado: (2024)
por: Zhang, Shun, et al.
Publicado: (2024)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
por: Sun, Zhongxiang, et al.
Publicado: (2025)
por: Sun, Zhongxiang, et al.
Publicado: (2025)
StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios
por: Wang, Sizhe, et al.
Publicado: (2026)
por: Wang, Sizhe, et al.
Publicado: (2026)
ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards
por: Li, Shiyu, et al.
Publicado: (2025)
por: Li, Shiyu, et al.
Publicado: (2025)
Ejemplares similares
-
Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
por: Zang, Jianxiang, et al.
Publicado: (2025) -
S2Sent: Nested Selectivity Aware Sentence Representation Learning
por: Zang, Jianxiang, et al.
Publicado: (2025) -
Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation
por: Zang, Jianxiang
Publicado: (2025) -
Explanation based Bias Decoupling Regularization for Natural Language Inference
por: Zang, Jianxiang, et al.
Publicado: (2024) -
Modeling Selective Feature Attention for Representation-based Siamese Text Matching
por: Zang, Jianxiang, et al.
Publicado: (2024)