Rethinking the Role of Proxy Rewards in Language Model Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kim, Sungdong, Seo, Minjoon |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Aligning Large Language Models by On-Policy Self-Judgment
von: Lee, Sangkyu, et al.
Veröffentlicht: (2024)
von: Lee, Sangkyu, et al.
Veröffentlicht: (2024)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
von: Zhu, Yu, et al.
Veröffentlicht: (2024)
von: Zhu, Yu, et al.
Veröffentlicht: (2024)
FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets
von: Ye, Seonghyeon, et al.
Veröffentlicht: (2023)
von: Ye, Seonghyeon, et al.
Veröffentlicht: (2023)
On the Robustness of Reward Models for Language Model Alignment
von: Hong, Jiwoo, et al.
Veröffentlicht: (2025)
von: Hong, Jiwoo, et al.
Veröffentlicht: (2025)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
von: Kim, Sunghwan, et al.
Veröffentlicht: (2025)
von: Kim, Sunghwan, et al.
Veröffentlicht: (2025)
Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization
von: Won, Yunjae, et al.
Veröffentlicht: (2025)
von: Won, Yunjae, et al.
Veröffentlicht: (2025)
Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning
von: Chen, Yifang, et al.
Veröffentlicht: (2024)
von: Chen, Yifang, et al.
Veröffentlicht: (2024)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
von: Tejaswi, Atula, et al.
Veröffentlicht: (2026)
von: Tejaswi, Atula, et al.
Veröffentlicht: (2026)
Reviving The Classics: Active Reward Modeling in Large Language Model Alignment
von: Shen, Yunyi, et al.
Veröffentlicht: (2025)
von: Shen, Yunyi, et al.
Veröffentlicht: (2025)
Generative Prompt Internalization
von: Shin, Haebin, et al.
Veröffentlicht: (2024)
von: Shin, Haebin, et al.
Veröffentlicht: (2024)
SALMON: Self-Alignment with Instructable Reward Models
von: Sun, Zhiqing, et al.
Veröffentlicht: (2023)
von: Sun, Zhiqing, et al.
Veröffentlicht: (2023)
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
von: Sun, Hao, et al.
Veröffentlicht: (2025)
von: Sun, Hao, et al.
Veröffentlicht: (2025)
Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
von: Wen, Xueru, et al.
Veröffentlicht: (2024)
von: Wen, Xueru, et al.
Veröffentlicht: (2024)
Readability $\ne$ Learnability: Rethinking the Role of Simplicity in Training Small Language Models
von: Lee, Ivan, et al.
Veröffentlicht: (2025)
von: Lee, Ivan, et al.
Veröffentlicht: (2025)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
ARGS: Alignment as Reward-Guided Search
von: Khanov, Maxim, et al.
Veröffentlicht: (2024)
von: Khanov, Maxim, et al.
Veröffentlicht: (2024)
Reward-free Alignment for Conflicting Objectives
von: Chen, Peter, et al.
Veröffentlicht: (2026)
von: Chen, Peter, et al.
Veröffentlicht: (2026)
Self-Refinement of Language Models from External Proxy Metrics Feedback
von: Ramji, Keshav, et al.
Veröffentlicht: (2024)
von: Ramji, Keshav, et al.
Veröffentlicht: (2024)
Diversity Measures: Domain-Independent Proxies for Failure in Language Model Queries
von: Ngu, Noel, et al.
Veröffentlicht: (2023)
von: Ngu, Noel, et al.
Veröffentlicht: (2023)
Improving Instruction Following in Language Models through Proxy-Based Uncertainty Estimation
von: Lee, JoonHo, et al.
Veröffentlicht: (2024)
von: Lee, JoonHo, et al.
Veröffentlicht: (2024)
SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMs
von: Kim, Jaehyung, et al.
Veröffentlicht: (2024)
von: Kim, Jaehyung, et al.
Veröffentlicht: (2024)
Value Augmented Sampling for Language Model Alignment and Personalization
von: Han, Seungwook, et al.
Veröffentlicht: (2024)
von: Han, Seungwook, et al.
Veröffentlicht: (2024)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
von: Li, Yanshi, et al.
Veröffentlicht: (2024)
von: Li, Yanshi, et al.
Veröffentlicht: (2024)
Query-Conditioned Test-Time Self-Training for Large Language Models
von: Song, Chaehee, et al.
Veröffentlicht: (2026)
von: Song, Chaehee, et al.
Veröffentlicht: (2026)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
von: Yang, Rui, et al.
Veröffentlicht: (2024)
von: Yang, Rui, et al.
Veröffentlicht: (2024)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2025)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
Hierarchical Reward Design from Language: Enhancing Alignment of Agent Behavior with Human Specifications
von: Qian, Zhiqin, et al.
Veröffentlicht: (2026)
von: Qian, Zhiqin, et al.
Veröffentlicht: (2026)
Rethinking Interpretability in the Era of Large Language Models
von: Singh, Chandan, et al.
Veröffentlicht: (2024)
von: Singh, Chandan, et al.
Veröffentlicht: (2024)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
von: Chen, Peter, et al.
Veröffentlicht: (2025)
von: Chen, Peter, et al.
Veröffentlicht: (2025)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
Process Reward Models That Think
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025)
Self-Generated Critiques Boost Reward Modeling for Language Models
von: Yu, Yue, et al.
Veröffentlicht: (2024)
von: Yu, Yue, et al.
Veröffentlicht: (2024)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
von: Yu, Zhang Ze, et al.
Veröffentlicht: (2023)
von: Yu, Zhang Ze, et al.
Veröffentlicht: (2023)
Self-Training Elicits Concise Reasoning in Large Language Models
von: Munkhbat, Tergel, et al.
Veröffentlicht: (2025)
von: Munkhbat, Tergel, et al.
Veröffentlicht: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
von: Lang, Hao, et al.
Veröffentlicht: (2024)
von: Lang, Hao, et al.
Veröffentlicht: (2024)
Prometheus: Inducing Fine-grained Evaluation Capability in Language Models
von: Kim, Seungone, et al.
Veröffentlicht: (2023)
von: Kim, Seungone, et al.
Veröffentlicht: (2023)
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
von: Feng, Xiao, et al.
Veröffentlicht: (2026)
von: Feng, Xiao, et al.
Veröffentlicht: (2026)
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
von: Shen, Yiran, et al.
Veröffentlicht: (2025)
von: Shen, Yiran, et al.
Veröffentlicht: (2025)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
von: Du, Yuhao, et al.
Veröffentlicht: (2025)
von: Du, Yuhao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Aligning Large Language Models by On-Policy Self-Judgment
von: Lee, Sangkyu, et al.
Veröffentlicht: (2024) -
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
von: Zhu, Yu, et al.
Veröffentlicht: (2024) -
FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets
von: Ye, Seonghyeon, et al.
Veröffentlicht: (2023) -
On the Robustness of Reward Models for Language Model Alignment
von: Hong, Jiwoo, et al.
Veröffentlicht: (2025) -
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
von: Kim, Sunghwan, et al.
Veröffentlicht: (2025)