Reviving The Classics: Active Reward Modeling in Large Language Model Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Yunyi, Sun, Hao, Ton, Jean-François |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
On the Robustness of Reward Models for Language Model Alignment
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
SALMON: Self-Alignment with Instructable Reward Models
di: Sun, Zhiqing, et al.
Pubblicazione: (2023)
di: Sun, Zhiqing, et al.
Pubblicazione: (2023)
Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives
di: Sun, Hao, et al.
Pubblicazione: (2024)
di: Sun, Hao, et al.
Pubblicazione: (2024)
Rethinking the Role of Proxy Rewards in Language Model Alignment
di: Kim, Sungdong, et al.
Pubblicazione: (2024)
di: Kim, Sungdong, et al.
Pubblicazione: (2024)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
di: Tejaswi, Atula, et al.
Pubblicazione: (2026)
di: Tejaswi, Atula, et al.
Pubblicazione: (2026)
Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
di: Alsadat, Shayan Meshkat, et al.
Pubblicazione: (2024)
di: Alsadat, Shayan Meshkat, et al.
Pubblicazione: (2024)
Understanding Chain-of-Thought in LLMs through Information Theory
di: Ton, Jean-Francois, et al.
Pubblicazione: (2024)
di: Ton, Jean-Francois, et al.
Pubblicazione: (2024)
Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning
di: Chen, Yifang, et al.
Pubblicazione: (2024)
di: Chen, Yifang, et al.
Pubblicazione: (2024)
Fine-Tuning Language Models with Reward Learning on Policy
di: Lang, Hao, et al.
Pubblicazione: (2024)
di: Lang, Hao, et al.
Pubblicazione: (2024)
Active Layer-Contrastive Decoding Reduces Hallucination in Large Language Model Generation
di: Zhang, Hongxiang, et al.
Pubblicazione: (2025)
di: Zhang, Hongxiang, et al.
Pubblicazione: (2025)
Active Preference Learning for Large Language Models
di: Muldrew, William, et al.
Pubblicazione: (2024)
di: Muldrew, William, et al.
Pubblicazione: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
di: Zhu, Yu, et al.
Pubblicazione: (2024)
di: Zhu, Yu, et al.
Pubblicazione: (2024)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Probabilistic Token Alignment for Large Language Model Fusion
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
Binary Classifier Optimization for Large Language Model Alignment
di: Jung, Seungjae, et al.
Pubblicazione: (2024)
di: Jung, Seungjae, et al.
Pubblicazione: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
di: He, Jiafan, et al.
Pubblicazione: (2024)
di: He, Jiafan, et al.
Pubblicazione: (2024)
Spectral Editing of Activations for Large Language Model Alignment
di: Qiu, Yifu, et al.
Pubblicazione: (2024)
di: Qiu, Yifu, et al.
Pubblicazione: (2024)
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
di: Feng, Xiao, et al.
Pubblicazione: (2026)
di: Feng, Xiao, et al.
Pubblicazione: (2026)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models
di: Jha, Abha, et al.
Pubblicazione: (2026)
di: Jha, Abha, et al.
Pubblicazione: (2026)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2025)
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2025)
DavIR: Data Selection via Implicit Reward for Large Language Models
di: Zhou, Haotian, et al.
Pubblicazione: (2023)
di: Zhou, Haotian, et al.
Pubblicazione: (2023)
Reward Collapse in Aligning Large Language Models
di: Song, Ziang, et al.
Pubblicazione: (2023)
di: Song, Ziang, et al.
Pubblicazione: (2023)
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
di: Shen, Yiran, et al.
Pubblicazione: (2025)
di: Shen, Yiran, et al.
Pubblicazione: (2025)
ACER: Automatic Language Model Context Extension via Retrieval
di: Gao, Luyu, et al.
Pubblicazione: (2024)
di: Gao, Luyu, et al.
Pubblicazione: (2024)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
di: Zhang, Jiazheng, et al.
Pubblicazione: (2025)
di: Zhang, Jiazheng, et al.
Pubblicazione: (2025)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models
di: Xu, Xingcheng
Pubblicazione: (2025)
di: Xu, Xingcheng
Pubblicazione: (2025)
Alignment Studio: Aligning Large Language Models to Particular Contextual Regulations
di: Achintalwar, Swapnaja, et al.
Pubblicazione: (2024)
di: Achintalwar, Swapnaja, et al.
Pubblicazione: (2024)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2023)
di: Zhao, Siyan, et al.
Pubblicazione: (2023)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
Automated ICD Classification of Psychiatric Diagnoses: From Classical NLP to Large Language Models
di: Ortega, Fernando, et al.
Pubblicazione: (2026)
di: Ortega, Fernando, et al.
Pubblicazione: (2026)
Self-Play Preference Optimization for Language Model Alignment
di: Wu, Yue, et al.
Pubblicazione: (2024)
di: Wu, Yue, et al.
Pubblicazione: (2024)
Large Language Model Pruning
di: Huang, Hanjuan, et al.
Pubblicazione: (2024)
di: Huang, Hanjuan, et al.
Pubblicazione: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
di: Yu, Yue, et al.
Pubblicazione: (2024)
di: Yu, Yue, et al.
Pubblicazione: (2024)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
di: Yu, Zhang Ze, et al.
Pubblicazione: (2023)
di: Yu, Zhang Ze, et al.
Pubblicazione: (2023)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
di: Sun, Hao, et al.
Pubblicazione: (2025) -
On the Robustness of Reward Models for Language Model Alignment
di: Hong, Jiwoo, et al.
Pubblicazione: (2025) -
SALMON: Self-Alignment with Instructable Reward Models
di: Sun, Zhiqing, et al.
Pubblicazione: (2023) -
Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives
di: Sun, Hao, et al.
Pubblicazione: (2024) -
Rethinking the Role of Proxy Rewards in Language Model Alignment
di: Kim, Sungdong, et al.
Pubblicazione: (2024)