ARGS: Alignment as Reward-Guided Search
Fuente:
arXiv
Guardado en:
| Autores principales: | Khanov, Maxim, Burapacheep, Jirayu, Li, Yixuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence
por: Choi, Hyeong Kyu, et al.
Publicado: (2025)
por: Choi, Hyeong Kyu, et al.
Publicado: (2025)
Your Classifier Can Be Secretly a Likelihood-Based OOD Detector
por: Burapacheep, Jirayu, et al.
Publicado: (2024)
por: Burapacheep, Jirayu, et al.
Publicado: (2024)
Fantastic Bugs and Where to Find Them in AI Benchmarks
por: Truong, Sang, et al.
Publicado: (2025)
por: Truong, Sang, et al.
Publicado: (2025)
Reward-free Alignment for Conflicting Objectives
por: Chen, Peter, et al.
Publicado: (2026)
por: Chen, Peter, et al.
Publicado: (2026)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
por: Cui, Yingqian, et al.
Publicado: (2025)
por: Cui, Yingqian, et al.
Publicado: (2025)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
por: Li, Yanshi, et al.
Publicado: (2024)
por: Li, Yanshi, et al.
Publicado: (2024)
SALMON: Self-Alignment with Instructable Reward Models
por: Sun, Zhiqing, et al.
Publicado: (2023)
por: Sun, Zhiqing, et al.
Publicado: (2023)
On the Robustness of Reward Models for Language Model Alignment
por: Hong, Jiwoo, et al.
Publicado: (2025)
por: Hong, Jiwoo, et al.
Publicado: (2025)
Rethinking the Role of Proxy Rewards in Language Model Alignment
por: Kim, Sungdong, et al.
Publicado: (2024)
por: Kim, Sungdong, et al.
Publicado: (2024)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
por: Huang, Kexin, et al.
Publicado: (2025)
por: Huang, Kexin, et al.
Publicado: (2025)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
por: Du, Yuhao, et al.
Publicado: (2025)
por: Du, Yuhao, et al.
Publicado: (2025)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
por: Xie, Yutao, et al.
Publicado: (2026)
por: Xie, Yutao, et al.
Publicado: (2026)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
por: Rafailov, Rafael, et al.
Publicado: (2024)
por: Rafailov, Rafael, et al.
Publicado: (2024)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
por: Cheng, Ruoxi, et al.
Publicado: (2025)
por: Cheng, Ruoxi, et al.
Publicado: (2025)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
por: Tejaswi, Atula, et al.
Publicado: (2026)
por: Tejaswi, Atula, et al.
Publicado: (2026)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
por: Zhang, Jiazheng, et al.
Publicado: (2025)
por: Zhang, Jiazheng, et al.
Publicado: (2025)
Reviving The Classics: Active Reward Modeling in Large Language Model Alignment
por: Shen, Yunyi, et al.
Publicado: (2025)
por: Shen, Yunyi, et al.
Publicado: (2025)
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
por: Shen, Yiran, et al.
Publicado: (2025)
por: Shen, Yiran, et al.
Publicado: (2025)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
por: Yang, Rui, et al.
Publicado: (2024)
por: Yang, Rui, et al.
Publicado: (2024)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
por: Wang, Ye, et al.
Publicado: (2026)
por: Wang, Ye, et al.
Publicado: (2026)
Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation
por: Padarha, Shreyansh
Publicado: (2025)
por: Padarha, Shreyansh
Publicado: (2025)
Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time
por: Han, Yixuan, et al.
Publicado: (2025)
por: Han, Yixuan, et al.
Publicado: (2025)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
por: Zheng, Congmin, et al.
Publicado: (2025)
por: Zheng, Congmin, et al.
Publicado: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Nudging: Inference-time Alignment of LLMs via Guided Decoding
por: Fei, Yu, et al.
Publicado: (2024)
por: Fei, Yu, et al.
Publicado: (2024)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
por: Wang, Kaiwen, et al.
Publicado: (2025)
por: Wang, Kaiwen, et al.
Publicado: (2025)
SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling
por: Rizvi, Md Imbesat Hassan, et al.
Publicado: (2025)
por: Rizvi, Md Imbesat Hassan, et al.
Publicado: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
por: Fei, Wu, et al.
Publicado: (2025)
por: Fei, Wu, et al.
Publicado: (2025)
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
por: Bobbili, Sarat Chandra, et al.
Publicado: (2025)
por: Bobbili, Sarat Chandra, et al.
Publicado: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
RewardAnything: Generalizable Principle-Following Reward Models
por: Yu, Zhuohao, et al.
Publicado: (2025)
por: Yu, Zhuohao, et al.
Publicado: (2025)
Process Rewards with Learned Reliability
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
Reward-Robust RLHF in LLMs
por: Yan, Yuzi, et al.
Publicado: (2024)
por: Yan, Yuzi, et al.
Publicado: (2024)
M-RewardBench: Evaluating Reward Models in Multilingual Settings
por: Gureja, Srishti, et al.
Publicado: (2024)
por: Gureja, Srishti, et al.
Publicado: (2024)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
por: Kim, Sunghwan, et al.
Publicado: (2025)
por: Kim, Sunghwan, et al.
Publicado: (2025)
Reward Models Identify Consistency, Not Causality
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
por: Qiu, Jiahao, et al.
Publicado: (2024)
por: Qiu, Jiahao, et al.
Publicado: (2024)
Reformatted Alignment
por: Fan, Run-Ze, et al.
Publicado: (2024)
por: Fan, Run-Ze, et al.
Publicado: (2024)
RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models
por: Yang, Daniel, et al.
Publicado: (2026)
por: Yang, Daniel, et al.
Publicado: (2026)
Ejemplares similares
-
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence
por: Choi, Hyeong Kyu, et al.
Publicado: (2025) -
Your Classifier Can Be Secretly a Likelihood-Based OOD Detector
por: Burapacheep, Jirayu, et al.
Publicado: (2024) -
Fantastic Bugs and Where to Find Them in AI Benchmarks
por: Truong, Sang, et al.
Publicado: (2025) -
Reward-free Alignment for Conflicting Objectives
por: Chen, Peter, et al.
Publicado: (2026) -
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
por: Cui, Yingqian, et al.
Publicado: (2025)