Critique-out-Loud Reward Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ankner, Zachary, Paul, Mansheej, Cui, Brandon, Chang, Jonathan D., Ammanabrolu, Prithviraj |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
di: Shen, Yiran, et al.
Pubblicazione: (2025)
di: Shen, Yiran, et al.
Pubblicazione: (2025)
Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning
di: Kim, Bosung, et al.
Pubblicazione: (2025)
di: Kim, Bosung, et al.
Pubblicazione: (2025)
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
di: Wang, Ruiyi, et al.
Pubblicazione: (2025)
di: Wang, Ruiyi, et al.
Pubblicazione: (2025)
How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess
di: Dionisopoulos, Lucas, et al.
Pubblicazione: (2026)
di: Dionisopoulos, Lucas, et al.
Pubblicazione: (2026)
Preference-Based Learning in Audio Applications: A Systematic Analysis
di: Broukhim, Aaron, et al.
Pubblicazione: (2025)
di: Broukhim, Aaron, et al.
Pubblicazione: (2025)
Scaling Laws for Precision
di: Kumar, Tanishq, et al.
Pubblicazione: (2024)
di: Kumar, Tanishq, et al.
Pubblicazione: (2024)
Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
di: Cui, Brandon, et al.
Pubblicazione: (2026)
di: Cui, Brandon, et al.
Pubblicazione: (2026)
$μ$nit Scaling: Simple and Scalable FP8 LLM Training
di: Narayan, Saaketh, et al.
Pubblicazione: (2025)
di: Narayan, Saaketh, et al.
Pubblicazione: (2025)
Does your data spark joy? Performance gains from domain upsampling at the end of training
di: Blakeney, Cody, et al.
Pubblicazione: (2024)
di: Blakeney, Cody, et al.
Pubblicazione: (2024)
Soup to go: mitigating forgetting during continual learning with model averaging
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
Self-Generated Critiques Boost Reward Modeling for Language Models
di: Yu, Yue, et al.
Pubblicazione: (2024)
di: Yu, Yue, et al.
Pubblicazione: (2024)
In-context Ranking Preference Optimization
di: Wu, Junda, et al.
Pubblicazione: (2025)
di: Wu, Junda, et al.
Pubblicazione: (2025)
Silent Tokens, Loud Effects: Padding in LLMs
di: Himelstein, Rom, et al.
Pubblicazione: (2025)
di: Himelstein, Rom, et al.
Pubblicazione: (2025)
MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
di: Surana, Rohan, et al.
Pubblicazione: (2026)
di: Surana, Rohan, et al.
Pubblicazione: (2026)
Decoding the Critique Mechanism in Large Reasoning Models
di: Phan, Hoang, et al.
Pubblicazione: (2026)
di: Phan, Hoang, et al.
Pubblicazione: (2026)
Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight
di: Cui, Christopher Z., et al.
Pubblicazione: (2026)
di: Cui, Christopher Z., et al.
Pubblicazione: (2026)
BaNEL: Exploration Posteriors for Generative Modeling Using Only Negative Rewards
di: Lee, Sangyun, et al.
Pubblicazione: (2025)
di: Lee, Sangyun, et al.
Pubblicazione: (2025)
Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking
di: Eisenstein, Jacob, et al.
Pubblicazione: (2023)
di: Eisenstein, Jacob, et al.
Pubblicazione: (2023)
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
di: Oertell, Owen, et al.
Pubblicazione: (2024)
di: Oertell, Owen, et al.
Pubblicazione: (2024)
Provably Sample-Efficient Robust Reinforcement Learning with Average Reward
di: Roch, Zachary, et al.
Pubblicazione: (2025)
di: Roch, Zachary, et al.
Pubblicazione: (2025)
LoRA Training Provably Converges to a Low-Rank Global Minimum or It Fails Loudly (But it Probably Won't Fail)
di: Kim, Junsu, et al.
Pubblicazione: (2025)
di: Kim, Junsu, et al.
Pubblicazione: (2025)
Policy Learning from Large Vision-Language Model Feedback without Reward Modeling
di: Luu, Tung M., et al.
Pubblicazione: (2025)
di: Luu, Tung M., et al.
Pubblicazione: (2025)
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
di: Shahani, Prithviraj Singh, et al.
Pubblicazione: (2025)
di: Shahani, Prithviraj Singh, et al.
Pubblicazione: (2025)
Dreaming Out Loud: A Self-Synthesis Approach For Training Vision-Language Models With Developmentally Plausible Data
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024)
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024)
Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models
di: Williams, Jonathan, et al.
Pubblicazione: (2026)
di: Williams, Jonathan, et al.
Pubblicazione: (2026)
RewardBench: Evaluating Reward Models for Language Modeling
di: Lambert, Nathan, et al.
Pubblicazione: (2024)
di: Lambert, Nathan, et al.
Pubblicazione: (2024)
Explanation through Reward Model Reconciliation using POMDP Tree Search
di: Kraske, Benjamin D., et al.
Pubblicazione: (2023)
di: Kraske, Benjamin D., et al.
Pubblicazione: (2023)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
di: Lee, Younghwan, et al.
Pubblicazione: (2025)
di: Lee, Younghwan, et al.
Pubblicazione: (2025)
Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling
di: Nikulkov, Alex
Pubblicazione: (2026)
di: Nikulkov, Alex
Pubblicazione: (2026)
Noise Contrastive Alignment of Language Models with Explicit Rewards
di: Chen, Huayu, et al.
Pubblicazione: (2024)
di: Chen, Huayu, et al.
Pubblicazione: (2024)
EvilGenie: A Reward Hacking Benchmark
di: Gabor, Jonathan, et al.
Pubblicazione: (2025)
di: Gabor, Jonathan, et al.
Pubblicazione: (2025)
Generative Reward Models
di: Mahan, Dakota, et al.
Pubblicazione: (2024)
di: Mahan, Dakota, et al.
Pubblicazione: (2024)
Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)
Bandit Simulation for Average Reward Inference
di: Praharaj, Samya, et al.
Pubblicazione: (2026)
di: Praharaj, Samya, et al.
Pubblicazione: (2026)
Critiques of World Models
di: Xing, Eric, et al.
Pubblicazione: (2025)
di: Xing, Eric, et al.
Pubblicazione: (2025)
Activation Reward Models for Few-Shot Model Alignment
di: Chai, Tianning, et al.
Pubblicazione: (2025)
di: Chai, Tianning, et al.
Pubblicazione: (2025)
Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models
di: Tiwari, Rishabh, et al.
Pubblicazione: (2026)
di: Tiwari, Rishabh, et al.
Pubblicazione: (2026)
Learning to Keep a Promise: Scaling Language Model Decoding Parallelism with Learned Asynchronous Decoding
di: Jin, Tian, et al.
Pubblicazione: (2025)
di: Jin, Tian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
di: Shen, Yiran, et al.
Pubblicazione: (2025) -
Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models
di: Ankner, Zachary, et al.
Pubblicazione: (2024) -
Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning
di: Kim, Bosung, et al.
Pubblicazione: (2025) -
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
di: Wang, Ruiyi, et al.
Pubblicazione: (2025) -
How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess
di: Dionisopoulos, Lucas, et al.
Pubblicazione: (2026)