Variance-aware Reward Modeling with Anchor Guidance
Fuente:
arXiv
Saved in:
| Main Authors: | Fang, Shuxing, Han, Ruijian, Zhang, Liangyu, Zhou, Fan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Learning Guarantee of Reward Modeling Using Deep Neural Networks
by: Luo, Yuanhang, et al.
Published: (2025)
by: Luo, Yuanhang, et al.
Published: (2025)
Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning
by: Yu, Shuguang, et al.
Published: (2024)
by: Yu, Shuguang, et al.
Published: (2024)
Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown
by: Lou, Xingzhou, et al.
Published: (2024)
by: Lou, Xingzhou, et al.
Published: (2024)
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
by: Zeng, Guanning, et al.
Published: (2025)
by: Zeng, Guanning, et al.
Published: (2025)
Mitigating Distribution Shift in Model-based Offline RL via Shifts-aware Reward Learning
by: Luo, Wang, et al.
Published: (2024)
by: Luo, Wang, et al.
Published: (2024)
Recent advances in the Bradley--Terry Model: theory, algorithms, and applications
by: Fang, Shuxing, et al.
Published: (2026)
by: Fang, Shuxing, et al.
Published: (2026)
Variance-Reduction Guidance: Sampling Trajectory Optimization for Diffusion Models
by: Xu, Shifeng, et al.
Published: (2025)
by: Xu, Shifeng, et al.
Published: (2025)
Uncertainty-aware Reward Design Process
by: Yang, Yang, et al.
Published: (2025)
by: Yang, Yang, et al.
Published: (2025)
VAE-Inf: A statistically interpretable generative paradigm for imbalanced classification
by: Wu, Hongfei, et al.
Published: (2026)
by: Wu, Hongfei, et al.
Published: (2026)
Statistical inference for pairwise comparison models
by: Han, Ruijian, et al.
Published: (2024)
by: Han, Ruijian, et al.
Published: (2024)
Uncertainty-aware Language Guidance for Concept Bottleneck Models
by: Li, Yangyi, et al.
Published: (2026)
by: Li, Yangyi, et al.
Published: (2026)
Online Knowledge Distillation with Reward Guidance
by: Jia, Chen
Published: (2025)
by: Jia, Chen
Published: (2025)
Adaptive Preference Optimization with Uncertainty-aware Utility Anchor
by: Wang, Xiaobo, et al.
Published: (2025)
by: Wang, Xiaobo, et al.
Published: (2025)
Deep Ranking with Heterogeneous Effects
by: Luo, Yuanhang, et al.
Published: (2026)
by: Luo, Yuanhang, et al.
Published: (2026)
Precise Asymptotics and Refined Regret of Variance-Aware UCB
by: Fan, Yingying, et al.
Published: (2024)
by: Fan, Yingying, et al.
Published: (2024)
Statistical ranking with dynamic covariates
by: Dong, Pinjun, et al.
Published: (2024)
by: Dong, Pinjun, et al.
Published: (2024)
Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
by: Li, Zhuo, et al.
Published: (2025)
by: Li, Zhuo, et al.
Published: (2025)
Anchor-guided Hypergraph Condensation with Dual-level Discrimination
by: Li, Fan, et al.
Published: (2026)
by: Li, Fan, et al.
Published: (2026)
Planning-Augmented Sampling with Early Guidance for High-Reward Discovery
by: Zhu, Rui, et al.
Published: (2025)
by: Zhu, Rui, et al.
Published: (2025)
Conflict-Aware Additive Guidance for Flow Models under Compositional Rewards
by: Yu, Xuehui, et al.
Published: (2026)
by: Yu, Xuehui, et al.
Published: (2026)
Accelerating RLHF Training with Reward Variance Increase
by: Yang, Zonglin, et al.
Published: (2025)
by: Yang, Zonglin, et al.
Published: (2025)
Neural Variance-aware Dueling Bandits with Deep Representation and Shallow Exploration
by: Oh, Youngmin, et al.
Published: (2025)
by: Oh, Youngmin, et al.
Published: (2025)
Adaptive debiased SGD in high-dimensional GLMs with streaming data
by: Han, Ruijian, et al.
Published: (2024)
by: Han, Ruijian, et al.
Published: (2024)
Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models
by: Peysakhovich, Alexander, et al.
Published: (2026)
by: Peysakhovich, Alexander, et al.
Published: (2026)
Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models
by: Kim, Yeongmin, et al.
Published: (2026)
by: Kim, Yeongmin, et al.
Published: (2026)
Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum
by: Li, Jingru, et al.
Published: (2026)
by: Li, Jingru, et al.
Published: (2026)
AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity
by: Zhang, Yu, et al.
Published: (2025)
by: Zhang, Yu, et al.
Published: (2025)
Weight Initialization and Variance Dynamics in Deep Neural Networks and Large Language Models
by: Han, Yankun
Published: (2025)
by: Han, Yankun
Published: (2025)
Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
by: Wan, Zhengyan, et al.
Published: (2025)
by: Wan, Zhengyan, et al.
Published: (2025)
DMRL: Data- and Model-aware Reward Learning for Data Extraction
by: Wang, Zhiqiang, et al.
Published: (2025)
by: Wang, Zhiqiang, et al.
Published: (2025)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
by: Tejaswi, Atula, et al.
Published: (2026)
by: Tejaswi, Atula, et al.
Published: (2026)
TagFog: Textual Anchor Guidance and Fake Outlier Generation for Visual Out-of-Distribution Detection
by: Chen, Jiankang, et al.
Published: (2024)
by: Chen, Jiankang, et al.
Published: (2024)
AdvAnchor: Enhancing Diffusion Model Unlearning with Adversarial Anchors
by: Zhao, Mengnan, et al.
Published: (2024)
by: Zhao, Mengnan, et al.
Published: (2024)
Scaling Reward Modeling without Human Supervision
by: Fan, Jingxuan, et al.
Published: (2026)
by: Fan, Jingxuan, et al.
Published: (2026)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
by: Sun, Shengyang, et al.
Published: (2025)
by: Sun, Shengyang, et al.
Published: (2025)
Calibration-then-Calculation: A Variance Reduced Metric Framework in Deep Click-Through Rate Prediction Models
by: Fan, Yewen, et al.
Published: (2024)
by: Fan, Yewen, et al.
Published: (2024)
Model Merging with Functional Dual Anchors
by: Shi, Kexuan, et al.
Published: (2025)
by: Shi, Kexuan, et al.
Published: (2025)
Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models
by: Kim, Kyuyoung, et al.
Published: (2024)
by: Kim, Kyuyoung, et al.
Published: (2024)
Spectral Enhancement and Pseudo-Anchor Guidance for Infrared-Visible Person Re-Identification
by: Ge, Yiyuan, et al.
Published: (2024)
by: Ge, Yiyuan, et al.
Published: (2024)
Anchor-free Clustering based on Anchor Graph Factorization
by: Mei, Shikun, et al.
Published: (2024)
by: Mei, Shikun, et al.
Published: (2024)
Similar Items
-
Learning Guarantee of Reward Modeling Using Deep Neural Networks
by: Luo, Yuanhang, et al.
Published: (2025) -
Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning
by: Yu, Shuguang, et al.
Published: (2024) -
Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown
by: Lou, Xingzhou, et al.
Published: (2024) -
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
by: Zeng, Guanning, et al.
Published: (2025) -
Mitigating Distribution Shift in Model-based Offline RL via Shifts-aware Reward Learning
by: Luo, Wang, et al.
Published: (2024)