Semi-Supervised Reward Modeling via Iterative Self-Training
Fuente:
arXiv
Saved in:
| Main Authors: | He, Yifei, Wang, Haoxiang, Jiang, Ziyan, Papangelis, Alexandros, Zhao, Han |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Gradual Domain Adaptation: Theory and Algorithms
by: He, Yifei, et al.
Published: (2023)
by: He, Yifei, et al.
Published: (2023)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
by: Wang, Haoxiang, et al.
Published: (2024)
by: Wang, Haoxiang, et al.
Published: (2024)
Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training
by: Long, Yunbo, et al.
Published: (2026)
by: Long, Yunbo, et al.
Published: (2026)
SemiReward: A General Reward Model for Semi-supervised Learning
by: Li, Siyuan, et al.
Published: (2023)
by: Li, Siyuan, et al.
Published: (2023)
Adversarial Training of Reward Models
by: Bukharin, Alexander, et al.
Published: (2025)
by: Bukharin, Alexander, et al.
Published: (2025)
Enhancing Semi-Supervised Multi-View Graph Convolutional Networks via Supervised Contrastive Learning and Self-Training
by: Xiao, Huaiyuan, et al.
Published: (2025)
by: Xiao, Huaiyuan, et al.
Published: (2025)
Iterative Foundation Model Fine-Tuning on Multiple Rewards
by: Ghari, Pouya M., et al.
Published: (2025)
by: Ghari, Pouya M., et al.
Published: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
by: Dong, Hanze, et al.
Published: (2024)
by: Dong, Hanze, et al.
Published: (2024)
An Analytical Multiple Criteria Framework for Temporal and Dynamic Business-to-Business Customer Segmentation in Manufacturing
by: Raees, Muhammad, et al.
Published: (2026)
by: Raees, Muhammad, et al.
Published: (2026)
Generalized Semi-Supervised Learning via Self-Supervised Feature Adaptation
by: Liang, Jiachen, et al.
Published: (2024)
by: Liang, Jiachen, et al.
Published: (2024)
GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment
by: He, Haoyang, et al.
Published: (2025)
by: He, Haoyang, et al.
Published: (2025)
LaMM: Semi-Supervised Pre-Training of Large-Scale Materials Models
by: Oyama, Yosuke, et al.
Published: (2025)
by: Oyama, Yosuke, et al.
Published: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
Reward-Free Curricula for Training Robust World Models
by: Rigter, Marc, et al.
Published: (2023)
by: Rigter, Marc, et al.
Published: (2023)
CRISP: Compressed Reasoning via Iterative Self-Policy Distillation
by: Sang, Hejian, et al.
Published: (2026)
by: Sang, Hejian, et al.
Published: (2026)
Rethinking Semi-Supervised Node Classification with Self-Supervised Graph Clustering
by: Wang, Songbo, et al.
Published: (2025)
by: Wang, Songbo, et al.
Published: (2025)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
by: Liang, Yu, et al.
Published: (2026)
by: Liang, Yu, et al.
Published: (2026)
Exploring Correlations of Self-Supervised Tasks for Graphs
by: Fang, Taoran, et al.
Published: (2024)
by: Fang, Taoran, et al.
Published: (2024)
Self-Supervised Learning of Iterative Solvers for Constrained Optimization
by: Lüken, Lukas, et al.
Published: (2024)
by: Lüken, Lukas, et al.
Published: (2024)
Semi-Supervised Learning with Multi-Head Co-Training
by: Chen, Mingcai, et al.
Published: (2021)
by: Chen, Mingcai, et al.
Published: (2021)
A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning
by: Li, Mengqi, et al.
Published: (2025)
by: Li, Mengqi, et al.
Published: (2025)
In-Context Symmetries: Self-Supervised Learning through Contextual World Models
by: Gupta, Sharut, et al.
Published: (2024)
by: Gupta, Sharut, et al.
Published: (2024)
Scaling Reward Modeling without Human Supervision
by: Fan, Jingxuan, et al.
Published: (2026)
by: Fan, Jingxuan, et al.
Published: (2026)
Supervised Reward Inference
by: Schwarzer, Will, et al.
Published: (2025)
by: Schwarzer, Will, et al.
Published: (2025)
Asynchronous Training Schemes in Distributed Learning with Time Delay
by: Wang, Haoxiang, et al.
Published: (2022)
by: Wang, Haoxiang, et al.
Published: (2022)
Reward Model Overoptimisation in Iterated RLHF
by: Wolf, Lorenz, et al.
Published: (2025)
by: Wolf, Lorenz, et al.
Published: (2025)
In-Context Semi-Supervised Learning
by: Fan, Jiashuo, et al.
Published: (2025)
by: Fan, Jiashuo, et al.
Published: (2025)
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
by: Jiang, Haoxiang, et al.
Published: (2026)
by: Jiang, Haoxiang, et al.
Published: (2026)
Robust Semi-Supervised Learning for Self-learning Open-World Classes
by: Xi, Wenjuan, et al.
Published: (2024)
by: Xi, Wenjuan, et al.
Published: (2024)
Robust Semi-Supervised Classification using GANs with Self-Organizing Maps
by: Fick, Ronald, et al.
Published: (2021)
by: Fick, Ronald, et al.
Published: (2021)
Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
by: Wang, Qi, et al.
Published: (2025)
by: Wang, Qi, et al.
Published: (2025)
Enhancing Compositional Generalization via Compositional Feature Alignment
by: Wang, Haoxiang, et al.
Published: (2024)
by: Wang, Haoxiang, et al.
Published: (2024)
RoiRL: Efficient, Self-Supervised Reasoning with Offline Iterative Reinforcement Learning
by: Arzhantsev, Aleksei, et al.
Published: (2025)
by: Arzhantsev, Aleksei, et al.
Published: (2025)
TRiCo: Triadic Game-Theoretic Co-Training for Robust Semi-Supervised Learning
by: He, Hongyang, et al.
Published: (2025)
by: He, Hongyang, et al.
Published: (2025)
Adversarial Training for Process Reward Models
by: Juneja, Gurusha, et al.
Published: (2025)
by: Juneja, Gurusha, et al.
Published: (2025)
Iterative Model-Learning Scheme via Gaussian Processes for Nonlinear Model Predictive Control of (Semi-)Batch Processes
by: Tan, Tai Xuan, et al.
Published: (2026)
by: Tan, Tai Xuan, et al.
Published: (2026)
Re-Evaluating the Impact of Unseen-Class Unlabeled Data on Semi-Supervised Learning Model
by: He, Rundong, et al.
Published: (2025)
by: He, Rundong, et al.
Published: (2025)
Negative-Free Self-Supervised Gaussian Embedding of Graphs
by: Liu, Yunhui, et al.
Published: (2024)
by: Liu, Yunhui, et al.
Published: (2024)
Semi-Supervised Multi-Label Feature Selection with Consistent Sparse Graph Learning
by: Zhong, Yan, et al.
Published: (2025)
by: Zhong, Yan, et al.
Published: (2025)
Hypergraph Transformer for Semi-Supervised Classification
by: Liu, Zexi, et al.
Published: (2023)
by: Liu, Zexi, et al.
Published: (2023)
Similar Items
-
Gradual Domain Adaptation: Theory and Algorithms
by: He, Yifei, et al.
Published: (2023) -
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
by: Wang, Haoxiang, et al.
Published: (2024) -
Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training
by: Long, Yunbo, et al.
Published: (2026) -
SemiReward: A General Reward Model for Semi-supervised Learning
by: Li, Siyuan, et al.
Published: (2023) -
Adversarial Training of Reward Models
by: Bukharin, Alexander, et al.
Published: (2025)