Saved in:
| Main Authors: | Xie, Bin, Xu, Bingbing, Tian, Xueyun, Chen, Yilin, Shen, Huawei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2601.12748 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment
by: Xie, Bin, et al.
Published: (2025)
by: Xie, Bin, et al.
Published: (2025)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
by: Tian, Xueyun, et al.
Published: (2026)
by: Tian, Xueyun, et al.
Published: (2026)
Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization
by: Tian, Xueyun, et al.
Published: (2026)
by: Tian, Xueyun, et al.
Published: (2026)
R$^2$PO: Decoupling Training Trajectories from Inference Responses for LLM Reasoning
by: Wang, Jingchu, et al.
Published: (2026)
by: Wang, Jingchu, et al.
Published: (2026)
Multi-Personality Generation of LLMs at Decoding-time
by: Chen, Rongxin, et al.
Published: (2025)
by: Chen, Rongxin, et al.
Published: (2025)
MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing
by: Tian, Xueyun, et al.
Published: (2025)
by: Tian, Xueyun, et al.
Published: (2025)
List-aware Reranking-Truncation Joint Model for Search and Retrieval-augmented Generation
by: Xu, Shicheng, et al.
Published: (2024)
by: Xu, Shicheng, et al.
Published: (2024)
Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents
by: Li, Yunfan, et al.
Published: (2026)
by: Li, Yunfan, et al.
Published: (2026)
RRM: Robust Reward Model Training Mitigates Reward Hacking
by: Liu, Tianqi, et al.
Published: (2024)
by: Liu, Tianqi, et al.
Published: (2024)
GIFT: Games as Informal Training for Generalizable LLMs
by: Lyu, Nuoyan, et al.
Published: (2026)
by: Lyu, Nuoyan, et al.
Published: (2026)
AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification
by: Tan, Xiaoyu, et al.
Published: (2025)
by: Tan, Xiaoyu, et al.
Published: (2025)
Inference-time Alignment in Continuous Space
by: Yuan, Yige, et al.
Published: (2025)
by: Yuan, Yige, et al.
Published: (2025)
Fact-Level Confidence Calibration and Self-Correction
by: Yuan, Yige, et al.
Published: (2024)
by: Yuan, Yige, et al.
Published: (2024)
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
by: Zhang, Qi, et al.
Published: (2025)
by: Zhang, Qi, et al.
Published: (2025)
On the Diminishing Returns of Complex Robust RAG Training in the Era of Powerful LLMs
by: Ding, Hanxing, et al.
Published: (2025)
by: Ding, Hanxing, et al.
Published: (2025)
Noise Contrastive Alignment of Language Models with Explicit Rewards
by: Chen, Huayu, et al.
Published: (2024)
by: Chen, Huayu, et al.
Published: (2024)
Reward-Robust RLHF in LLMs
by: Yan, Yuzi, et al.
Published: (2024)
by: Yan, Yuzi, et al.
Published: (2024)
ViLBench: A Suite for Vision-Language Process Reward Modeling
by: Tu, Haoqin, et al.
Published: (2025)
by: Tu, Haoqin, et al.
Published: (2025)
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
by: Qiu, Zhisong, et al.
Published: (2026)
by: Qiu, Zhisong, et al.
Published: (2026)
Think Before You Speak: Cultivating Communication Skills of Large Language Models via Inner Monologue
by: Zhou, Junkai, et al.
Published: (2023)
by: Zhou, Junkai, et al.
Published: (2023)
Process Rewards with Learned Reliability
by: Li, Jinyuan, et al.
Published: (2026)
by: Li, Jinyuan, et al.
Published: (2026)
The Bidirectional Process Reward Model
by: Zhang, Lingyin, et al.
Published: (2025)
by: Zhang, Lingyin, et al.
Published: (2025)
D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models
by: Gu, Jia, et al.
Published: (2026)
by: Gu, Jia, et al.
Published: (2026)
Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents
by: Xu, Xiucheng, et al.
Published: (2026)
by: Xu, Xiucheng, et al.
Published: (2026)
SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
by: Ding, Yuyang, et al.
Published: (2025)
by: Ding, Yuyang, et al.
Published: (2025)
RLKD: Distilling LLMs' Reasoning via Reinforcement Learning
by: Xu, Shicheng, et al.
Published: (2025)
by: Xu, Shicheng, et al.
Published: (2025)
R-PRM: Reasoning-Driven Process Reward Modeling
by: She, Shuaijie, et al.
Published: (2025)
by: She, Shuaijie, et al.
Published: (2025)
Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks
by: Xu, Shicheng, et al.
Published: (2023)
by: Xu, Shicheng, et al.
Published: (2023)
Dynamic and Generalizable Process Reward Modeling
by: Yin, Zhangyue, et al.
Published: (2025)
by: Yin, Zhangyue, et al.
Published: (2025)
Enhancing Training Data Attribution for Large Language Models with Fitting Error Consideration
by: Wu, Kangxi, et al.
Published: (2024)
by: Wu, Kangxi, et al.
Published: (2024)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
by: Sun, Shengyang, et al.
Published: (2025)
by: Sun, Shengyang, et al.
Published: (2025)
Do LLMs Play Dice? Exploring Probability Distribution Sampling in Large Language Models for Behavioral Simulation
by: Gu, Jia, et al.
Published: (2024)
by: Gu, Jia, et al.
Published: (2024)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
by: Pathmanathan, Pankayaraj, et al.
Published: (2025)
by: Pathmanathan, Pankayaraj, et al.
Published: (2025)
Following the Autoregressive Nature of LLM Embeddings via Compression and Alignment
by: Deng, Jingcheng, et al.
Published: (2025)
by: Deng, Jingcheng, et al.
Published: (2025)
Autoregressive Multi-trait Essay Scoring via Reinforcement Learning with Scoring-aware Multiple Rewards
by: Do, Heejin, et al.
Published: (2024)
by: Do, Heejin, et al.
Published: (2024)
Generalist Reward Models: Found Inside Large Language Models
by: Li, Yi-Chen, et al.
Published: (2025)
by: Li, Yi-Chen, et al.
Published: (2025)
CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards
by: Zhang, Taolin, et al.
Published: (2025)
by: Zhang, Taolin, et al.
Published: (2025)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
by: Wen, Bosi, et al.
Published: (2026)
by: Wen, Bosi, et al.
Published: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards
by: Zhang, Dengjia, et al.
Published: (2026)
by: Zhang, Dengjia, et al.
Published: (2026)
Similar Items
-
From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment
by: Xie, Bin, et al.
Published: (2025) -
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
by: Tian, Xueyun, et al.
Published: (2026) -
Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization
by: Tian, Xueyun, et al.
Published: (2026) -
R$^2$PO: Decoupling Training Trajectories from Inference Responses for LLM Reasoning
by: Wang, Jingchu, et al.
Published: (2026) -
Multi-Personality Generation of LLMs at Decoding-time
by: Chen, Rongxin, et al.
Published: (2025)