Process Rewards with Learned Reliability
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Jinyuan, Huang, Langlin, Huang, Chengsong, Xu, Shaoyang, Cai, Donghong, Yang, Yuyi, Zhang, Wenxuan, Huang, Jiaxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
por: Huang, Langlin, et al.
Publicado: (2026)
por: Huang, Langlin, et al.
Publicado: (2026)
Training Data Efficiency in Multimodal Process Reward Models
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
Divide, Reweight, and Conquer: A Logit Arithmetic Approach for In-Context Learning
por: Huang, Chengsong, et al.
Publicado: (2024)
por: Huang, Chengsong, et al.
Publicado: (2024)
RelayLLM: Efficient Reasoning via Collaborative Decoding
por: Huang, Chengsong, et al.
Publicado: (2026)
por: Huang, Chengsong, et al.
Publicado: (2026)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
por: Huang, Langlin, et al.
Publicado: (2025)
por: Huang, Langlin, et al.
Publicado: (2025)
Efficient Test-Time Scaling via Self-Calibration
por: Huang, Chengsong, et al.
Publicado: (2025)
por: Huang, Chengsong, et al.
Publicado: (2025)
G-Zero: Self-Play for Open-Ended Generation from Zero Data
por: Huang, Chengsong, et al.
Publicado: (2026)
por: Huang, Chengsong, et al.
Publicado: (2026)
VisPlay: Self-Evolving Vision-Language Models from Images
por: He, Yicheng, et al.
Publicado: (2025)
por: He, Yicheng, et al.
Publicado: (2025)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
por: Huang, Chengsong, et al.
Publicado: (2025)
por: Huang, Chengsong, et al.
Publicado: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024)
por: Lang, Hao, et al.
Publicado: (2024)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
por: Leng, Jixuan, et al.
Publicado: (2025)
por: Leng, Jixuan, et al.
Publicado: (2025)
T-REG: Preference Optimization with Token-Level Reward Regularization
por: Zhou, Wenxuan, et al.
Publicado: (2024)
por: Zhou, Wenxuan, et al.
Publicado: (2024)
Process Reinforcement through Implicit Rewards
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
TTCS: Test-Time Curriculum Synthesis for Self-Evolving
por: Yang, Chengyi, et al.
Publicado: (2026)
por: Yang, Chengyi, et al.
Publicado: (2026)
DC-W2S: Dual-Consensus Weak-to-Strong Training for Reliable Process Reward Modeling in Biological Reasoning
por: Chan, Chi-Min, et al.
Publicado: (2026)
por: Chan, Chi-Min, et al.
Publicado: (2026)
Learn to Reason Efficiently with Adaptive Length-based Reward Shaping
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
por: Fei, Wu, et al.
Publicado: (2025)
por: Fei, Wu, et al.
Publicado: (2025)
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025)
por: Yu, Wenhao, et al.
Publicado: (2025)
Enabling Weak LLMs to Judge Response Reliability via Meta Ranking
por: Liu, Zijun, et al.
Publicado: (2024)
por: Liu, Zijun, et al.
Publicado: (2024)
SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
por: Rahman, Salman, et al.
Publicado: (2025)
por: Rahman, Salman, et al.
Publicado: (2025)
HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
por: Lu, Zhicong, et al.
Publicado: (2026)
por: Lu, Zhicong, et al.
Publicado: (2026)
TabDLM: Free-Form Tabular Data Generation via Joint Numerical-Language Diffusion
por: Cai, Donghong, et al.
Publicado: (2026)
por: Cai, Donghong, et al.
Publicado: (2026)
Selective Preference Optimization via Token-Level Reward Function Estimation
por: Yang, Kailai, et al.
Publicado: (2024)
por: Yang, Kailai, et al.
Publicado: (2024)
Process Reward Models That Think
por: Khalifa, Muhammad, et al.
Publicado: (2025)
por: Khalifa, Muhammad, et al.
Publicado: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025)
por: Ye, Zhiling, et al.
Publicado: (2025)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
por: Zhang, Zhenru, et al.
Publicado: (2025)
por: Zhang, Zhenru, et al.
Publicado: (2025)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
por: Zheng, Congmin, et al.
Publicado: (2025)
por: Zheng, Congmin, et al.
Publicado: (2025)
Reinforcement Learning with Conditional Expectation Reward
por: Xiao, Changyi, et al.
Publicado: (2026)
por: Xiao, Changyi, et al.
Publicado: (2026)
From Explainable to Interpretable Deep Learning for Natural Language Processing in Healthcare: How Far from Reality?
por: Huang, Guangming, et al.
Publicado: (2024)
por: Huang, Guangming, et al.
Publicado: (2024)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
por: Lai, Yuhang, et al.
Publicado: (2024)
por: Lai, Yuhang, et al.
Publicado: (2024)
More Bang for the Buck: Process Reward Modeling with Entropy-Driven Uncertainty
por: Cao, Lang, et al.
Publicado: (2025)
por: Cao, Lang, et al.
Publicado: (2025)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
por: Luo, Ruilin, et al.
Publicado: (2025)
por: Luo, Ruilin, et al.
Publicado: (2025)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
por: Peng, Miao, et al.
Publicado: (2025)
por: Peng, Miao, et al.
Publicado: (2025)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
por: Chen, Lichang, et al.
Publicado: (2024)
por: Chen, Lichang, et al.
Publicado: (2024)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
por: Yang, Junxiao, et al.
Publicado: (2025)
por: Yang, Junxiao, et al.
Publicado: (2025)
MetaScale: Test-Time Scaling with Evolving Meta-Thoughts
por: Liu, Qin, et al.
Publicado: (2025)
por: Liu, Qin, et al.
Publicado: (2025)
OmniStruct: Universal Text-to-Structure Generation across Diverse Schemas
por: Huang, James Y., et al.
Publicado: (2025)
por: Huang, James Y., et al.
Publicado: (2025)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
por: Yang, Wenkai, et al.
Publicado: (2026)
por: Yang, Wenkai, et al.
Publicado: (2026)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
por: Wei, Kangda, et al.
Publicado: (2026)
por: Wei, Kangda, et al.
Publicado: (2026)
MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning
por: Feng, Zhaopeng, et al.
Publicado: (2025)
por: Feng, Zhaopeng, et al.
Publicado: (2025)
Ejemplares similares
-
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
por: Huang, Langlin, et al.
Publicado: (2026) -
Training Data Efficiency in Multimodal Process Reward Models
por: Li, Jinyuan, et al.
Publicado: (2026) -
Divide, Reweight, and Conquer: A Logit Arithmetic Approach for In-Context Learning
por: Huang, Chengsong, et al.
Publicado: (2024) -
RelayLLM: Efficient Reasoning via Collaborative Decoding
por: Huang, Chengsong, et al.
Publicado: (2026) -
POSS: Position Specialist Generates Better Draft for Speculative Decoding
por: Huang, Langlin, et al.
Publicado: (2025)