FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Ruiyi, Qin, Peijia, Cao, Qi, Xue, Eric, Xie, Pengtao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding
by: Zhang, Ruiyi, et al.
Published: (2025)
by: Zhang, Ruiyi, et al.
Published: (2025)
SecCodePRM: A Process Reward Model for Code Security
by: Yu, Weichen, et al.
Published: (2026)
by: Yu, Weichen, et al.
Published: (2026)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
by: Cao, Qi, et al.
Published: (2025)
by: Cao, Qi, et al.
Published: (2025)
Leveraging Reward Models for Guiding Code Review Comment Generation
by: Sghaier, Oussama Ben, et al.
Published: (2025)
by: Sghaier, Oussama Ben, et al.
Published: (2025)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
by: Fan, Lishui, et al.
Published: (2025)
by: Fan, Lishui, et al.
Published: (2025)
DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation
by: Qin, Peijia, et al.
Published: (2026)
by: Qin, Peijia, et al.
Published: (2026)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
by: Li, Xin-Ye, et al.
Published: (2026)
by: Li, Xin-Ye, et al.
Published: (2026)
Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards
by: Jolfaei, Erfan Aghadavoodi, et al.
Published: (2026)
by: Jolfaei, Erfan Aghadavoodi, et al.
Published: (2026)
DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training
by: Cao, Qi, et al.
Published: (2025)
by: Cao, Qi, et al.
Published: (2025)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
by: Yu, Zhuohao, et al.
Published: (2024)
by: Yu, Zhuohao, et al.
Published: (2024)
Smaller Models, Smarter Rewards: A Two-Sided Approach to Process and Outcome Rewards
by: Groeneveld, Jan Niklas, et al.
Published: (2025)
by: Groeneveld, Jan Niklas, et al.
Published: (2025)
QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
by: Ke, Changxin, et al.
Published: (2026)
by: Ke, Changxin, et al.
Published: (2026)
Ensuring Functional Correctness of Large Code Models with Selective Generation
by: Jeong, Jaewoo, et al.
Published: (2025)
by: Jeong, Jaewoo, et al.
Published: (2025)
Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring
by: Paul, Indraneil, et al.
Published: (2026)
by: Paul, Indraneil, et al.
Published: (2026)
NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness
by: Singhal, Manav, et al.
Published: (2024)
by: Singhal, Manav, et al.
Published: (2024)
Verifier-Guided Code Translation via Meta-Step Decoding
by: Zhou, Tianyang, et al.
Published: (2026)
by: Zhou, Tianyang, et al.
Published: (2026)
RM -RF: Reward Model for Run-Free Unit Test Evaluation
by: Bruches, Elena, et al.
Published: (2026)
by: Bruches, Elena, et al.
Published: (2026)
Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis
by: Deshpande, Darshan, et al.
Published: (2026)
by: Deshpande, Darshan, et al.
Published: (2026)
Dynamic Scaling of Unit Tests for Code Reward Modeling
by: Ma, Zeyao, et al.
Published: (2025)
by: Ma, Zeyao, et al.
Published: (2025)
Calibration and Correctness of Language Models for Code
by: Spiess, Claudio, et al.
Published: (2024)
by: Spiess, Claudio, et al.
Published: (2024)
Correctness Assessment of Code Generated by Large Language Models Using Internal Representations
by: Bui, Tuan-Dung, et al.
Published: (2025)
by: Bui, Tuan-Dung, et al.
Published: (2025)
BiDoRA: Bi-level Optimization-Based Weight-Decomposed Low-Rank Adaptation
by: Qin, Peijia, et al.
Published: (2024)
by: Qin, Peijia, et al.
Published: (2024)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
by: Yan, Kaiwen, et al.
Published: (2025)
by: Yan, Kaiwen, et al.
Published: (2025)
MetaLint: Easy-to-Hard Generalization for Code Linting
by: Naik, Atharva, et al.
Published: (2025)
by: Naik, Atharva, et al.
Published: (2025)
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
by: Han, Hao, et al.
Published: (2026)
by: Han, Hao, et al.
Published: (2026)
Think Anywhere in Code Generation
by: Jiang, Xue, et al.
Published: (2026)
by: Jiang, Xue, et al.
Published: (2026)
Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
by: Ouyang, Shuyin, et al.
Published: (2026)
by: Ouyang, Shuyin, et al.
Published: (2026)
QEDCartographer: Automating Formal Verification Using Reward-Free Reinforcement Learning
by: Sanchez-Stern, Alex, et al.
Published: (2024)
by: Sanchez-Stern, Alex, et al.
Published: (2024)
Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation
by: Jacopin, Éric
Published: (2026)
by: Jacopin, Éric
Published: (2026)
Evaluating Language Models for Efficient Code Generation
by: Liu, Jiawei, et al.
Published: (2024)
by: Liu, Jiawei, et al.
Published: (2024)
PromSec: Prompt Optimization for Secure Generation of Functional Source Code with Large Language Models (LLMs)
by: Nazzal, Mahmoud, et al.
Published: (2024)
by: Nazzal, Mahmoud, et al.
Published: (2024)
ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
by: Tang, Lingxiao, et al.
Published: (2026)
by: Tang, Lingxiao, et al.
Published: (2026)
Learning to Generate Secure Code via Token-Level Rewards
by: Quan, Jiazheng, et al.
Published: (2026)
by: Quan, Jiazheng, et al.
Published: (2026)
Unsupervised Evaluation of Code LLMs with Round-Trip Correctness
by: Allamanis, Miltiadis, et al.
Published: (2024)
by: Allamanis, Miltiadis, et al.
Published: (2024)
Correctness-Guaranteed Code Generation via Constrained Decoding
by: Li, Lingxiao, et al.
Published: (2025)
by: Li, Lingxiao, et al.
Published: (2025)
ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents
by: Li, Dawei, et al.
Published: (2026)
by: Li, Dawei, et al.
Published: (2026)
Mechanistic Interpretability of Code Correctness in LLMs via Sparse Autoencoders
by: Tahimic, Kriz, et al.
Published: (2025)
by: Tahimic, Kriz, et al.
Published: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
by: Tong, Weixi, et al.
Published: (2024)
by: Tong, Weixi, et al.
Published: (2024)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
by: Abdelaal, Mohamed, et al.
Published: (2025)
by: Abdelaal, Mohamed, et al.
Published: (2025)
CodeScore-R: An Automated Robustness Metric for Assessing the FunctionalCorrectness of Code Synthesis
by: Yang, Guang, et al.
Published: (2024)
by: Yang, Guang, et al.
Published: (2024)
Similar Items
-
DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding
by: Zhang, Ruiyi, et al.
Published: (2025) -
SecCodePRM: A Process Reward Model for Code Security
by: Yu, Weichen, et al.
Published: (2026) -
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
by: Cao, Qi, et al.
Published: (2025) -
Leveraging Reward Models for Guiding Code Review Comment Generation
by: Sghaier, Oussama Ben, et al.
Published: (2025) -
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
by: Fan, Lishui, et al.
Published: (2025)