GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yao, Wu, Yu, Zhang, Haowei, Li, Weiguo, Chen, Haokun, Wu, Jingpei, Li, Guohao, Han, Zhen, Tresp, Volker |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
di: Zhang, Yao, et al.
Pubblicazione: (2026)
di: Zhang, Yao, et al.
Pubblicazione: (2026)
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
di: Chen, Shuo, et al.
Pubblicazione: (2025)
di: Chen, Shuo, et al.
Pubblicazione: (2025)
Temporal Fact Reasoning over Hyper-Relational Knowledge Graphs
di: Ding, Zifeng, et al.
Pubblicazione: (2023)
di: Ding, Zifeng, et al.
Pubblicazione: (2023)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
di: Zhang, Yao, et al.
Pubblicazione: (2025)
di: Zhang, Yao, et al.
Pubblicazione: (2025)
ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
FreePRM: Training Process Reward Models Without Ground Truth Process Labels
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
di: Zhang, Ruiyi, et al.
Pubblicazione: (2026)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2026)
R-PRM: Reasoning-Driven Process Reward Modeling
di: She, Shuaijie, et al.
Pubblicazione: (2025)
di: She, Shuaijie, et al.
Pubblicazione: (2025)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
di: Cao, Qi, et al.
Pubblicazione: (2025)
di: Cao, Qi, et al.
Pubblicazione: (2025)
DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding
di: Zhang, Ruiyi, et al.
Pubblicazione: (2025)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2025)
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning
di: Zhao, Jian, et al.
Pubblicazione: (2025)
di: Zhao, Jian, et al.
Pubblicazione: (2025)
VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data
di: Zeng, Thomas, et al.
Pubblicazione: (2025)
di: Zeng, Thomas, et al.
Pubblicazione: (2025)
WebPilot: A Versatile and Autonomous Multi-Agent System for Web Task Execution with Strategic Exploration
di: Zhang, Yao, et al.
Pubblicazione: (2024)
di: Zhang, Yao, et al.
Pubblicazione: (2024)
GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning
di: Zhang, Jianghangfan, et al.
Pubblicazione: (2025)
di: Zhang, Jianghangfan, et al.
Pubblicazione: (2025)
Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models
di: Zhu, Jie, et al.
Pubblicazione: (2025)
di: Zhu, Jie, et al.
Pubblicazione: (2025)
Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
di: Nie, Shuo, et al.
Pubblicazione: (2026)
di: Nie, Shuo, et al.
Pubblicazione: (2026)
FedPop: Federated Population-based Hyperparameter Tuning
di: Chen, Haokun, et al.
Pubblicazione: (2023)
di: Chen, Haokun, et al.
Pubblicazione: (2023)
AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
di: Chen, Haokun, et al.
Pubblicazione: (2025)
di: Chen, Haokun, et al.
Pubblicazione: (2025)
zrLLM: Zero-Shot Relational Learning on Temporal Knowledge Graphs with Large Language Models
di: Ding, Zifeng, et al.
Pubblicazione: (2023)
di: Ding, Zifeng, et al.
Pubblicazione: (2023)
Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process Rewards
di: Yun, Jaehoon, et al.
Pubblicazione: (2025)
di: Yun, Jaehoon, et al.
Pubblicazione: (2025)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
di: Rezaei, Mohammad, et al.
Pubblicazione: (2026)
di: Rezaei, Mohammad, et al.
Pubblicazione: (2026)
How the (Tensor-) Brain uses Embeddings and Embodiment to Encode Senses and Symbols
di: Tresp, Volker, et al.
Pubblicazione: (2024)
di: Tresp, Volker, et al.
Pubblicazione: (2024)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
SwarmAgentic: Towards Fully Automated Agentic System Generation via Swarm Intelligence
di: Zhang, Yao, et al.
Pubblicazione: (2025)
di: Zhang, Yao, et al.
Pubblicazione: (2025)
Limits of PRM-Guided Tree Search for Mathematical Reasoning with LLMs
di: Cinquin, Tristan, et al.
Pubblicazione: (2025)
di: Cinquin, Tristan, et al.
Pubblicazione: (2025)
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
di: Amoroso, Roberto, et al.
Pubblicazione: (2024)
di: Amoroso, Roberto, et al.
Pubblicazione: (2024)
Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning
di: Samarinas, Chris, et al.
Pubblicazione: (2026)
di: Samarinas, Chris, et al.
Pubblicazione: (2026)
Visual Question Decomposition on Multimodal Large Language Models
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
di: Wu, Xian, et al.
Pubblicazione: (2026)
di: Wu, Xian, et al.
Pubblicazione: (2026)
DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding
di: Wu, Yuchuan, et al.
Pubblicazione: (2026)
di: Wu, Yuchuan, et al.
Pubblicazione: (2026)
CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process
di: Bi, Jinhe, et al.
Pubblicazione: (2025)
di: Bi, Jinhe, et al.
Pubblicazione: (2025)
Is Sarcasm Detection A Step-by-Step Reasoning Process in Large Language Models?
di: Yao, Ben, et al.
Pubblicazione: (2024)
di: Yao, Ben, et al.
Pubblicazione: (2024)
SecCodePRM: A Process Reward Model for Code Security
di: Yu, Weichen, et al.
Pubblicazione: (2026)
di: Yu, Weichen, et al.
Pubblicazione: (2026)
FedBiP: Heterogeneous One-Shot Federated Learning with Personalized Latent Diffusion Models
di: Chen, Haokun, et al.
Pubblicazione: (2024)
di: Chen, Haokun, et al.
Pubblicazione: (2024)
PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
di: Xu, Huimin, et al.
Pubblicazione: (2025)
di: Xu, Huimin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
di: Zhang, Yao, et al.
Pubblicazione: (2026) -
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
di: Chen, Shuo, et al.
Pubblicazione: (2025) -
Temporal Fact Reasoning over Hyper-Relational Knowledge Graphs
di: Ding, Zifeng, et al.
Pubblicazione: (2023) -
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
di: Zhang, Yao, et al.
Pubblicazione: (2025) -
ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)