Guardado en:
| Autores principales: | Zhang, Yao, Wu, Yu, Zhang, Haowei, Li, Weiguo, Chen, Haokun, Wu, Jingpei, Li, Guohao, Han, Zhen, Tresp, Volker |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.14942 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
por: Zhang, Yao, et al.
Publicado: (2026)
por: Zhang, Yao, et al.
Publicado: (2026)
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
por: Chen, Shuo, et al.
Publicado: (2025)
por: Chen, Shuo, et al.
Publicado: (2025)
Temporal Fact Reasoning over Hyper-Relational Knowledge Graphs
por: Ding, Zifeng, et al.
Publicado: (2023)
por: Ding, Zifeng, et al.
Publicado: (2023)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
por: Zhang, Yao, et al.
Publicado: (2025)
por: Zhang, Yao, et al.
Publicado: (2025)
ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay
por: Zhang, Gengyuan, et al.
Publicado: (2025)
por: Zhang, Gengyuan, et al.
Publicado: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
FreePRM: Training Process Reward Models Without Ground Truth Process Labels
por: Sun, Lin, et al.
Publicado: (2025)
por: Sun, Lin, et al.
Publicado: (2025)
WebPilot: A Versatile and Autonomous Multi-Agent System for Web Task Execution with Strategic Exploration
por: Zhang, Yao, et al.
Publicado: (2024)
por: Zhang, Yao, et al.
Publicado: (2024)
FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
por: Zhang, Ruiyi, et al.
Publicado: (2026)
por: Zhang, Ruiyi, et al.
Publicado: (2026)
R-PRM: Reasoning-Driven Process Reward Modeling
por: She, Shuaijie, et al.
Publicado: (2025)
por: She, Shuaijie, et al.
Publicado: (2025)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
por: Cao, Qi, et al.
Publicado: (2025)
por: Cao, Qi, et al.
Publicado: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
FedPop: Federated Population-based Hyperparameter Tuning
por: Chen, Haokun, et al.
Publicado: (2023)
por: Chen, Haokun, et al.
Publicado: (2023)
zrLLM: Zero-Shot Relational Learning on Temporal Knowledge Graphs with Large Language Models
por: Ding, Zifeng, et al.
Publicado: (2023)
por: Ding, Zifeng, et al.
Publicado: (2023)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
por: Chen, Haokun, et al.
Publicado: (2025)
por: Chen, Haokun, et al.
Publicado: (2025)
DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding
por: Zhang, Ruiyi, et al.
Publicado: (2025)
por: Zhang, Ruiyi, et al.
Publicado: (2025)
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
por: Du, Lingxiao, et al.
Publicado: (2025)
por: Du, Lingxiao, et al.
Publicado: (2025)
Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
por: Nie, Shuo, et al.
Publicado: (2026)
por: Nie, Shuo, et al.
Publicado: (2026)
VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data
por: Zeng, Thomas, et al.
Publicado: (2025)
por: Zeng, Thomas, et al.
Publicado: (2025)
GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning
por: Zhao, Jian, et al.
Publicado: (2025)
por: Zhao, Jian, et al.
Publicado: (2025)
Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models
por: Zhu, Jie, et al.
Publicado: (2025)
por: Zhu, Jie, et al.
Publicado: (2025)
GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning
por: Zhang, Jianghangfan, et al.
Publicado: (2025)
por: Zhang, Jianghangfan, et al.
Publicado: (2025)
AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
por: Chen, Zhaorun, et al.
Publicado: (2024)
por: Chen, Zhaorun, et al.
Publicado: (2024)
SwarmAgentic: Towards Fully Automated Agentic System Generation via Swarm Intelligence
por: Zhang, Yao, et al.
Publicado: (2025)
por: Zhang, Yao, et al.
Publicado: (2025)
How the (Tensor-) Brain uses Embeddings and Embodiment to Encode Senses and Symbols
por: Tresp, Volker, et al.
Publicado: (2024)
por: Tresp, Volker, et al.
Publicado: (2024)
Visual Question Decomposition on Multimodal Large Language Models
por: Zhang, Haowei, et al.
Publicado: (2024)
por: Zhang, Haowei, et al.
Publicado: (2024)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
por: Zhang, Gengyuan, et al.
Publicado: (2023)
por: Zhang, Gengyuan, et al.
Publicado: (2023)
Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process Rewards
por: Yun, Jaehoon, et al.
Publicado: (2025)
por: Yun, Jaehoon, et al.
Publicado: (2025)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
por: Rezaei, Mohammad, et al.
Publicado: (2026)
por: Rezaei, Mohammad, et al.
Publicado: (2026)
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
por: Amoroso, Roberto, et al.
Publicado: (2024)
por: Amoroso, Roberto, et al.
Publicado: (2024)
CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process
por: Bi, Jinhe, et al.
Publicado: (2025)
por: Bi, Jinhe, et al.
Publicado: (2025)
FedBiP: Heterogeneous One-Shot Federated Learning with Personalized Latent Diffusion Models
por: Chen, Haokun, et al.
Publicado: (2024)
por: Chen, Haokun, et al.
Publicado: (2024)
SecCodePRM: A Process Reward Model for Code Security
por: Yu, Weichen, et al.
Publicado: (2026)
por: Yu, Weichen, et al.
Publicado: (2026)
DW-A-PRM: A Dynamic Weighted Planner
por: Wang, Siyuan, et al.
Publicado: (2025)
por: Wang, Siyuan, et al.
Publicado: (2025)
Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning
por: Samarinas, Chris, et al.
Publicado: (2026)
por: Samarinas, Chris, et al.
Publicado: (2026)
Deep Research Brings Deeper Harm
por: Chen, Shuo, et al.
Publicado: (2025)
por: Chen, Shuo, et al.
Publicado: (2025)
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
por: Wu, Xian, et al.
Publicado: (2026)
por: Wu, Xian, et al.
Publicado: (2026)
DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding
por: Wu, Yuchuan, et al.
Publicado: (2026)
por: Wu, Yuchuan, et al.
Publicado: (2026)
Is Sarcasm Detection A Step-by-Step Reasoning Process in Large Language Models?
por: Yao, Ben, et al.
Publicado: (2024)
por: Yao, Ben, et al.
Publicado: (2024)
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
por: Zhang, Gengyuan, et al.
Publicado: (2025)
por: Zhang, Gengyuan, et al.
Publicado: (2025)
Ejemplares similares
-
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
por: Zhang, Yao, et al.
Publicado: (2026) -
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
por: Chen, Shuo, et al.
Publicado: (2025) -
Temporal Fact Reasoning over Hyper-Relational Knowledge Graphs
por: Ding, Zifeng, et al.
Publicado: (2023) -
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
por: Zhang, Yao, et al.
Publicado: (2025) -
ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay
por: Zhang, Gengyuan, et al.
Publicado: (2025)