Guardado en:
| Autores principales: | Zhang, Lingyin, Gao, Jun, Ren, Xiaoxue, Cao, Ziqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2508.01682 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
\texttt{ReMind}: Understanding Deductive Code Reasoning in LLMs
por: Gao, Jun, et al.
Publicado: (2025)
por: Gao, Jun, et al.
Publicado: (2025)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
por: Sun, Zhongxiang, et al.
Publicado: (2025)
por: Sun, Zhongxiang, et al.
Publicado: (2025)
AIM: Let Any Multi-modal Large Language Models Embrace Efficient In-Context Learning
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
Guiding ChatGPT to Generate Salient Domain Summaries
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
UniICL: An Efficient Unified Framework Unifying Compression, Selection, and Generation
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
Entropy-Regularized Process Reward Model
por: Zhang, Hanning, et al.
Publicado: (2024)
por: Zhang, Hanning, et al.
Publicado: (2024)
Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
por: Wang, Binghai, et al.
Publicado: (2026)
por: Wang, Binghai, et al.
Publicado: (2026)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning
por: Wu, Lingyan, et al.
Publicado: (2026)
por: Wu, Lingyan, et al.
Publicado: (2026)
Dynamic and Generalizable Process Reward Modeling
por: Yin, Zhangyue, et al.
Publicado: (2025)
por: Yin, Zhangyue, et al.
Publicado: (2025)
Process-based Self-Rewarding Language Models
por: Zhang, Shimao, et al.
Publicado: (2025)
por: Zhang, Shimao, et al.
Publicado: (2025)
Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
Scaling Multiagent Systems with Process Rewards
por: Li, Ed, et al.
Publicado: (2026)
por: Li, Ed, et al.
Publicado: (2026)
DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding
por: Zhang, Ruiyi, et al.
Publicado: (2025)
por: Zhang, Ruiyi, et al.
Publicado: (2025)
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
por: Qiu, Zhisong, et al.
Publicado: (2026)
por: Qiu, Zhisong, et al.
Publicado: (2026)
RRM: Robust Reward Model Training Mitigates Reward Hacking
por: Liu, Tianqi, et al.
Publicado: (2024)
por: Liu, Tianqi, et al.
Publicado: (2024)
Improving Generalization in Intent Detection: GRPO with Reward-Based Curriculum Sampling
por: Feng, Zihao, et al.
Publicado: (2025)
por: Feng, Zihao, et al.
Publicado: (2025)
GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning
por: Zhao, Jian, et al.
Publicado: (2025)
por: Zhao, Jian, et al.
Publicado: (2025)
Process Reward Models That Think
por: Khalifa, Muhammad, et al.
Publicado: (2025)
por: Khalifa, Muhammad, et al.
Publicado: (2025)
Demystifying Multilingual Chain-of-Thought in Process Reward Modeling
por: Wang, Weixuan, et al.
Publicado: (2025)
por: Wang, Weixuan, et al.
Publicado: (2025)
R-PRM: Reasoning-Driven Process Reward Modeling
por: She, Shuaijie, et al.
Publicado: (2025)
por: She, Shuaijie, et al.
Publicado: (2025)
Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards
por: Pisano, Raffaele, et al.
Publicado: (2026)
por: Pisano, Raffaele, et al.
Publicado: (2026)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
por: Jin, Zhuoran, et al.
Publicado: (2025)
por: Jin, Zhuoran, et al.
Publicado: (2025)
Free Process Rewards without Process Labels
por: Yuan, Lifan, et al.
Publicado: (2024)
por: Yuan, Lifan, et al.
Publicado: (2024)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
por: Jin, Zhuoran, et al.
Publicado: (2024)
por: Jin, Zhuoran, et al.
Publicado: (2024)
Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning
por: Cheng, Xiaoxue, et al.
Publicado: (2025)
por: Cheng, Xiaoxue, et al.
Publicado: (2025)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
por: Men, Tianyi, et al.
Publicado: (2025)
por: Men, Tianyi, et al.
Publicado: (2025)
Process Reward Model with Q-Value Rankings
por: Li, Wendi, et al.
Publicado: (2024)
por: Li, Wendi, et al.
Publicado: (2024)
Data-adaptive Safety Rules for Training Reward Models
por: Li, Xiaomin, et al.
Publicado: (2025)
por: Li, Xiaomin, et al.
Publicado: (2025)
Training Data Efficiency in Multimodal Process Reward Models
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
por: Zheng, Congmin, et al.
Publicado: (2025)
por: Zheng, Congmin, et al.
Publicado: (2025)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
por: Zhang, Zhenru, et al.
Publicado: (2025)
por: Zhang, Zhenru, et al.
Publicado: (2025)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
por: Ma, Qiyao, et al.
Publicado: (2026)
por: Ma, Qiyao, et al.
Publicado: (2026)
ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models
por: Li, Xiaomin, et al.
Publicado: (2025)
por: Li, Xiaomin, et al.
Publicado: (2025)
FreePRM: Training Process Reward Models Without Ground Truth Process Labels
por: Sun, Lin, et al.
Publicado: (2025)
por: Sun, Lin, et al.
Publicado: (2025)
Trigger$^3$: Refining Query Correction via Adaptive Model Selector
por: Zhang, Kepu, et al.
Publicado: (2024)
por: Zhang, Kepu, et al.
Publicado: (2024)
Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework
por: Wang, Zhuoshang, et al.
Publicado: (2026)
por: Wang, Zhuoshang, et al.
Publicado: (2026)
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
por: Zhang, Qi, et al.
Publicado: (2025)
por: Zhang, Qi, et al.
Publicado: (2025)
Better Process Supervision with Bi-directional Rewarding Signals
por: Chen, Wenxiang, et al.
Publicado: (2025)
por: Chen, Wenxiang, et al.
Publicado: (2025)
Ejemplares similares
-
SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself
por: Gao, Jun, et al.
Publicado: (2024) -
\texttt{ReMind}: Understanding Deductive Code Reasoning in LLMs
por: Gao, Jun, et al.
Publicado: (2025) -
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
por: Sun, Zhongxiang, et al.
Publicado: (2025) -
AIM: Let Any Multi-modal Large Language Models Embrace Efficient In-Context Learning
por: Gao, Jun, et al.
Publicado: (2024) -
Guiding ChatGPT to Generate Salient Domain Summaries
por: Gao, Jun, et al.
Publicado: (2024)