CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zheng, Congmin, Zhu, Jiachen, Lin, Jianghao, Dai, Xinyi, Liu, Weiwen, Li, Haoxuan, Yu, Yong, Zhang, Weinan, Yang, Mengyue |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
von: Zhu, Jiachen, et al.
Veröffentlicht: (2025)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2025)
A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
von: Zheng, Congmin, et al.
Veröffentlicht: (2025)
von: Zheng, Congmin, et al.
Veröffentlicht: (2025)
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026)
Superplatforms Have to Attack AI Agents
von: Lin, Jianghao, et al.
Veröffentlicht: (2025)
von: Lin, Jianghao, et al.
Veröffentlicht: (2025)
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
von: Zhu, Jiachen, et al.
Veröffentlicht: (2025)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2025)
Adaptive Milestone Reward for GUI Agents
von: Zheng, Congmin, et al.
Veröffentlicht: (2026)
von: Zheng, Congmin, et al.
Veröffentlicht: (2026)
Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026)
CoLD Fusion: A Real-time Capable Spline-based Fusion Algorithm for Collective Lane Detection
von: Gamerdinger, Jörg, et al.
Veröffentlicht: (2025)
von: Gamerdinger, Jörg, et al.
Veröffentlicht: (2025)
Lifelong Personalized Low-Rank Adaptation of Large Language Models for Recommendation
von: Zhu, Jiachen, et al.
Veröffentlicht: (2024)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2024)
Stop DDoS Attacking the Research Community with AI-Generated Survey Papers
von: Lin, Jianghao, et al.
Veröffentlicht: (2025)
von: Lin, Jianghao, et al.
Veröffentlicht: (2025)
A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges
von: Xi, Yunjia, et al.
Veröffentlicht: (2025)
von: Xi, Yunjia, et al.
Veröffentlicht: (2025)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
von: Zhang, Zhenru, et al.
Veröffentlicht: (2025)
von: Zhang, Zhenru, et al.
Veröffentlicht: (2025)
M-scan: A Multi-Scenario Causal-driven Adaptive Network for Recommendation
von: Zhu, Jiachen, et al.
Veröffentlicht: (2024)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2024)
MemoCRS: Memory-enhanced Sequential Conversational Recommender Systems with Large Language Models
von: Xi, Yunjia, et al.
Veröffentlicht: (2024)
von: Xi, Yunjia, et al.
Veröffentlicht: (2024)
Large Language Models Make Sample-Efficient Recommender Systems
von: Lin, Jianghao, et al.
Veröffentlicht: (2024)
von: Lin, Jianghao, et al.
Veröffentlicht: (2024)
MassTool: A Multi-Task Search-Based Tool Retrieval Framework for Large Language Models
von: Lin, Jianghao, et al.
Veröffentlicht: (2025)
von: Lin, Jianghao, et al.
Veröffentlicht: (2025)
Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents
von: Shan, Rong, et al.
Veröffentlicht: (2026)
von: Shan, Rong, et al.
Veröffentlicht: (2026)
Full-Stack Optimized Large Language Models for Lifelong Sequential Behavior Comprehension in Recommendation
von: Shan, Rong, et al.
Veröffentlicht: (2025)
von: Shan, Rong, et al.
Veröffentlicht: (2025)
SkillMAS: Skill Co-Evolution with LLM-based Multi-Agent System
von: Pan, Shuai, et al.
Veröffentlicht: (2026)
von: Pan, Shuai, et al.
Veröffentlicht: (2026)
Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models
von: Lin, Zheng, et al.
Veröffentlicht: (2026)
von: Lin, Zheng, et al.
Veröffentlicht: (2026)
Coarse-to-Fine Process Reward Modeling for Mathematical Reasoning
von: Hu, Yulan, et al.
Veröffentlicht: (2025)
von: Hu, Yulan, et al.
Veröffentlicht: (2025)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
A Survey on Diffusion Models for Recommender Systems
von: Lin, Jianghao, et al.
Veröffentlicht: (2024)
von: Lin, Jianghao, et al.
Veröffentlicht: (2024)
DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News Retrieval
von: Qi, Siyuan, et al.
Veröffentlicht: (2026)
von: Qi, Siyuan, et al.
Veröffentlicht: (2026)
Play to Your Strengths: Collaborative Intelligence of Conventional Recommender Models and Large Language Models
von: Xi, Yunjia, et al.
Veröffentlicht: (2024)
von: Xi, Yunjia, et al.
Veröffentlicht: (2024)
Beyond Positive History: Re-ranking with List-level Hybrid Feedback
von: Weng, Muyan, et al.
Veröffentlicht: (2024)
von: Weng, Muyan, et al.
Veröffentlicht: (2024)
GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning
von: Zhang, Jianghangfan, et al.
Veröffentlicht: (2025)
von: Zhang, Jianghangfan, et al.
Veröffentlicht: (2025)
How Can Recommender Systems Benefit from Large Language Models: A Survey
von: Lin, Jianghao, et al.
Veröffentlicht: (2023)
von: Lin, Jianghao, et al.
Veröffentlicht: (2023)
DisCo: Towards Harmonious Disentanglement and Collaboration between Tabular and Semantic Space for Recommendation
von: Du, Kounianhua, et al.
Veröffentlicht: (2024)
von: Du, Kounianhua, et al.
Veröffentlicht: (2024)
AdvKT: An Adversarial Multi-Step Training Framework for Knowledge Tracing
von: Fu, Lingyue, et al.
Veröffentlicht: (2025)
von: Fu, Lingyue, et al.
Veröffentlicht: (2025)
Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding
von: Xi, Yunjia, et al.
Veröffentlicht: (2024)
von: Xi, Yunjia, et al.
Veröffentlicht: (2024)
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
von: Wang, Jingxing, et al.
Veröffentlicht: (2026)
von: Wang, Jingxing, et al.
Veröffentlicht: (2026)
ATGen: Adversarial Reinforcement Learning for Test Case Generation
von: Li, Qingyao, et al.
Veröffentlicht: (2025)
von: Li, Qingyao, et al.
Veröffentlicht: (2025)
DebugTA: An LLM-Based Agent for Simplifying Debugging and Teaching in Programming Education
von: Fu, Lingyue, et al.
Veröffentlicht: (2025)
von: Fu, Lingyue, et al.
Veröffentlicht: (2025)
Efficient and Deployable Knowledge Infusion for Open-World Recommendations via Large Language Models
von: Xi, Yunjia, et al.
Veröffentlicht: (2024)
von: Xi, Yunjia, et al.
Veröffentlicht: (2024)
AdverMCTS: Combating Pseudo-Correctness in Code Generation via Adversarial Monte Carlo Tree Search
von: Li, Qingyao, et al.
Veröffentlicht: (2026)
von: Li, Qingyao, et al.
Veröffentlicht: (2026)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution
von: Huang, Junjie, et al.
Veröffentlicht: (2026)
von: Huang, Junjie, et al.
Veröffentlicht: (2026)
ClickPrompt: CTR Models are Strong Prompt Generators for Adapting Language Models to CTR Prediction
von: Lin, Jianghao, et al.
Veröffentlicht: (2023)
von: Lin, Jianghao, et al.
Veröffentlicht: (2023)
Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations
von: Xi, Yunjia, et al.
Veröffentlicht: (2026)
von: Xi, Yunjia, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
von: Zhu, Jiachen, et al.
Veröffentlicht: (2025) -
A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
von: Zheng, Congmin, et al.
Veröffentlicht: (2025) -
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026) -
Superplatforms Have to Attack AI Agents
von: Lin, Jianghao, et al.
Veröffentlicht: (2025) -
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
von: Zhu, Jiachen, et al.
Veröffentlicht: (2025)