Good Learners Think Their Thinking: Generative PRM Makes Large Reasoning Model More Efficient Math Learner
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Tao, Mu, Rongchuan, Liao, Lizi, Cao, Yixin, Liu, Ming, Qin, Bing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Generative Multi-modal Models are Good Class-Incremental Learners
par: Cao, Xusheng, et autres
Publié: (2024)
par: Cao, Xusheng, et autres
Publié: (2024)
XFinBench: Benchmarking LLMs in Complex Financial Problem Solving and Reasoning
par: Zhang, Zhihan, et autres
Publié: (2025)
par: Zhang, Zhihan, et autres
Publié: (2025)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Large Language Models are Good Relational Learners
par: Wu, Fang, et autres
Publié: (2025)
par: Wu, Fang, et autres
Publié: (2025)
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
par: Zou, Jiaru, et autres
Publié: (2025)
par: Zou, Jiaru, et autres
Publié: (2025)
Efficient Reasoning with Balanced Thinking
par: Li, Yulin, et autres
Publié: (2026)
par: Li, Yulin, et autres
Publié: (2026)
Are Large Language Models Good Temporal Graph Learners?
par: Huang, Shenyang, et autres
Publié: (2025)
par: Huang, Shenyang, et autres
Publié: (2025)
Simulating Before Planning: Constructing Intrinsic User World Model for User-Tailored Dialogue Policy Planning
par: He, Tao, et autres
Publié: (2025)
par: He, Tao, et autres
Publié: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
par: Wang, Zekun, et autres
Publié: (2025)
par: Wang, Zekun, et autres
Publié: (2025)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
par: Wang, Xiangqi, et autres
Publié: (2025)
par: Wang, Xiangqi, et autres
Publié: (2025)
RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format
par: Huang, Zhehao, et autres
Publié: (2026)
par: Huang, Zhehao, et autres
Publié: (2026)
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model
par: Ding, Bowen, et autres
Publié: (2025)
par: Ding, Bowen, et autres
Publié: (2025)
Planning Like Human: A Dual-process Framework for Dialogue Planning
par: He, Tao, et autres
Publié: (2024)
par: He, Tao, et autres
Publié: (2024)
To Think or Not to Think: Exploring the Unthinking Vulnerability in Large Reasoning Models
par: Zhu, Zihao, et autres
Publié: (2025)
par: Zhu, Zihao, et autres
Publié: (2025)
Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks?
par: He, Xuan, et autres
Publié: (2024)
par: He, Xuan, et autres
Publié: (2024)
Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
par: Lotfi, Sanae, et autres
Publié: (2026)
par: Lotfi, Sanae, et autres
Publié: (2026)
Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning
par: Akter, Syeda Nahida, et autres
Publié: (2025)
par: Akter, Syeda Nahida, et autres
Publié: (2025)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
par: Guo, Zhenyuan, et autres
Publié: (2026)
par: Guo, Zhenyuan, et autres
Publié: (2026)
More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models
par: Wang, Xiao
Publié: (2026)
par: Wang, Xiao
Publié: (2026)
Making Large Vision Language Models to be Good Few-shot Learners
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
par: Hong, Ilgee, et autres
Publié: (2025)
par: Hong, Ilgee, et autres
Publié: (2025)
Reverse Thinking Makes LLMs Stronger Reasoners
par: Chen, Justin Chih-Yao, et autres
Publié: (2024)
par: Chen, Justin Chih-Yao, et autres
Publié: (2024)
Efficient Reasoning with Hidden Thinking
par: Shen, Xuan, et autres
Publié: (2025)
par: Shen, Xuan, et autres
Publié: (2025)
Simulation-Free Hierarchical Latent Policy Planning for Proactive Dialogues
par: He, Tao, et autres
Publié: (2024)
par: He, Tao, et autres
Publié: (2024)
Think Beyond Size: Adaptive Prompting for More Effective Reasoning
par: R, Kamesh
Publié: (2024)
par: R, Kamesh
Publié: (2024)
Boosting Chart-to-Code Generation in MLLM via Dual Preference-Guided Refinement
par: Zhang, Zhihan, et autres
Publié: (2025)
par: Zhang, Zhihan, et autres
Publié: (2025)
Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
par: Wang, Yuhang, et autres
Publié: (2025)
par: Wang, Yuhang, et autres
Publié: (2025)
DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models
par: Shen, Yi, et autres
Publié: (2025)
par: Shen, Yi, et autres
Publié: (2025)
Retrieval Augmented Generation for Dynamic Graph Modeling
par: Wu, Yuxia, et autres
Publié: (2024)
par: Wu, Yuxia, et autres
Publié: (2024)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
par: Wan, Xu, et autres
Publié: (2025)
par: Wan, Xu, et autres
Publié: (2025)
AdaptThink: Reasoning Models Can Learn When to Think
par: Zhang, Jiajie, et autres
Publié: (2025)
par: Zhang, Jiajie, et autres
Publié: (2025)
Intermediate Outputs Are More Sensitive Than You Think
par: Huang, Tao, et autres
Publié: (2024)
par: Huang, Tao, et autres
Publié: (2024)
Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models
par: Xie, Zhifei, et autres
Publié: (2025)
par: Xie, Zhifei, et autres
Publié: (2025)
K2-Think: A Parameter-Efficient Reasoning System
par: Cheng, Zhoujun, et autres
Publié: (2025)
par: Cheng, Zhoujun, et autres
Publié: (2025)
Fine-Tuned In-Context Learners for Efficient Adaptation
par: Bornschein, Jorg, et autres
Publié: (2025)
par: Bornschein, Jorg, et autres
Publié: (2025)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
par: Xu, Xin, et autres
Publié: (2026)
par: Xu, Xin, et autres
Publié: (2026)
Are Large Language Models In-Context Graph Learners?
par: Li, Jintang, et autres
Publié: (2025)
par: Li, Jintang, et autres
Publié: (2025)
Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners
par: Zhang, Shimao, et autres
Publié: (2024)
par: Zhang, Shimao, et autres
Publié: (2024)
Large Reasoning Models Learn Better Alignment from Flawed Thinking
par: Peng, ShengYun, et autres
Publié: (2025)
par: Peng, ShengYun, et autres
Publié: (2025)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
par: Cao, Qi, et autres
Publié: (2025)
par: Cao, Qi, et autres
Publié: (2025)
Documents similaires
-
Generative Multi-modal Models are Good Class-Incremental Learners
par: Cao, Xusheng, et autres
Publié: (2024) -
XFinBench: Benchmarking LLMs in Complex Financial Problem Solving and Reasoning
par: Zhang, Zhihan, et autres
Publié: (2025) -
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
par: Xu, Xin, et autres
Publié: (2025) -
Large Language Models are Good Relational Learners
par: Wu, Fang, et autres
Publié: (2025) -
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
par: Zou, Jiaru, et autres
Publié: (2025)