Good Learners Think Their Thinking: Generative PRM Makes Large Reasoning Model More Efficient Math Learner
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Tao, Mu, Rongchuan, Liao, Lizi, Cao, Yixin, Liu, Ming, Qin, Bing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generative Multi-modal Models are Good Class-Incremental Learners
por: Cao, Xusheng, et al.
Publicado: (2024)
por: Cao, Xusheng, et al.
Publicado: (2024)
XFinBench: Benchmarking LLMs in Complex Financial Problem Solving and Reasoning
por: Zhang, Zhihan, et al.
Publicado: (2025)
por: Zhang, Zhihan, et al.
Publicado: (2025)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
Large Language Models are Good Relational Learners
por: Wu, Fang, et al.
Publicado: (2025)
por: Wu, Fang, et al.
Publicado: (2025)
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
por: Zou, Jiaru, et al.
Publicado: (2025)
por: Zou, Jiaru, et al.
Publicado: (2025)
Efficient Reasoning with Balanced Thinking
por: Li, Yulin, et al.
Publicado: (2026)
por: Li, Yulin, et al.
Publicado: (2026)
Are Large Language Models Good Temporal Graph Learners?
por: Huang, Shenyang, et al.
Publicado: (2025)
por: Huang, Shenyang, et al.
Publicado: (2025)
Simulating Before Planning: Constructing Intrinsic User World Model for User-Tailored Dialogue Policy Planning
por: He, Tao, et al.
Publicado: (2025)
por: He, Tao, et al.
Publicado: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
por: Wang, Zekun, et al.
Publicado: (2025)
por: Wang, Zekun, et al.
Publicado: (2025)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
por: Wang, Xiangqi, et al.
Publicado: (2025)
por: Wang, Xiangqi, et al.
Publicado: (2025)
RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format
por: Huang, Zhehao, et al.
Publicado: (2026)
por: Huang, Zhehao, et al.
Publicado: (2026)
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model
por: Ding, Bowen, et al.
Publicado: (2025)
por: Ding, Bowen, et al.
Publicado: (2025)
Planning Like Human: A Dual-process Framework for Dialogue Planning
por: He, Tao, et al.
Publicado: (2024)
por: He, Tao, et al.
Publicado: (2024)
To Think or Not to Think: Exploring the Unthinking Vulnerability in Large Reasoning Models
por: Zhu, Zihao, et al.
Publicado: (2025)
por: Zhu, Zihao, et al.
Publicado: (2025)
Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks?
por: He, Xuan, et al.
Publicado: (2024)
por: He, Xuan, et al.
Publicado: (2024)
Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
por: Lotfi, Sanae, et al.
Publicado: (2026)
por: Lotfi, Sanae, et al.
Publicado: (2026)
Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning
por: Akter, Syeda Nahida, et al.
Publicado: (2025)
por: Akter, Syeda Nahida, et al.
Publicado: (2025)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
por: Guo, Zhenyuan, et al.
Publicado: (2026)
por: Guo, Zhenyuan, et al.
Publicado: (2026)
More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models
por: Wang, Xiao
Publicado: (2026)
por: Wang, Xiao
Publicado: (2026)
Making Large Vision Language Models to be Good Few-shot Learners
por: Liu, Fan, et al.
Publicado: (2024)
por: Liu, Fan, et al.
Publicado: (2024)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
por: Hong, Ilgee, et al.
Publicado: (2025)
por: Hong, Ilgee, et al.
Publicado: (2025)
Reverse Thinking Makes LLMs Stronger Reasoners
por: Chen, Justin Chih-Yao, et al.
Publicado: (2024)
por: Chen, Justin Chih-Yao, et al.
Publicado: (2024)
Efficient Reasoning with Hidden Thinking
por: Shen, Xuan, et al.
Publicado: (2025)
por: Shen, Xuan, et al.
Publicado: (2025)
Simulation-Free Hierarchical Latent Policy Planning for Proactive Dialogues
por: He, Tao, et al.
Publicado: (2024)
por: He, Tao, et al.
Publicado: (2024)
Think Beyond Size: Adaptive Prompting for More Effective Reasoning
por: R, Kamesh
Publicado: (2024)
por: R, Kamesh
Publicado: (2024)
Boosting Chart-to-Code Generation in MLLM via Dual Preference-Guided Refinement
por: Zhang, Zhihan, et al.
Publicado: (2025)
por: Zhang, Zhihan, et al.
Publicado: (2025)
Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
por: Wang, Yuhang, et al.
Publicado: (2025)
por: Wang, Yuhang, et al.
Publicado: (2025)
DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models
por: Shen, Yi, et al.
Publicado: (2025)
por: Shen, Yi, et al.
Publicado: (2025)
Retrieval Augmented Generation for Dynamic Graph Modeling
por: Wu, Yuxia, et al.
Publicado: (2024)
por: Wu, Yuxia, et al.
Publicado: (2024)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
por: Wan, Xu, et al.
Publicado: (2025)
por: Wan, Xu, et al.
Publicado: (2025)
AdaptThink: Reasoning Models Can Learn When to Think
por: Zhang, Jiajie, et al.
Publicado: (2025)
por: Zhang, Jiajie, et al.
Publicado: (2025)
Intermediate Outputs Are More Sensitive Than You Think
por: Huang, Tao, et al.
Publicado: (2024)
por: Huang, Tao, et al.
Publicado: (2024)
Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models
por: Xie, Zhifei, et al.
Publicado: (2025)
por: Xie, Zhifei, et al.
Publicado: (2025)
K2-Think: A Parameter-Efficient Reasoning System
por: Cheng, Zhoujun, et al.
Publicado: (2025)
por: Cheng, Zhoujun, et al.
Publicado: (2025)
Fine-Tuned In-Context Learners for Efficient Adaptation
por: Bornschein, Jorg, et al.
Publicado: (2025)
por: Bornschein, Jorg, et al.
Publicado: (2025)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
por: Xu, Xin, et al.
Publicado: (2026)
por: Xu, Xin, et al.
Publicado: (2026)
Are Large Language Models In-Context Graph Learners?
por: Li, Jintang, et al.
Publicado: (2025)
por: Li, Jintang, et al.
Publicado: (2025)
Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners
por: Zhang, Shimao, et al.
Publicado: (2024)
por: Zhang, Shimao, et al.
Publicado: (2024)
Large Reasoning Models Learn Better Alignment from Flawed Thinking
por: Peng, ShengYun, et al.
Publicado: (2025)
por: Peng, ShengYun, et al.
Publicado: (2025)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
por: Cao, Qi, et al.
Publicado: (2025)
por: Cao, Qi, et al.
Publicado: (2025)
Ejemplares similares
-
Generative Multi-modal Models are Good Class-Incremental Learners
por: Cao, Xusheng, et al.
Publicado: (2024) -
XFinBench: Benchmarking LLMs in Complex Financial Problem Solving and Reasoning
por: Zhang, Zhihan, et al.
Publicado: (2025) -
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
por: Xu, Xin, et al.
Publicado: (2025) -
Large Language Models are Good Relational Learners
por: Wu, Fang, et al.
Publicado: (2025) -
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
por: Zou, Jiaru, et al.
Publicado: (2025)