Scaling Reasoning Tokens via RL and Parallel Thinking: Evidence From Competitive Programming
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Qianfan, Guo, Tianyu, Ren, Xuandi, Chen, Jiale, Ding, Ming, Xin, Ran, Xiao, Xia |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
von: Guo, Zhenyuan, et al.
Veröffentlicht: (2026)
von: Guo, Zhenyuan, et al.
Veröffentlicht: (2026)
Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model
von: Ding, Bowen, et al.
Veröffentlicht: (2025)
von: Ding, Bowen, et al.
Veröffentlicht: (2025)
ThinkPilot: Steering Reasoning Models via Automated Think-prefixes Optimization
von: Li, Sunzhu, et al.
Veröffentlicht: (2025)
von: Li, Sunzhu, et al.
Veröffentlicht: (2025)
Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens
von: Chen, Wei-Lin, et al.
Veröffentlicht: (2026)
von: Chen, Wei-Lin, et al.
Veröffentlicht: (2026)
ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests
von: Xu, Shiyi, et al.
Veröffentlicht: (2025)
von: Xu, Shiyi, et al.
Veröffentlicht: (2025)
Parallel-Probe: Towards Efficient Parallel Thinking via 2D Probing
von: Zheng, Tong, et al.
Veröffentlicht: (2026)
von: Zheng, Tong, et al.
Veröffentlicht: (2026)
Think Clearly: Improving Reasoning via Redundant Token Pruning
von: Choi, Daewon, et al.
Veröffentlicht: (2025)
von: Choi, Daewon, et al.
Veröffentlicht: (2025)
Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge
von: Tang, Yao, et al.
Veröffentlicht: (2026)
von: Tang, Yao, et al.
Veröffentlicht: (2026)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
von: Jia, Sheng, et al.
Veröffentlicht: (2025)
von: Jia, Sheng, et al.
Veröffentlicht: (2025)
Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
von: Qian, Chen, et al.
Veröffentlicht: (2025)
von: Qian, Chen, et al.
Veröffentlicht: (2025)
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
von: Zheng, Tong, et al.
Veröffentlicht: (2025)
von: Zheng, Tong, et al.
Veröffentlicht: (2025)
Fast Quiet-STaR: Thinking Without Thought Tokens
von: Huang, Wei, et al.
Veröffentlicht: (2025)
von: Huang, Wei, et al.
Veröffentlicht: (2025)
Competitive Programming with Large Reasoning Models
von: OpenAI, et al.
Veröffentlicht: (2025)
von: OpenAI, et al.
Veröffentlicht: (2025)
SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
von: Shu, Fangxun, et al.
Veröffentlicht: (2025)
von: Shu, Fangxun, et al.
Veröffentlicht: (2025)
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
von: He, Bingxiang, et al.
Veröffentlicht: (2025)
von: He, Bingxiang, et al.
Veröffentlicht: (2025)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
Wait, We Don't Need to "Wait"! Removing Thinking Tokens Improves Reasoning Efficiency
von: Wang, Chenlong, et al.
Veröffentlicht: (2025)
von: Wang, Chenlong, et al.
Veröffentlicht: (2025)
Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning
von: Yu, Kun-Yang, et al.
Veröffentlicht: (2026)
von: Yu, Kun-Yang, et al.
Veröffentlicht: (2026)
Think Socially via Cognitive Reasoning
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL
von: Wu, Zhaofeng, et al.
Veröffentlicht: (2026)
von: Wu, Zhaofeng, et al.
Veröffentlicht: (2026)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
von: Xu, Xin, et al.
Veröffentlicht: (2026)
von: Xu, Xin, et al.
Veröffentlicht: (2026)
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
AetherCode: Evaluating LLMs' Ability to Win In Premier Programming Competitions
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
von: Yang, Wang, et al.
Veröffentlicht: (2026)
von: Yang, Wang, et al.
Veröffentlicht: (2026)
TwT: Thinking without Tokens by Habitual Reasoning Distillation with Multi-Teachers' Guidance
von: Xu, Jingxian, et al.
Veröffentlicht: (2025)
von: Xu, Jingxian, et al.
Veröffentlicht: (2025)
LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
von: Zebaze, Armel, et al.
Veröffentlicht: (2025)
von: Zebaze, Armel, et al.
Veröffentlicht: (2025)
Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning
von: Li, Gengyang, et al.
Veröffentlicht: (2026)
von: Li, Gengyang, et al.
Veröffentlicht: (2026)
Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration
von: Liu, Xin, et al.
Veröffentlicht: (2026)
von: Liu, Xin, et al.
Veröffentlicht: (2026)
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
von: Wu, Tong, et al.
Veröffentlicht: (2025)
von: Wu, Tong, et al.
Veröffentlicht: (2025)
How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning
von: Chen, Haoyang, et al.
Veröffentlicht: (2026)
von: Chen, Haoyang, et al.
Veröffentlicht: (2026)
Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality
von: Bi, Ziqian, et al.
Veröffentlicht: (2025)
von: Bi, Ziqian, et al.
Veröffentlicht: (2025)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
von: Li, Haozhan, et al.
Veröffentlicht: (2025)
von: Li, Haozhan, et al.
Veröffentlicht: (2025)
From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents
von: Xia, Sirui, et al.
Veröffentlicht: (2026)
von: Xia, Sirui, et al.
Veröffentlicht: (2026)
ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF
von: Gao, Ziyuan, et al.
Veröffentlicht: (2025)
von: Gao, Ziyuan, et al.
Veröffentlicht: (2025)
Learning a Continue-Thinking Token for Enhanced Test-Time Scaling
von: Ringel, Liran, et al.
Veröffentlicht: (2025)
von: Ringel, Liran, et al.
Veröffentlicht: (2025)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
von: Wang, Yikun, et al.
Veröffentlicht: (2025)
von: Wang, Yikun, et al.
Veröffentlicht: (2025)
Not All Tokens Are What You Need In Thinking
von: Yuan, Hang, et al.
Veröffentlicht: (2025)
von: Yuan, Hang, et al.
Veröffentlicht: (2025)
Efficient Reasoning with Balanced Thinking
von: Li, Yulin, et al.
Veröffentlicht: (2026)
von: Li, Yulin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
von: Guo, Zhenyuan, et al.
Veröffentlicht: (2026) -
Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
von: Wang, Haonan, et al.
Veröffentlicht: (2025) -
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model
von: Ding, Bowen, et al.
Veröffentlicht: (2025) -
ThinkPilot: Steering Reasoning Models via Automated Think-prefixes Optimization
von: Li, Sunzhu, et al.
Veröffentlicht: (2025) -
Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens
von: Chen, Wei-Lin, et al.
Veröffentlicht: (2026)