Thinking Long, but Short: Stable Sequential Test-Time Scaling for Large Reasoning Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Metel, Michael R., Cui, Yufei, Chen, Boxing, Parthasarathi, Prasanna |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
por: Heuillet, Maxime, et al.
Publicado: (2025)
por: Heuillet, Maxime, et al.
Publicado: (2025)
Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucination
por: Huang, Jerry, et al.
Publicado: (2024)
por: Huang, Jerry, et al.
Publicado: (2024)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
por: Parthasarathi, Prasanna, et al.
Publicado: (2025)
por: Parthasarathi, Prasanna, et al.
Publicado: (2025)
MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
por: Chen, Hongwei, et al.
Publicado: (2025)
por: Chen, Hongwei, et al.
Publicado: (2025)
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
por: Ghosal, Soumya Suvra, et al.
Publicado: (2025)
por: Ghosal, Soumya Suvra, et al.
Publicado: (2025)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
por: Yang, Wenkai, et al.
Publicado: (2025)
por: Yang, Wenkai, et al.
Publicado: (2025)
Do Large Language Models Know How Much They Know?
por: Prato, Gabriele, et al.
Publicado: (2025)
por: Prato, Gabriele, et al.
Publicado: (2025)
Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression
por: Metel, Michael R., et al.
Publicado: (2024)
por: Metel, Michael R., et al.
Publicado: (2024)
Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models
por: Ahmadi, Saba, et al.
Publicado: (2026)
por: Ahmadi, Saba, et al.
Publicado: (2026)
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
por: Hammoud, Hasan Abed Al Kader, et al.
Publicado: (2025)
por: Hammoud, Hasan Abed Al Kader, et al.
Publicado: (2025)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
por: Ding, Jiayu, et al.
Publicado: (2025)
por: Ding, Jiayu, et al.
Publicado: (2025)
Towards Practical Tool Usage for Continually Learning LLMs
por: Huang, Jerry, et al.
Publicado: (2024)
por: Huang, Jerry, et al.
Publicado: (2024)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
por: Yan, Yuchen, et al.
Publicado: (2025)
por: Yan, Yuchen, et al.
Publicado: (2025)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
por: Huang, Xiaoke, et al.
Publicado: (2025)
por: Huang, Xiaoke, et al.
Publicado: (2025)
Modeling Hierarchical Thinking in Large Reasoning Models
por: Shahariar, G M, et al.
Publicado: (2025)
por: Shahariar, G M, et al.
Publicado: (2025)
A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?
por: Zhang, Qiyuan, et al.
Publicado: (2025)
por: Zhang, Qiyuan, et al.
Publicado: (2025)
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
por: Zou, Jiaru, et al.
Publicado: (2025)
por: Zou, Jiaru, et al.
Publicado: (2025)
Logical Reasoning with Outcome Reward Models for Test-Time Scaling
por: Thatikonda, Ramya Keerthy, et al.
Publicado: (2025)
por: Thatikonda, Ramya Keerthy, et al.
Publicado: (2025)
Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks
por: Gong, Nanxu, et al.
Publicado: (2026)
por: Gong, Nanxu, et al.
Publicado: (2026)
Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning
por: Wang, Qianyue, et al.
Publicado: (2026)
por: Wang, Qianyue, et al.
Publicado: (2026)
Think Again! The Effect of Test-Time Compute on Preferences, Opinions, and Beliefs of Large Language Models
por: Kour, George, et al.
Publicado: (2025)
por: Kour, George, et al.
Publicado: (2025)
Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization
por: Ye, Wengao, et al.
Publicado: (2025)
por: Ye, Wengao, et al.
Publicado: (2025)
Lissard: Long and Simple Sequential Reasoning Datasets
por: Bueno, Mirelle, et al.
Publicado: (2024)
por: Bueno, Mirelle, et al.
Publicado: (2024)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
por: Guo, Zhenyuan, et al.
Publicado: (2026)
por: Guo, Zhenyuan, et al.
Publicado: (2026)
Parallel Test-Time Scaling for Latent Reasoning Models
por: You, Runyang, et al.
Publicado: (2025)
por: You, Runyang, et al.
Publicado: (2025)
ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
por: Ni, Jingwei, et al.
Publicado: (2025)
por: Ni, Jingwei, et al.
Publicado: (2025)
Think Before Recommend: Unleashing the Latent Reasoning Power for Sequential Recommendation
por: Tang, Jiakai, et al.
Publicado: (2025)
por: Tang, Jiakai, et al.
Publicado: (2025)
Controlling Thinking Speed in Reasoning Models
por: Lin, Zhengkai, et al.
Publicado: (2025)
por: Lin, Zhengkai, et al.
Publicado: (2025)
Resona: Improving Context Copying in Linear Recurrence Models with Retrieval
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
Think$^{2}$: Grounded Metacognitive Reasoning in Large Language Models
por: Elenjical, Abraham Paul, et al.
Publicado: (2026)
por: Elenjical, Abraham Paul, et al.
Publicado: (2026)
Exploring the System 1 Thinking Capability of Large Reasoning Models
por: Zhang, Wenyuan, et al.
Publicado: (2025)
por: Zhang, Wenyuan, et al.
Publicado: (2025)
Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling
por: Trung, Bui The, et al.
Publicado: (2026)
por: Trung, Bui The, et al.
Publicado: (2026)
To Think or Not to Think: Exploring the Unthinking Vulnerability in Large Reasoning Models
por: Zhu, Zihao, et al.
Publicado: (2025)
por: Zhu, Zihao, et al.
Publicado: (2025)
Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation
por: Chen, Peter Baile, et al.
Publicado: (2025)
por: Chen, Peter Baile, et al.
Publicado: (2025)
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
por: Li, Chengzu, et al.
Publicado: (2026)
por: Li, Chengzu, et al.
Publicado: (2026)
LSTPrompt: Large Language Models as Zero-Shot Time Series Forecasters by Long-Short-Term Prompting
por: Liu, Haoxin, et al.
Publicado: (2024)
por: Liu, Haoxin, et al.
Publicado: (2024)
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model
por: Ding, Bowen, et al.
Publicado: (2025)
por: Ding, Bowen, et al.
Publicado: (2025)
ThinkPilot: Steering Reasoning Models via Automated Think-prefixes Optimization
por: Li, Sunzhu, et al.
Publicado: (2025)
por: Li, Sunzhu, et al.
Publicado: (2025)
Ejemplares similares
-
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
por: Heuillet, Maxime, et al.
Publicado: (2025) -
Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucination
por: Huang, Jerry, et al.
Publicado: (2024) -
GRPO-$λ$: Credit Assignment improves LLM Reasoning
por: Parthasarathi, Prasanna, et al.
Publicado: (2025) -
MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
por: Chen, Hongwei, et al.
Publicado: (2025) -
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
por: Ghosal, Soumya Suvra, et al.
Publicado: (2025)