Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Feng, Raventos, Allan, Cheng, Nan, Ganguli, Surya, Druckmann, Shaul |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deriving Neural Scaling Laws from the statistics of natural language
par: Cagnetta, Francesco, et autres
Publié: (2026)
par: Cagnetta, Francesco, et autres
Publié: (2026)
Unlocking LLM Creativity in Science through Analogical Reasoning
par: Shen, Andrew, et autres
Publié: (2026)
par: Shen, Andrew, et autres
Publié: (2026)
Get rich quick: exact solutions reveal how unbalanced initializations promote rapid feature learning
par: Kunin, Daniel, et autres
Publié: (2024)
par: Kunin, Daniel, et autres
Publié: (2024)
Informed Correctors for Discrete Diffusion Models
par: Zhao, Yixiu, et autres
Publié: (2024)
par: Zhao, Yixiu, et autres
Publié: (2024)
Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks
par: Chen, Feng, et autres
Publié: (2023)
par: Chen, Feng, et autres
Publié: (2023)
Fooling LLM graders into giving better grades through neural activity guided adversarial prompting
par: Yamamura, Atsushi, et autres
Publié: (2024)
par: Yamamura, Atsushi, et autres
Publié: (2024)
Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling
par: Wunderlich, Florian Valentin, et autres
Publié: (2026)
par: Wunderlich, Florian Valentin, et autres
Publié: (2026)
Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling
par: Chen, Hao Mark, et autres
Publié: (2025)
par: Chen, Hao Mark, et autres
Publié: (2025)
A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition
par: Benster, Tyler, et autres
Publié: (2024)
par: Benster, Tyler, et autres
Publié: (2024)
Examining False Positives under Inference Scaling for Mathematical Reasoning
par: Wang, Yu, et autres
Publié: (2025)
par: Wang, Yu, et autres
Publié: (2025)
BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models
par: Patarlapalli, Sai Babu, et autres
Publié: (2026)
par: Patarlapalli, Sai Babu, et autres
Publié: (2026)
MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning
par: Chen, Jinhao, et autres
Publié: (2025)
par: Chen, Jinhao, et autres
Publié: (2025)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
par: Tang, Zhengyang, et autres
Publié: (2024)
par: Tang, Zhengyang, et autres
Publié: (2024)
TMAS: Scaling Test-Time Compute via Multi-Agent Synergy
par: Wu, George, et autres
Publié: (2026)
par: Wu, George, et autres
Publié: (2026)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
par: Qu, Yuxiao, et autres
Publié: (2025)
par: Qu, Yuxiao, et autres
Publié: (2025)
An analytic theory of creativity in convolutional diffusion models
par: Kamb, Mason, et autres
Publié: (2024)
par: Kamb, Mason, et autres
Publié: (2024)
Rethinking Reward Models for Multi-Domain Test-Time Scaling
par: Lee, Dong Bok, et autres
Publié: (2025)
par: Lee, Dong Bok, et autres
Publié: (2025)
Maximizing Confidence Alone Improves Reasoning
par: Prabhudesai, Mihir, et autres
Publié: (2025)
par: Prabhudesai, Mihir, et autres
Publié: (2025)
NeuroProlog: Multi-Task Fine-Tuning for Neurosymbolic Mathematical Reasoning via the Cocktail Effect
par: Zunjare, Pratibha, et autres
Publié: (2026)
par: Zunjare, Pratibha, et autres
Publié: (2026)
CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute
par: Jin, Chen, et autres
Publié: (2026)
par: Jin, Chen, et autres
Publié: (2026)
ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control
par: Tang, Zhentao, et autres
Publié: (2026)
par: Tang, Zhentao, et autres
Publié: (2026)
Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation
par: Chen, Peter Baile, et autres
Publié: (2025)
par: Chen, Peter Baile, et autres
Publié: (2025)
TFGN: Task-Free, Replay-Free Continual Pre-Training Without Catastrophic Forgetting at LLM Scale
par: Ganguli, Anurup
Publié: (2026)
par: Ganguli, Anurup
Publié: (2026)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning
par: Bi, Zhenni, et autres
Publié: (2024)
par: Bi, Zhenni, et autres
Publié: (2024)
Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention
par: Yang, Zhen, et autres
Publié: (2025)
par: Yang, Zhen, et autres
Publié: (2025)
Inverse Scaling in Test-Time Compute
par: Gema, Aryo Pradipta, et autres
Publié: (2025)
par: Gema, Aryo Pradipta, et autres
Publié: (2025)
Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy
par: Shi, Xiaofeng, et autres
Publié: (2025)
par: Shi, Xiaofeng, et autres
Publié: (2025)
Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence
par: Ghasemabadi, Amirhosein, et autres
Publié: (2025)
par: Ghasemabadi, Amirhosein, et autres
Publié: (2025)
BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
par: Ou, Litu, et autres
Publié: (2025)
par: Ou, Litu, et autres
Publié: (2025)
On-Policy Supervised Fine-Tuning for Efficient Reasoning
par: Zhao, Anhao, et autres
Publié: (2026)
par: Zhao, Anhao, et autres
Publié: (2026)
Mitigating Strategy-Selection Bias in Reasoning for More Effective Test-Time Scaling
par: Wu, Zongqian, et autres
Publié: (2025)
par: Wu, Zongqian, et autres
Publié: (2025)
Rethinking the Role of Prompting Strategies in LLM Test-Time Scaling: A Perspective of Probability Theory
par: Liu, Yexiang, et autres
Publié: (2025)
par: Liu, Yexiang, et autres
Publié: (2025)
Beyond Model Scaling: Test-Time Intervention for Efficient Deep Reasoning
par: Wang, Qianyue, et autres
Publié: (2026)
par: Wang, Qianyue, et autres
Publié: (2026)
Efficiently Learning at Test-Time: Active Fine-Tuning of LLMs
par: Hübotter, Jonas, et autres
Publié: (2024)
par: Hübotter, Jonas, et autres
Publié: (2024)
Agentic Test-Time Scaling for WebAgents
par: Lee, Nicholas, et autres
Publié: (2026)
par: Lee, Nicholas, et autres
Publié: (2026)
MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
par: Chen, Hongwei, et autres
Publié: (2025)
par: Chen, Hongwei, et autres
Publié: (2025)
Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
par: Shen, Junhong, et autres
Publié: (2025)
par: Shen, Junhong, et autres
Publié: (2025)
GRIP: In-Parameter Graph Reasoning through Fine-Tuning Large Language Models
par: Feng, Jiarui, et autres
Publié: (2025)
par: Feng, Jiarui, et autres
Publié: (2025)
ScaleRTL: Scaling LLMs with Reasoning Data and Test-Time Compute for Accurate RTL Code Generation
par: Deng, Chenhui, et autres
Publié: (2025)
par: Deng, Chenhui, et autres
Publié: (2025)
Documents similaires
-
Deriving Neural Scaling Laws from the statistics of natural language
par: Cagnetta, Francesco, et autres
Publié: (2026) -
Unlocking LLM Creativity in Science through Analogical Reasoning
par: Shen, Andrew, et autres
Publié: (2026) -
Get rich quick: exact solutions reveal how unbalanced initializations promote rapid feature learning
par: Kunin, Daniel, et autres
Publié: (2024) -
Informed Correctors for Discrete Diffusion Models
par: Zhao, Yixiu, et autres
Publié: (2024) -
Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks
par: Chen, Feng, et autres
Publié: (2023)