Sleep-time Compute: Beyond Inference Scaling at Test-time
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Kevin, Snell, Charlie, Wang, Yu, Packer, Charles, Wooders, Sarah, Stoica, Ion, Gonzalez, Joseph E. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MemGPT: Towards LLMs as Operating Systems
par: Packer, Charles, et autres
Publié: (2023)
par: Packer, Charles, et autres
Publié: (2023)
Post-Training Sparse Attention with Double Sparsity
par: Yang, Shuo, et autres
Publié: (2024)
par: Yang, Shuo, et autres
Publié: (2024)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
par: Cui, Justin, et autres
Publié: (2024)
par: Cui, Justin, et autres
Publié: (2024)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
par: Cemri, Mert, et autres
Publié: (2025)
par: Cemri, Mert, et autres
Publié: (2025)
Speculative Decoding: Performance or Illusion?
par: Liu, Xiaoxuan, et autres
Publié: (2025)
par: Liu, Xiaoxuan, et autres
Publié: (2025)
RAFT: Adapting Language Model to Domain Specific RAG
par: Zhang, Tianjun, et autres
Publié: (2024)
par: Zhang, Tianjun, et autres
Publié: (2024)
GameArena: Evaluating LLM Reasoning through Live Computer Games
par: Hu, Lanxiang, et autres
Publié: (2024)
par: Hu, Lanxiang, et autres
Publié: (2024)
LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset
par: Zheng, Lianmin, et autres
Publié: (2023)
par: Zheng, Lianmin, et autres
Publié: (2023)
OptScale: Probabilistic Optimality for Inference-time Scaling
par: Wang, Youkang, et autres
Publié: (2025)
par: Wang, Youkang, et autres
Publié: (2025)
Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
par: Chen, Lingjiao, et autres
Publié: (2024)
par: Chen, Lingjiao, et autres
Publié: (2024)
T1: Tool-integrated Verification for Test-time Compute Scaling in Small Language Models
par: Kang, Minki, et autres
Publié: (2025)
par: Kang, Minki, et autres
Publié: (2025)
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
par: Paliotta, Daniele, et autres
Publié: (2025)
par: Paliotta, Daniele, et autres
Publié: (2025)
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
par: Li, Tianle, et autres
Publié: (2024)
par: Li, Tianle, et autres
Publié: (2024)
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
par: Wang, Fali, et autres
Publié: (2025)
par: Wang, Fali, et autres
Publié: (2025)
Reasoning Models Can Be Effective Without Thinking
par: Ma, Wenjie, et autres
Publié: (2025)
par: Ma, Wenjie, et autres
Publié: (2025)
ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute
par: Wen, Hao, et autres
Publié: (2025)
par: Wen, Hao, et autres
Publié: (2025)
Test-time Prompt Intervention
par: Yang, Chenxu, et autres
Publié: (2025)
par: Yang, Chenxu, et autres
Publié: (2025)
RouteLLM: Learning to Route LLMs with Preference Data
par: Ong, Isaac, et autres
Publié: (2024)
par: Ong, Isaac, et autres
Publié: (2024)
ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
par: Li, Xirui, et autres
Publié: (2026)
par: Li, Xirui, et autres
Publié: (2026)
Scaling LLM Inference with Optimized Sample Compute Allocation
par: Zhang, Kexun, et autres
Publié: (2024)
par: Zhang, Kexun, et autres
Publié: (2024)
S*: Test Time Scaling for Code Generation
par: Li, Dacheng, et autres
Publié: (2025)
par: Li, Dacheng, et autres
Publié: (2025)
HashAttention: Semantic Sparsity for Faster Inference
par: Desai, Aditya, et autres
Publié: (2024)
par: Desai, Aditya, et autres
Publié: (2024)
K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model
par: Cao, Shiyi, et autres
Publié: (2026)
par: Cao, Shiyi, et autres
Publié: (2026)
UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
par: Huang, Kaiyu, et autres
Publié: (2026)
par: Huang, Kaiyu, et autres
Publié: (2026)
BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation
par: Zhu, Alan, et autres
Publié: (2025)
par: Zhu, Alan, et autres
Publié: (2025)
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
par: Chiang, Wei-Lin, et autres
Publié: (2024)
par: Chiang, Wei-Lin, et autres
Publié: (2024)
How to Evaluate Reward Models for RLHF
par: Frick, Evan, et autres
Publié: (2024)
par: Frick, Evan, et autres
Publié: (2024)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
Trust but Verify! A Survey on Verification Design for Test-time Scaling
par: Venktesh, V, et autres
Publié: (2025)
par: Venktesh, V, et autres
Publié: (2025)
SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Inverse Scaling in Test-Time Compute
par: Gema, Aryo Pradipta, et autres
Publié: (2025)
par: Gema, Aryo Pradipta, et autres
Publié: (2025)
Adaptive Rectification Sampling for Test-Time Compute Scaling
par: Tan, Zhendong, et autres
Publié: (2025)
par: Tan, Zhendong, et autres
Publié: (2025)
GoEX: Perspectives and Designs Towards a Runtime for Autonomous LLM Applications
par: Patil, Shishir G., et autres
Publié: (2024)
par: Patil, Shishir G., et autres
Publié: (2024)
Budget-aware Test-time Scaling via Discriminative Verification
par: Montgomery, Kyle, et autres
Publié: (2025)
par: Montgomery, Kyle, et autres
Publié: (2025)
SGLang: Efficient Execution of Structured Language Model Programs
par: Zheng, Lianmin, et autres
Publié: (2023)
par: Zheng, Lianmin, et autres
Publié: (2023)
depyf: Open the Opaque Box of PyTorch Compiler for Machine Learning Researchers
par: You, Kaichao, et autres
Publié: (2024)
par: You, Kaichao, et autres
Publié: (2024)
Evaluating Language Model Context Windows: A "Working Memory" Test and Inference-time Correction
par: Dsouza, Amanda, et autres
Publié: (2024)
par: Dsouza, Amanda, et autres
Publié: (2024)
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
par: Snell, Charlie, et autres
Publié: (2024)
par: Snell, Charlie, et autres
Publié: (2024)
DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis
par: Patel, Liana, et autres
Publié: (2025)
par: Patel, Liana, et autres
Publié: (2025)
Documents similaires
-
MemGPT: Towards LLMs as Operating Systems
par: Packer, Charles, et autres
Publié: (2023) -
Post-Training Sparse Attention with Double Sparsity
par: Yang, Shuo, et autres
Publié: (2024) -
OR-Bench: An Over-Refusal Benchmark for Large Language Models
par: Cui, Justin, et autres
Publié: (2024) -
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
par: Cemri, Mert, et autres
Publié: (2025) -
Speculative Decoding: Performance or Illusion?
par: Liu, Xiaoxuan, et autres
Publié: (2025)