S*: Test Time Scaling for Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Dacheng, Cao, Shiyi, Cao, Chengkun, Li, Xiuyu, Tan, Shangyin, Keutzer, Kurt, Xing, Jiarong, Gonzalez, Joseph E., Stoica, Ion |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fairness in Serving Large Language Models
par: Sheng, Ying, et autres
Publié: (2023)
par: Sheng, Ying, et autres
Publié: (2023)
K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model
par: Cao, Shiyi, et autres
Publié: (2026)
par: Cao, Shiyi, et autres
Publié: (2026)
S-LoRA: Serving Thousands of Concurrent LoRA Adapters
par: Sheng, Ying, et autres
Publié: (2023)
par: Sheng, Ying, et autres
Publié: (2023)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
par: Cemri, Mert, et autres
Publié: (2025)
par: Cemri, Mert, et autres
Publié: (2025)
NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference
par: Jiang, Xuanlin, et autres
Publié: (2024)
par: Jiang, Xuanlin, et autres
Publié: (2024)
LLoCO: Learning Long Contexts Offline
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling
par: Mishra, Mayank, et autres
Publié: (2026)
par: Mishra, Mayank, et autres
Publié: (2026)
MPC-Minimized Secure LLM Inference
par: Rathee, Deevashwer, et autres
Publié: (2024)
par: Rathee, Deevashwer, et autres
Publié: (2024)
DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training
par: Li, Dacheng, et autres
Publié: (2023)
par: Li, Dacheng, et autres
Publié: (2023)
MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs
par: Cao, Shiyi, et autres
Publié: (2024)
par: Cao, Shiyi, et autres
Publié: (2024)
Prism: Unleashing GPU Sharing for Cost-Efficient Multi-LLM Serving
par: Yu, Shan, et autres
Publié: (2025)
par: Yu, Shan, et autres
Publié: (2025)
RouterBench: A Benchmark for Multi-LLM Routing System
par: Hu, Qitian Jason, et autres
Publié: (2024)
par: Hu, Qitian Jason, et autres
Publié: (2024)
Inference Time Context Sparsity: Illusion or Opportunity?
par: Joshi, Sahil, et autres
Publié: (2026)
par: Joshi, Sahil, et autres
Publié: (2026)
Post-Training Sparse Attention with Double Sparsity
par: Yang, Shuo, et autres
Publié: (2024)
par: Yang, Shuo, et autres
Publié: (2024)
HashAttention: Semantic Sparsity for Faster Inference
par: Desai, Aditya, et autres
Publié: (2024)
par: Desai, Aditya, et autres
Publié: (2024)
LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!
par: Li, Dacheng, et autres
Publié: (2025)
par: Li, Dacheng, et autres
Publié: (2025)
Code Generation by Differential Test Time Scaling
par: He, Yifeng, et autres
Publié: (2026)
par: He, Yifeng, et autres
Publié: (2026)
Agentic Test-Time Scaling for WebAgents
par: Lee, Nicholas, et autres
Publié: (2026)
par: Lee, Nicholas, et autres
Publié: (2026)
Sleep-time Compute: Beyond Inference Scaling at Test-time
par: Lin, Kevin, et autres
Publié: (2025)
par: Lin, Kevin, et autres
Publié: (2025)
WorldModelBench: Judging Video Generation Models As World Models
par: Li, Dacheng, et autres
Publié: (2025)
par: Li, Dacheng, et autres
Publié: (2025)
depyf: Open the Opaque Box of PyTorch Compiler for Machine Learning Researchers
par: You, Kaichao, et autres
Publié: (2024)
par: You, Kaichao, et autres
Publié: (2024)
Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation
par: Li, Xingyang, et autres
Publié: (2025)
par: Li, Xingyang, et autres
Publié: (2025)
SDGF: Fusing Static and Multi-Scale Dynamic Correlations for Multivariate Time Series Forecasting
par: Wang, Shaoxun, et autres
Publié: (2025)
par: Wang, Shaoxun, et autres
Publié: (2025)
MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation
par: Wang, Yutong, et autres
Publié: (2025)
par: Wang, Yutong, et autres
Publié: (2025)
BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation
par: Zhu, Alan, et autres
Publié: (2025)
par: Zhu, Alan, et autres
Publié: (2025)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
par: Zhang, Jintao, et autres
Publié: (2025)
par: Zhang, Jintao, et autres
Publié: (2025)
SageBwd: A Trainable Low-bit Attention
par: Zhang, Jintao, et autres
Publié: (2026)
par: Zhang, Jintao, et autres
Publié: (2026)
A Statistical Framework for Ranking LLM-Based Chatbots
par: Ameli, Siavash, et autres
Publié: (2024)
par: Ameli, Siavash, et autres
Publié: (2024)
JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models
par: Cao, Jialun, et autres
Publié: (2024)
par: Cao, Jialun, et autres
Publié: (2024)
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
par: Li, Tianle, et autres
Publié: (2024)
par: Li, Tianle, et autres
Publié: (2024)
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
par: Bai, Yifan, et autres
Publié: (2026)
par: Bai, Yifan, et autres
Publié: (2026)
Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution
par: Park, Jongseok, et autres
Publié: (2026)
par: Park, Jongseok, et autres
Publié: (2026)
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
par: Guo, Wentao, et autres
Publié: (2025)
par: Guo, Wentao, et autres
Publié: (2025)
RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models
par: Kwok, Jacky, et autres
Publié: (2025)
par: Kwok, Jacky, et autres
Publié: (2025)
vAttention: Verified Sparse Attention
par: Desai, Aditya, et autres
Publié: (2025)
par: Desai, Aditya, et autres
Publié: (2025)
CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
par: Zhu, Xiao, et autres
Publié: (2026)
par: Zhu, Xiao, et autres
Publié: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
par: Cao, Shiyi, et autres
Publié: (2025)
par: Cao, Shiyi, et autres
Publié: (2025)
Revisiting Long-term Time Series Forecasting: An Investigation on Linear Mapping
par: Li, Zhe, et autres
Publié: (2023)
par: Li, Zhe, et autres
Publié: (2023)
Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling
par: Wang, Xinglin, et autres
Publié: (2025)
par: Wang, Xinglin, et autres
Publié: (2025)
Scaling Test-Time Compute for Agentic Coding
par: Kim, Joongwon, et autres
Publié: (2026)
par: Kim, Joongwon, et autres
Publié: (2026)
Documents similaires
-
Fairness in Serving Large Language Models
par: Sheng, Ying, et autres
Publié: (2023) -
K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model
par: Cao, Shiyi, et autres
Publié: (2026) -
S-LoRA: Serving Thousands of Concurrent LoRA Adapters
par: Sheng, Ying, et autres
Publié: (2023) -
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
par: Cemri, Mert, et autres
Publié: (2025) -
NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference
par: Jiang, Xuanlin, et autres
Publié: (2024)