Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Youpeng, LV, Jinpeng, Wu, Di, Wang, Jun, Gooley, Christopher |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
ALISE: Accelerating Large Language Model Serving with Speculative Scheduling
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving
von: Jayakody, Shakya, et al.
Veröffentlicht: (2026)
von: Jayakody, Shakya, et al.
Veröffentlicht: (2026)
Time is Not Compute: Scaling Laws for Wall-Clock Constrained Training on Consumer GPUs
von: Liu, Yi
Veröffentlicht: (2026)
von: Liu, Yi
Veröffentlicht: (2026)
The Race to Efficiency: A New Perspective on AI Scaling Laws
von: Lu, Chien-Ping
Veröffentlicht: (2025)
von: Lu, Chien-Ping
Veröffentlicht: (2025)
Generalizing Scaling Laws for Dense and Sparse Large Language Models
von: Hossain, Md Arafat, et al.
Veröffentlicht: (2025)
von: Hossain, Md Arafat, et al.
Veröffentlicht: (2025)
AI-driven Java Performance Testing: Balancing Result Quality with Testing Time
von: Traini, Luca, et al.
Veröffentlicht: (2024)
von: Traini, Luca, et al.
Veröffentlicht: (2024)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
von: Jha, Mayank
Veröffentlicht: (2026)
von: Jha, Mayank
Veröffentlicht: (2026)
Adaptive Orchestration for Large-Scale Inference on Heterogeneous Accelerator Systems Balancing Cost, Performance, and Resilience
von: Biran, Yahav, et al.
Veröffentlicht: (2025)
von: Biran, Yahav, et al.
Veröffentlicht: (2025)
DeepContext: A Context-aware, Cross-platform, and Cross-framework Tool for Performance Profiling and Analysis of Deep Learning Workloads
von: Zhao, Qidong, et al.
Veröffentlicht: (2024)
von: Zhao, Qidong, et al.
Veröffentlicht: (2024)
Comment on paper: Position: Rethinking Post-Hoc Search-Based Neural Approaches for Solving Large-Scale Traveling Salesman Problems
von: Min, Yimeng
Veröffentlicht: (2024)
von: Min, Yimeng
Veröffentlicht: (2024)
Improving LLM Performance Through Black-Box Online Tuning: A Case for Adding System Specs to Factsheets for Trusted AI
von: Atinafu, Yonas, et al.
Veröffentlicht: (2026)
von: Atinafu, Yonas, et al.
Veröffentlicht: (2026)
Offloading and Quality Control for AI Generated Content Services in 6G Mobile Edge Computing Networks
von: Wang, Yitong, et al.
Veröffentlicht: (2023)
von: Wang, Yitong, et al.
Veröffentlicht: (2023)
Can We Make Code Green? Understanding Trade-Offs in LLMs vs. Human Code Optimizations
von: Rani, Pooja, et al.
Veröffentlicht: (2025)
von: Rani, Pooja, et al.
Veröffentlicht: (2025)
TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput
von: Liu, Xiaoxuan, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoxuan, et al.
Veröffentlicht: (2024)
LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics
von: Liu, Jiashuo, et al.
Veröffentlicht: (2025)
von: Liu, Jiashuo, et al.
Veröffentlicht: (2025)
A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search
von: Ellis-Mohr, Austin R., et al.
Veröffentlicht: (2025)
von: Ellis-Mohr, Austin R., et al.
Veröffentlicht: (2025)
Root Cause Localization for Microservice Systems in Cloud-edge Collaborative Environments
von: Zhu, Yuhan, et al.
Veröffentlicht: (2024)
von: Zhu, Yuhan, et al.
Veröffentlicht: (2024)
Rapid Augmentations for Time Series (RATS): A High-Performance Library for Time Series Augmentation
von: Skaf, Wadie, et al.
Veröffentlicht: (2026)
von: Skaf, Wadie, et al.
Veröffentlicht: (2026)
Quantifying the Generalization Gap in Seizure Detection: A Large-Scale Empirical Benchmark via the SzCORE Challenge
von: Dan, Jonathan, et al.
Veröffentlicht: (2025)
von: Dan, Jonathan, et al.
Veröffentlicht: (2025)
XTC, A Research Platform for Optimizing AI Workload Operators
von: Hugo, Pompougnac, et al.
Veröffentlicht: (2025)
von: Hugo, Pompougnac, et al.
Veröffentlicht: (2025)
DDSA: Dual-Domain Strategic Attack for Spatial-Temporal Efficiency in Adversarial Robustness Testing
von: Hu, Jinwei, et al.
Veröffentlicht: (2026)
von: Hu, Jinwei, et al.
Veröffentlicht: (2026)
LogiPlan: A Structured Benchmark for Logical Planning and Relational Reasoning in LLMs
von: Cai, Yanan, et al.
Veröffentlicht: (2025)
von: Cai, Yanan, et al.
Veröffentlicht: (2025)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
von: Zhao, Yushang, et al.
Veröffentlicht: (2025)
von: Zhao, Yushang, et al.
Veröffentlicht: (2025)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
von: Fang, Yunhua, et al.
Veröffentlicht: (2025)
von: Fang, Yunhua, et al.
Veröffentlicht: (2025)
FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
von: Qiao, Liang, et al.
Veröffentlicht: (2025)
von: Qiao, Liang, et al.
Veröffentlicht: (2025)
Scaling Multi Agent Reinforcement Learning for Underwater Acoustic Tracking via Autonomous Vehicles
von: Gallici, Matteo, et al.
Veröffentlicht: (2025)
von: Gallici, Matteo, et al.
Veröffentlicht: (2025)
Energy-Efficient Transformer Inference: Optimization Strategies for Time Series Classification
von: Kermani, Arshia, et al.
Veröffentlicht: (2025)
von: Kermani, Arshia, et al.
Veröffentlicht: (2025)
A 4D Hybrid Algorithm to Scale Parallel Training to Thousands of GPUs
von: Singh, Siddharth, et al.
Veröffentlicht: (2023)
von: Singh, Siddharth, et al.
Veröffentlicht: (2023)
Energy Concerns with HPC Systems and Applications
von: Nana, Roblex, et al.
Veröffentlicht: (2023)
von: Nana, Roblex, et al.
Veröffentlicht: (2023)
KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta
von: Liao, Gang, et al.
Veröffentlicht: (2025)
von: Liao, Gang, et al.
Veröffentlicht: (2025)
This Is Taking Too Long -- Investigating Time as a Proxy for Energy Consumption of LLMs
von: Krupp, Lars, et al.
Veröffentlicht: (2026)
von: Krupp, Lars, et al.
Veröffentlicht: (2026)
On the Compression of Language Models for Code: An Empirical Study on CodeBERT
von: d'Aloisio, Giordano, et al.
Veröffentlicht: (2024)
von: d'Aloisio, Giordano, et al.
Veröffentlicht: (2024)
Impact of Data-Oriented and Object-Oriented Design on Performance and Cache Utilization with Artificial Intelligence Algorithms in Multi-Threaded CPUs
von: Arantes, Gabriel M., et al.
Veröffentlicht: (2025)
von: Arantes, Gabriel M., et al.
Veröffentlicht: (2025)
PerfDojo: Automated ML Library Generation for Heterogeneous Architectures
von: Ivanov, Andrei, et al.
Veröffentlicht: (2025)
von: Ivanov, Andrei, et al.
Veröffentlicht: (2025)
Edge Deployment of Small Language Models, a comprehensive comparison of CPU, GPU and NPU backends
von: Prieto, Pablo, et al.
Veröffentlicht: (2025)
von: Prieto, Pablo, et al.
Veröffentlicht: (2025)
PixLift: Accelerating Web Browsing via AI Upscaling
von: Atinafu, Yonas, et al.
Veröffentlicht: (2025)
von: Atinafu, Yonas, et al.
Veröffentlicht: (2025)
Tiny-QMoE
von: Cashman, Jack, et al.
Veröffentlicht: (2025)
von: Cashman, Jack, et al.
Veröffentlicht: (2025)
Understanding and Benchmarking Artificial Intelligence: OpenAI's o3 Is Not AGI
von: Pfister, Rolf, et al.
Veröffentlicht: (2025)
von: Pfister, Rolf, et al.
Veröffentlicht: (2025)
FlexQuant: Elastic Quantization Framework for Locally Hosted LLM on Edge Devices
von: Chai, Yuji, et al.
Veröffentlicht: (2025)
von: Chai, Yuji, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024) -
ALISE: Accelerating Large Language Model Serving with Speculative Scheduling
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024) -
GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving
von: Jayakody, Shakya, et al.
Veröffentlicht: (2026) -
Time is Not Compute: Scaling Laws for Wall-Clock Constrained Training on Consumer GPUs
von: Liu, Yi
Veröffentlicht: (2026) -
The Race to Efficiency: A New Perspective on AI Scaling Laws
von: Lu, Chien-Ping
Veröffentlicht: (2025)