Predictive Scheduling for Efficient Inference-Time Reasoning in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Brown, Katrina, Muppidi, Aneesh, Shahout, Rana |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Queueing, Predictions, and LLMs: Challenges and Open Problems
di: Mitzenmacher, Michael, et al.
Pubblicazione: (2025)
di: Mitzenmacher, Michael, et al.
Pubblicazione: (2025)
Fast Inference for Augmented Large Language Models
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
Fast TRAC: A Parameter-Free Optimizer for Lifelong Reinforcement Learning
di: Muppidi, Aneesh, et al.
Pubblicazione: (2024)
di: Muppidi, Aneesh, et al.
Pubblicazione: (2024)
Orla: A Library for Serving LLM-Based Multi-Agent Systems
di: Shahout, Rana, et al.
Pubblicazione: (2026)
di: Shahout, Rana, et al.
Pubblicazione: (2026)
SkipPredict: When to Invest in Predictions for Scheduling
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
PALS: Power-Aware LLM Serving for Mixture-of-Experts Models
di: Hankendi, Can, et al.
Pubblicazione: (2026)
di: Hankendi, Can, et al.
Pubblicazione: (2026)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
di: Komanduri, Aneesh, et al.
Pubblicazione: (2025)
di: Komanduri, Aneesh, et al.
Pubblicazione: (2025)
Permutation Invariant Learning with High-Dimensional Particle Filters
di: Boopathy, Akhilan, et al.
Pubblicazione: (2024)
di: Boopathy, Akhilan, et al.
Pubblicazione: (2024)
From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing
di: Shahout, Rana, et al.
Pubblicazione: (2025)
di: Shahout, Rana, et al.
Pubblicazione: (2025)
PhysicsEval: Inference-Time Techniques to Improve the Reasoning Proficiency of Large Language Models on Physics Problems
di: Siddique, Oshayer, et al.
Pubblicazione: (2025)
di: Siddique, Oshayer, et al.
Pubblicazione: (2025)
TCM-Serve: Modality-aware Scheduling for Multimodal Large Language Model Inference
di: Papaioannou, Konstantinos, et al.
Pubblicazione: (2026)
di: Papaioannou, Konstantinos, et al.
Pubblicazione: (2026)
A Survey on Efficient Inference for Large Language Models
di: Zhou, Zixuan, et al.
Pubblicazione: (2024)
di: Zhou, Zixuan, et al.
Pubblicazione: (2024)
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
di: Sui, Yuan, et al.
Pubblicazione: (2025)
di: Sui, Yuan, et al.
Pubblicazione: (2025)
Real-Time Progress Prediction in Reasoning Language Models
di: Raaschou-Jensen, Hans Peter Lyngsøe, et al.
Pubblicazione: (2025)
di: Raaschou-Jensen, Hans Peter Lyngsøe, et al.
Pubblicazione: (2025)
SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models
di: Tian, Jiayi, et al.
Pubblicazione: (2025)
di: Tian, Jiayi, et al.
Pubblicazione: (2025)
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
di: Hutson, Dylan, et al.
Pubblicazione: (2025)
di: Hutson, Dylan, et al.
Pubblicazione: (2025)
ARS: Adaptive Reasoning Suppression for Efficient Large Reasoning Language Models
di: Zheng, Dongqi
Pubblicazione: (2025)
di: Zheng, Dongqi
Pubblicazione: (2025)
Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time
di: Yang, Wang, et al.
Pubblicazione: (2025)
di: Yang, Wang, et al.
Pubblicazione: (2025)
Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning
di: Fu, Zichuan, et al.
Pubblicazione: (2026)
di: Fu, Zichuan, et al.
Pubblicazione: (2026)
DART: Difficulty-Adaptive Reasoning Truncation for Efficient Large Language Models
di: Zhang, Ruofan, et al.
Pubblicazione: (2025)
di: Zhang, Ruofan, et al.
Pubblicazione: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
di: Shi, Wenqi, et al.
Pubblicazione: (2024)
di: Shi, Wenqi, et al.
Pubblicazione: (2024)
Efficient Large Language Model Inference with Neural Block Linearization
di: Erdogan, Mete, et al.
Pubblicazione: (2025)
di: Erdogan, Mete, et al.
Pubblicazione: (2025)
Plato: Plan to Efficiently Decode for Large Language Model Inference
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
Multimodal Hidden Markov Models for Persistent Emotional State Tracking
di: Ragu, Anamika, et al.
Pubblicazione: (2026)
di: Ragu, Anamika, et al.
Pubblicazione: (2026)
ExpertFlow: Efficient Mixture-of-Experts Inference via Predictive Expert Caching and Token Scheduling
di: He, Xin, et al.
Pubblicazione: (2024)
di: He, Xin, et al.
Pubblicazione: (2024)
Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Model-First Reasoning LLM Agents: Reducing Hallucinations through Explicit Problem Modeling
di: Rana, Annu, et al.
Pubblicazione: (2025)
di: Rana, Annu, et al.
Pubblicazione: (2025)
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
di: Liu, Yan, et al.
Pubblicazione: (2026)
di: Liu, Yan, et al.
Pubblicazione: (2026)
Reasoning-Enhanced Large Language Models for Molecular Property Prediction
di: Zhuang, Jiaxi, et al.
Pubblicazione: (2025)
di: Zhuang, Jiaxi, et al.
Pubblicazione: (2025)
Combining Constraint Programming Reasoning with Large Language Model Predictions
di: Régin, Florian, et al.
Pubblicazione: (2024)
di: Régin, Florian, et al.
Pubblicazione: (2024)
A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models
di: Chang, Ching, et al.
Pubblicazione: (2025)
di: Chang, Ching, et al.
Pubblicazione: (2025)
ShorterBetter: Guiding Reasoning Models to Find Optimal Inference Length for Efficient Reasoning
di: Yi, Jingyang, et al.
Pubblicazione: (2025)
di: Yi, Jingyang, et al.
Pubblicazione: (2025)
ENSI: Efficient Non-Interactive Secure Inference for Large Language Models
di: He, Zhiyu, et al.
Pubblicazione: (2025)
di: He, Zhiyu, et al.
Pubblicazione: (2025)
Optimal Self-Consistency for Efficient Reasoning with Large Language Models
di: Feng, Austin, et al.
Pubblicazione: (2025)
di: Feng, Austin, et al.
Pubblicazione: (2025)
TIP-Search: Time-Predictable Inference Scheduling for Market Prediction under Uncertain Load
di: Wang, Xibai
Pubblicazione: (2025)
di: Wang, Xibai
Pubblicazione: (2025)
Human-Alignment and Calibration of Inference-Time Uncertainty in Large Language Models
di: Moore, Kyle, et al.
Pubblicazione: (2025)
di: Moore, Kyle, et al.
Pubblicazione: (2025)
ALISE: Accelerating Large Language Model Serving with Speculative Scheduling
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
Investigating the Potential of Using Large Language Models for Scheduling
di: Jobson, Deddy, et al.
Pubblicazione: (2024)
di: Jobson, Deddy, et al.
Pubblicazione: (2024)
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
di: Zeng, Bowen, et al.
Pubblicazione: (2026)
di: Zeng, Bowen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Queueing, Predictions, and LLMs: Challenges and Open Problems
di: Mitzenmacher, Michael, et al.
Pubblicazione: (2025) -
Fast Inference for Augmented Large Language Models
di: Shahout, Rana, et al.
Pubblicazione: (2024) -
Fast TRAC: A Parameter-Free Optimizer for Lifelong Reinforcement Learning
di: Muppidi, Aneesh, et al.
Pubblicazione: (2024) -
Orla: A Library for Serving LLM-Based Multi-Agent Systems
di: Shahout, Rana, et al.
Pubblicazione: (2026) -
SkipPredict: When to Invest in Predictions for Scheduling
di: Shahout, Rana, et al.
Pubblicazione: (2024)