Universal Model Routing for Efficient LLM Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Jitkrittum, Wittawat, Narasimhan, Harikrishna, Rawat, Ankit Singh, Juneja, Jeevesh, Wang, Congchao, Wang, Zifeng, Go, Alec, Lee, Chen-Yu, Shenoy, Pradeep, Panigrahy, Rina, Menon, Aditya Krishna, Kumar, Sanjiv |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cascade-Aware Training of Language Models
di: Wang, Congchao, et al.
Pubblicazione: (2024)
di: Wang, Congchao, et al.
Pubblicazione: (2024)
When Does Confidence-Based Cascade Deferral Suffice?
di: Jitkrittum, Wittawat, et al.
Pubblicazione: (2023)
di: Jitkrittum, Wittawat, et al.
Pubblicazione: (2023)
Language Model Cascades: Token-level uncertainty and beyond
di: Gupta, Neha, et al.
Pubblicazione: (2024)
di: Gupta, Neha, et al.
Pubblicazione: (2024)
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
Regression-aware Inference with LLMs
di: Lukasik, Michal, et al.
Pubblicazione: (2024)
di: Lukasik, Michal, et al.
Pubblicazione: (2024)
Bipartite Ranking From Multiple Labels: On Loss Versus Label Aggregation
di: Lukasik, Michal, et al.
Pubblicazione: (2025)
di: Lukasik, Michal, et al.
Pubblicazione: (2025)
A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
Think before you speak: Training Language Models With Pause Tokens
di: Goyal, Sachin, et al.
Pubblicazione: (2023)
di: Goyal, Sachin, et al.
Pubblicazione: (2023)
Gatekeeper: Improving Model Cascades Through Confidence Tuning
di: Rabanser, Stephan, et al.
Pubblicazione: (2025)
di: Rabanser, Stephan, et al.
Pubblicazione: (2025)
Privacy-preserved LLM Cascade via CoT-enhanced Policy Learning
di: Zhang, Kai, et al.
Pubblicazione: (2024)
di: Zhang, Kai, et al.
Pubblicazione: (2024)
Cost-Aware Routing for Efficient Text-To-Image Generation
di: Li, Qinchan, et al.
Pubblicazione: (2025)
di: Li, Qinchan, et al.
Pubblicazione: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
Efficient Document Ranking with Learnable Late Interactions
di: Ji, Ziwei, et al.
Pubblicazione: (2024)
di: Ji, Ziwei, et al.
Pubblicazione: (2024)
Limitations on Accurate, Trusted, Human-level Reasoning
di: Panigrahy, Rina, et al.
Pubblicazione: (2025)
di: Panigrahy, Rina, et al.
Pubblicazione: (2025)
Less Is More: Measuring How LLM Involvement affects Chatbot Accuracy in Static Analysis
di: Narasimhan, Krishna
Pubblicazione: (2026)
di: Narasimhan, Krishna
Pubblicazione: (2026)
ReLope: KL-Regularized LoRA Probes for Multimodal LLM Routing
di: Zeng, Yaopei, et al.
Pubblicazione: (2026)
di: Zeng, Yaopei, et al.
Pubblicazione: (2026)
On student-teacher deviations in distillation: does it pay to disobey?
di: Nagarajan, Vaishnavh, et al.
Pubblicazione: (2023)
di: Nagarajan, Vaishnavh, et al.
Pubblicazione: (2023)
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
di: Shah, Kulin, et al.
Pubblicazione: (2024)
di: Shah, Kulin, et al.
Pubblicazione: (2024)
Understanding the Nuances: The Quantity and Quality of Learner Feedback in Second‐Language Pronunciation
di: Congchao Hua
Pubblicazione: (2026)
di: Congchao Hua
Pubblicazione: (2026)
Dynamic Exponent Market Maker: Personalized Portfolio Manager and One Pool to Trade Them All
di: Kositwattanarerk, Wittawat
Pubblicazione: (2025)
di: Kositwattanarerk, Wittawat
Pubblicazione: (2025)
Financial literacy and Women's empowerment in rural India: Empirical evidence from Sagar district, Madhya Pradesh
di: Joga Harikrishna, et al.
Pubblicazione: (2026)
di: Joga Harikrishna, et al.
Pubblicazione: (2026)
Simple Mechanisms for Representing, Indexing and Manipulating Concepts
di: Li, Yuanzhi, et al.
Pubblicazione: (2023)
di: Li, Yuanzhi, et al.
Pubblicazione: (2023)
Ethnomedicinal Uses, Phytochemistry, Pharmacology, and Toxicology of Ruellia tuberosa L.: A Review
di: Akanksha Sharma, et al.
Pubblicazione: (2024)
di: Akanksha Sharma, et al.
Pubblicazione: (2024)
Exploring the Influence of Graph Operations on Zero Forcing Sets
di: Menon, Krishna, et al.
Pubblicazione: (2024)
di: Menon, Krishna, et al.
Pubblicazione: (2024)
Descent-restricted subsequences via RSK and evacuation
di: Menon, Krishna, et al.
Pubblicazione: (2026)
di: Menon, Krishna, et al.
Pubblicazione: (2026)
Short-Context Dominance: How Much Local Context Natural Language Actually Needs?
di: Vakilian, Vala, et al.
Pubblicazione: (2025)
di: Vakilian, Vala, et al.
Pubblicazione: (2025)
OLAF: A Plug-and-Play Framework for Enhanced Multi-object Multi-part Scene Parsing
di: Gupta, Pranav, et al.
Pubblicazione: (2024)
di: Gupta, Pranav, et al.
Pubblicazione: (2024)
A Statistical Framework for Data-dependent Retrieval-Augmented Models
di: Basu, Soumya, et al.
Pubblicazione: (2024)
di: Basu, Soumya, et al.
Pubblicazione: (2024)
Fine-grained Analysis of In-context Linear Estimation: Data, Architecture, and Beyond
di: Li, Yingcong, et al.
Pubblicazione: (2024)
di: Li, Yingcong, et al.
Pubblicazione: (2024)
StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel
di: Cutler, Dylan, et al.
Pubblicazione: (2025)
di: Cutler, Dylan, et al.
Pubblicazione: (2025)
Selective classification using a robust meta-learning approach
di: Jain, Nishant, et al.
Pubblicazione: (2022)
di: Jain, Nishant, et al.
Pubblicazione: (2022)
Improving Generalization via Meta-Learning on Hard Samples
di: Jain, Nishant, et al.
Pubblicazione: (2024)
di: Jain, Nishant, et al.
Pubblicazione: (2024)
Sum of squares of hook lengths and contents
di: Menon, Krishna
Pubblicazione: (2024)
di: Menon, Krishna
Pubblicazione: (2024)
A Implies B: Circuit Analysis in LLMs for Propositional Logical Reasoning
di: Hong, Guan Zhe, et al.
Pubblicazione: (2024)
di: Hong, Guan Zhe, et al.
Pubblicazione: (2024)
The importance of feature preprocessing for differentially private linear optimization
di: Sun, Ziteng, et al.
Pubblicazione: (2023)
di: Sun, Ziteng, et al.
Pubblicazione: (2023)
Noncommutative Geometry and the Thermodynamic Fate of Black Holes
di: Anand, Ankit, et al.
Pubblicazione: (2025)
di: Anand, Ankit, et al.
Pubblicazione: (2025)
Effect of Non-Extensive Parameter on Page Curve
di: Anand, Ankit, et al.
Pubblicazione: (2025)
di: Anand, Ankit, et al.
Pubblicazione: (2025)
Unequal Clustering and Routing Optimization in Wireless Sensor Networks Using Bonobo Optimizer: Maximizing Energy Efficiency and Network Lifetime
di: Manikandan Hariharan, et al.
Pubblicazione: (2026)
di: Manikandan Hariharan, et al.
Pubblicazione: (2026)
Bias-Corrected Adaptive Conformal Inference for Multi-Horizon Time Series Forecasting
di: Lade, Ankit, et al.
Pubblicazione: (2026)
di: Lade, Ankit, et al.
Pubblicazione: (2026)
Life history of prawns: a review of recent studies with special reference to Indian species
di: Krishna Menon, M.
Pubblicazione: (1965)
di: Krishna Menon, M.
Pubblicazione: (1965)
Documenti analoghi
-
Cascade-Aware Training of Language Models
di: Wang, Congchao, et al.
Pubblicazione: (2024) -
When Does Confidence-Based Cascade Deferral Suffice?
di: Jitkrittum, Wittawat, et al.
Pubblicazione: (2023) -
Language Model Cascades: Token-level uncertainty and beyond
di: Gupta, Neha, et al.
Pubblicazione: (2024) -
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024) -
Regression-aware Inference with LLMs
di: Lukasik, Michal, et al.
Pubblicazione: (2024)