Eagle: Efficient Training-Free Router for Multi-LLM Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Zesen, Jin, Shuowei, Mao, Z. Morley |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Compute Or Load KV Cache? Why Not Both?
par: Jin, Shuowei, et autres
Publié: (2024)
par: Jin, Shuowei, et autres
Publié: (2024)
MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search
par: Cho, Minkyoung, et autres
Publié: (2026)
par: Cho, Minkyoung, et autres
Publié: (2026)
TensorOpera Router: A Multi-Model Router for Efficient LLM Inference
par: Stripelis, Dimitris, et autres
Publié: (2024)
par: Stripelis, Dimitris, et autres
Publié: (2024)
HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs
par: Wu, Yongji, et autres
Publié: (2025)
par: Wu, Yongji, et autres
Publié: (2025)
AutoSpec: Automated Generation of Neural Network Specifications
par: Jin, Shuowei, et autres
Publié: (2024)
par: Jin, Shuowei, et autres
Publié: (2024)
Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training
par: Hu, Pingbang, et autres
Publié: (2026)
par: Hu, Pingbang, et autres
Publié: (2026)
Lodestar: An Online-Learning LLM Inference Router
par: Lim, Gangmuk, et autres
Publié: (2026)
par: Lim, Gangmuk, et autres
Publié: (2026)
AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs
par: Zheng, Haizhong, et autres
Publié: (2026)
par: Zheng, Haizhong, et autres
Publié: (2026)
RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers
par: Lu, Yifan, et autres
Publié: (2025)
par: Lu, Yifan, et autres
Publié: (2025)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
par: Ma, Wenhan, et autres
Publié: (2025)
par: Ma, Wenhan, et autres
Publié: (2025)
CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving
par: Zhu, Ruiyang, et autres
Publié: (2026)
par: Zhu, Ruiyang, et autres
Publié: (2026)
Rerouting LLM Routers
par: Shafran, Avital, et autres
Publié: (2025)
par: Shafran, Avital, et autres
Publié: (2025)
The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
HSTFL: A Heterogeneous Federated Learning Framework for Misaligned Spatiotemporal Forecasting
par: Cai, Shuowei, et autres
Publié: (2024)
par: Cai, Shuowei, et autres
Publié: (2024)
SkillRouter: Skill Routing for LLM Agents at Scale
par: Zheng, YanZhao, et autres
Publié: (2026)
par: Zheng, YanZhao, et autres
Publié: (2026)
RouterBench: A Benchmark for Multi-LLM Routing System
par: Hu, Qitian Jason, et autres
Publié: (2024)
par: Hu, Qitian Jason, et autres
Publié: (2024)
Is Retraining-Free Enough? The Necessity of Router Calibration for Efficient MoE Compression
par: Hyeon, Sieun, et autres
Publié: (2026)
par: Hyeon, Sieun, et autres
Publié: (2026)
Eigenvectors of Experts are Training-free Non-collapsing Routers
par: Do, Giang, et autres
Publié: (2026)
par: Do, Giang, et autres
Publié: (2026)
GMTRouter: Personalized LLM Router over Multi-turn User Interactions
par: Xie, Encheng, et autres
Publié: (2025)
par: Xie, Encheng, et autres
Publié: (2025)
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
LLM Router: Rethinking Routing with Prefill Activations
par: Varshney, Tanay, et autres
Publié: (2026)
par: Varshney, Tanay, et autres
Publié: (2026)
Efficient Training-Free Online Routing for High-Volume Multi-LLM Serving
par: Wu, Fangzhou, et autres
Publié: (2025)
par: Wu, Fangzhou, et autres
Publié: (2025)
OrcaRouter: A Production-Oriented LLM Router with Hybrid Offline-Online Learning
par: Bao, Zhenghua, et autres
Publié: (2026)
par: Bao, Zhenghua, et autres
Publié: (2026)
The Efficiency Frontier: Classical Shadows versus Quantum Footage
par: Ma, Shuowei, et autres
Publié: (2025)
par: Ma, Shuowei, et autres
Publié: (2025)
Mol-MoE: Training Preference-Guided Routers for Molecule Generation
par: Calanzone, Diego, et autres
Publié: (2025)
par: Calanzone, Diego, et autres
Publié: (2025)
Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective
par: Zhang, Yuheng, et autres
Publié: (2026)
par: Zhang, Yuheng, et autres
Publié: (2026)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025)
par: Liu, Guangda, et autres
Publié: (2025)
Federate the Router: Learning Language Model Routers with Sparse and Decentralized Evaluations
par: Askin, Baris, et autres
Publié: (2026)
par: Askin, Baris, et autres
Publié: (2026)
FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
par: Huang, Haiduo, et autres
Publié: (2025)
par: Huang, Haiduo, et autres
Publié: (2025)
ICL-Router: In-Context Learned Model Representations for LLM Routing
par: Wang, Chenxu, et autres
Publié: (2025)
par: Wang, Chenxu, et autres
Publié: (2025)
Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start
par: Liu, Xueshen, et autres
Publié: (2026)
par: Liu, Xueshen, et autres
Publié: (2026)
MViewRouter: Internalizing Geometric Equivariance via Multi-view Alternating Attention for Combinatorial Routing
par: Liu, Shiyan, et autres
Publié: (2026)
par: Liu, Shiyan, et autres
Publié: (2026)
PersonalizedRouter: Personalized LLM Routing via Graph-based User Preference Modeling
par: Dai, Zhongjie, et autres
Publié: (2025)
par: Dai, Zhongjie, et autres
Publié: (2025)
RouteNator: A Router-Based Multi-Modal Architecture for Generating Synthetic Training Data for Function Calling LLMs
par: Belavadi, Vibha, et autres
Publié: (2025)
par: Belavadi, Vibha, et autres
Publié: (2025)
MasRouter: Learning to Route LLMs for Multi-Agent Systems
par: Yue, Yanwei, et autres
Publié: (2025)
par: Yue, Yanwei, et autres
Publié: (2025)
Graph Mixture of Experts and Memory-augmented Routers for Multivariate Time Series Anomaly Detection
par: Huang, Xiaoyu, et autres
Publié: (2024)
par: Huang, Xiaoyu, et autres
Publié: (2024)
Learn To be Efficient: Build Structured Sparsity in Large Language Models
par: Zheng, Haizhong, et autres
Publié: (2024)
par: Zheng, Haizhong, et autres
Publié: (2024)
Coupling Experts and Routers in Mixture-of-Experts via an Auxiliary Loss
par: Lv, Ang, et autres
Publié: (2025)
par: Lv, Ang, et autres
Publié: (2025)
ProxRouter: Proximity-Weighted LLM Query Routing for Improved Robustness to Outliers
par: Patel, Shivam, et autres
Publié: (2025)
par: Patel, Shivam, et autres
Publié: (2025)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
par: Tang, Hongyin, et autres
Publié: (2024)
par: Tang, Hongyin, et autres
Publié: (2024)
Documents similaires
-
Compute Or Load KV Cache? Why Not Both?
par: Jin, Shuowei, et autres
Publié: (2024) -
MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search
par: Cho, Minkyoung, et autres
Publié: (2026) -
TensorOpera Router: A Multi-Model Router for Efficient LLM Inference
par: Stripelis, Dimitris, et autres
Publié: (2024) -
HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs
par: Wu, Yongji, et autres
Publié: (2025) -
AutoSpec: Automated Generation of Neural Network Specifications
par: Jin, Shuowei, et autres
Publié: (2024)