Salvato in:
| Autori principali: | Bhatti, Amit Singh, Vaddina, Vishal, Birru, Dagnachew |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.19402 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ORPO-Distill: Mixed-Policy Preference Optimization for Cross-Architecture LLM Distillation
di: Singh, Aasheesh, et al.
Pubblicazione: (2025)
di: Singh, Aasheesh, et al.
Pubblicazione: (2025)
Responsible AI for General-Purpose Systems: Overview, Challenges, and A Path Forward
di: Patro, Gourab K, et al.
Pubblicazione: (2026)
di: Patro, Gourab K, et al.
Pubblicazione: (2026)
Surrogate-Guided Quantum Discovery in Black-Box Landscapes with Latent-Quadratic Interaction Embedding Transformers
di: Gopalakrishnan, Saisubramaniam, et al.
Pubblicazione: (2026)
di: Gopalakrishnan, Saisubramaniam, et al.
Pubblicazione: (2026)
A Multi-Objective Genetic Algorithm for Healthcare Workforce Scheduling
di: Patel, Vipul, et al.
Pubblicazione: (2025)
di: Patel, Vipul, et al.
Pubblicazione: (2025)
Knowledge Graph Based Repository-Level Code Generation
di: Athale, Mihir, et al.
Pubblicazione: (2025)
di: Athale, Mihir, et al.
Pubblicazione: (2025)
Search-Based Risk Feature Discovery in Document Structure Spaces under a Constrained Budget
di: Gopalakrishnan, Saisubramaniam, et al.
Pubblicazione: (2026)
di: Gopalakrishnan, Saisubramaniam, et al.
Pubblicazione: (2026)
Accelerated Gradient-based Design Optimization Via Differentiable Physics-Informed Neural Operator: A Composites Autoclave Processing Case Study
di: Patel, Janak M., et al.
Pubblicazione: (2025)
di: Patel, Janak M., et al.
Pubblicazione: (2025)
ACT: Bridging the Gap in Code Translation through Synthetic Data Generation & Adaptive Training
di: Saxena, Shreya, et al.
Pubblicazione: (2025)
di: Saxena, Shreya, et al.
Pubblicazione: (2025)
PickLLM: Context-Aware RL-Assisted Large Language Model Routing
di: Sikeridis, Dimitrios, et al.
Pubblicazione: (2024)
di: Sikeridis, Dimitrios, et al.
Pubblicazione: (2024)
Efficient Training-Free Online Routing for High-Volume Multi-LLM Serving
di: Wu, Fangzhou, et al.
Pubblicazione: (2025)
di: Wu, Fangzhou, et al.
Pubblicazione: (2025)
SLA-Aware Distributed LLM Inference Across Device-RAN-Cloud
di: Yet, Hariz, et al.
Pubblicazione: (2026)
di: Yet, Hariz, et al.
Pubblicazione: (2026)
HI-SQL: Optimizing Text-to-SQL Systems through Dynamic Hint Integration
di: Parab, Ganesh, et al.
Pubblicazione: (2025)
di: Parab, Ganesh, et al.
Pubblicazione: (2025)
LAPS: A Length-Aware-Prefill LLM Serving System
di: She, Jianshu, et al.
Pubblicazione: (2026)
di: She, Jianshu, et al.
Pubblicazione: (2026)
Orla: A Library for Serving LLM-Based Multi-Agent Systems
di: Shahout, Rana, et al.
Pubblicazione: (2026)
di: Shahout, Rana, et al.
Pubblicazione: (2026)
SLA2: Sparse-Linear Attention with Learnable Routing and QAT
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
TinyServe: Query-Aware Cache Selection for Efficient LLM Serving
di: Liu, Dong, et al.
Pubblicazione: (2025)
di: Liu, Dong, et al.
Pubblicazione: (2025)
GAR: Carbon-Aware Routing for LLM Inference via Constrained Optimization
di: Sheshanarayana, Disha, et al.
Pubblicazione: (2026)
di: Sheshanarayana, Disha, et al.
Pubblicazione: (2026)
SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning
di: Xu, Zhongling, et al.
Pubblicazione: (2026)
di: Xu, Zhongling, et al.
Pubblicazione: (2026)
POLAR: Online Learning for LoRA Adapter Caching and Routing in Edge LLM Serving
di: Li, Shaoang, et al.
Pubblicazione: (2026)
di: Li, Shaoang, et al.
Pubblicazione: (2026)
StreamServe: Adaptive Speculative Flows for Low-Latency Disaggregated LLM Serving
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
Efficient Mixture-of-Agents Serving via Tree-Structured Routing, Adaptive Pruning, and Dependency-Aware Prefill-Decode Overlap
di: Wang, Zijun, et al.
Pubblicazione: (2025)
di: Wang, Zijun, et al.
Pubblicazione: (2025)
LLM-Guided Lifecycle-Aware Clustering of Multi-Turn Customer Support Conversations
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026)
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
di: Cao, Shiyi, et al.
Pubblicazione: (2025)
di: Cao, Shiyi, et al.
Pubblicazione: (2025)
Constraint-Aware Route Recommendation from Natural Language via Hierarchical LLM Agents
di: Zhe, Tao, et al.
Pubblicazione: (2025)
di: Zhe, Tao, et al.
Pubblicazione: (2025)
SOMA: Efficient Multi-turn LLM Serving via Small Language Model
di: Cheng, Xueqi, et al.
Pubblicazione: (2026)
di: Cheng, Xueqi, et al.
Pubblicazione: (2026)
SpecMap: Hierarchical LLM Agent for Datasheet-to-Code Traceability Link Recovery in Systems Engineering
di: Nipane, Vedant, et al.
Pubblicazione: (2026)
di: Nipane, Vedant, et al.
Pubblicazione: (2026)
RouterBench: A Benchmark for Multi-LLM Routing System
di: Hu, Qitian Jason, et al.
Pubblicazione: (2024)
di: Hu, Qitian Jason, et al.
Pubblicazione: (2024)
RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
Towards Socially and Morally Aware RL agent: Reward Design With LLM
di: Wang, Zhaoyue
Pubblicazione: (2024)
di: Wang, Zhaoyue
Pubblicazione: (2024)
Cooperative Multi-agent RL with Communication Constraints
di: Xiong, Nuoya, et al.
Pubblicazione: (2026)
di: Xiong, Nuoya, et al.
Pubblicazione: (2026)
Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts
di: Garg, Saloni, et al.
Pubblicazione: (2026)
di: Garg, Saloni, et al.
Pubblicazione: (2026)
VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?
di: Kamahori, Keisuke, et al.
Pubblicazione: (2026)
di: Kamahori, Keisuke, et al.
Pubblicazione: (2026)
MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings
di: Zhang, Yiqun, et al.
Pubblicazione: (2026)
di: Zhang, Yiqun, et al.
Pubblicazione: (2026)
Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization
di: Wang, Xudong, et al.
Pubblicazione: (2026)
di: Wang, Xudong, et al.
Pubblicazione: (2026)
Chatsparent: An Interactive System for Detecting and Mitigating Cognitive Fatigue in LLMs
di: Marwah, Riju, et al.
Pubblicazione: (2025)
di: Marwah, Riju, et al.
Pubblicazione: (2025)
PALS: Power-Aware LLM Serving for Mixture-of-Experts Models
di: Hankendi, Can, et al.
Pubblicazione: (2026)
di: Hankendi, Can, et al.
Pubblicazione: (2026)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
di: Zhang, Hao, et al.
Pubblicazione: (2026)
di: Zhang, Hao, et al.
Pubblicazione: (2026)
LoopServe: An Adaptive Dual-phase LLM Inference Acceleration System for Multi-Turn Dialogues
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
VoltanaLLM: Feedback-Driven Frequency Control and State-Space Routing for Energy-Efficient LLM Serving
di: Yu, Jiahuan, et al.
Pubblicazione: (2025)
di: Yu, Jiahuan, et al.
Pubblicazione: (2025)
IRT-Router: Effective and Interpretable Multi-LLM Routing via Item Response Theory
di: Song, Wei, et al.
Pubblicazione: (2025)
di: Song, Wei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ORPO-Distill: Mixed-Policy Preference Optimization for Cross-Architecture LLM Distillation
di: Singh, Aasheesh, et al.
Pubblicazione: (2025) -
Responsible AI for General-Purpose Systems: Overview, Challenges, and A Path Forward
di: Patro, Gourab K, et al.
Pubblicazione: (2026) -
Surrogate-Guided Quantum Discovery in Black-Box Landscapes with Latent-Quadratic Interaction Embedding Transformers
di: Gopalakrishnan, Saisubramaniam, et al.
Pubblicazione: (2026) -
A Multi-Objective Genetic Algorithm for Healthcare Workforce Scheduling
di: Patel, Vipul, et al.
Pubblicazione: (2025) -
Knowledge Graph Based Repository-Level Code Generation
di: Athale, Mihir, et al.
Pubblicazione: (2025)