From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Huamin, Liu, Xunzhuo, He, Bowei, Liu, Xue |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Conflict-Free Policy Languages for Probabilistic ML Predicates: A Framework and Case Study with the Semantic Router DSL
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
FleetOpt: Analytical Fleet Provisioning for LLM Inference with Compress-and-Route as Implementation Mechanism
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Adaptive Vision-Language Model Routing for Computer Use Agents
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
The 1/W Law: An Analytical Study of Context-Length Routing Topology and GPU Generation Gains for LLM Inference Energy Efficiency
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
inference-fleet-sim: A Queueing-Theory-Grounded Fleet Capacity Planner for LLM Inference
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
98$\times$ Faster LLM Routing Without a Dedicated GPU: Flash Attention, Prompt Compression, and Near-Streaming for the vLLM Semantic Router
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Category-Aware Semantic Caching for Heterogeneous LLM Workloads
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Distributionally Robust Set Representation Learning Under Inference-Time Element Corruption
par: Chen, Yankai, et autres
Publié: (2026)
par: Chen, Yankai, et autres
Publié: (2026)
Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR
par: Min, Zijun, et autres
Publié: (2026)
par: Min, Zijun, et autres
Publié: (2026)
From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents
par: Wang, Yuan, et autres
Publié: (2025)
par: Wang, Yuan, et autres
Publié: (2025)
RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
par: Guan, Weifan, et autres
Publié: (2025)
par: Guan, Weifan, et autres
Publié: (2025)
Multi-Agent Reinforcement Learning for Adaptive Resource Orchestration in Cloud-Native Clusters
par: Yao, Guanzi, et autres
Publié: (2025)
par: Yao, Guanzi, et autres
Publié: (2025)
InferF: Declarative Factorization of AI/ML Inferences over Joins
par: Chowdhury, Kanchan, et autres
Publié: (2025)
par: Chowdhury, Kanchan, et autres
Publié: (2025)
DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies
par: Yang, Ning, et autres
Publié: (2025)
par: Yang, Ning, et autres
Publié: (2025)
From Solo to Symphony: Orchestrating Multi-Agent Collaboration with Single-Agent Demos
par: Wang, Xun, et autres
Publié: (2025)
par: Wang, Xun, et autres
Publié: (2025)
Group-in-Group Policy Optimization for LLM Agent Training
par: Feng, Lang, et autres
Publié: (2025)
par: Feng, Lang, et autres
Publié: (2025)
Learning to Orchestrate Agents under Uncertainty
par: Oliver, Mary Chriselda Antony, et autres
Publié: (2026)
par: Oliver, Mary Chriselda Antony, et autres
Publié: (2026)
Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning
par: Liu, Weidong, et autres
Publié: (2023)
par: Liu, Weidong, et autres
Publié: (2023)
Statistical Inference for Responsiveness Verification
par: Cheon, Seung Hyun, et autres
Publié: (2025)
par: Cheon, Seung Hyun, et autres
Publié: (2025)
Offline Imitation Learning with Variational Counterfactual Reasoning
par: He, Bowei, et autres
Publié: (2023)
par: He, Bowei, et autres
Publié: (2023)
Support-Proximity Augmented Diffusion Estimation for Offline Black-Box Optimization
par: Yang, Yonghan, et autres
Publié: (2026)
par: Yang, Yonghan, et autres
Publié: (2026)
IterIS: Iterative Inference-Solving Alignment for LoRA Merging
par: Chen, Hongxu, et autres
Publié: (2024)
par: Chen, Hongxu, et autres
Publié: (2024)
Learning to Orchestrate Agents in Natural Language with the Conductor
par: Nielsen, Stefan, et autres
Publié: (2025)
par: Nielsen, Stefan, et autres
Publié: (2025)
Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading
par: Li, Jifeng, et autres
Publié: (2025)
par: Li, Jifeng, et autres
Publié: (2025)
HLL: Can Agents Cross Humanity's Last Line of Verification?
par: Song, Xinhao, et autres
Publié: (2026)
par: Song, Xinhao, et autres
Publié: (2026)
Towards Sharper Risk Bounds for Minimax Problems
par: Zhu, Bowei, et autres
Publié: (2024)
par: Zhu, Bowei, et autres
Publié: (2024)
A Multi-Agent, Policy-Gradient approach to Network Routing
par: Tao, Nigel, et autres
Publié: (2025)
par: Tao, Nigel, et autres
Publié: (2025)
Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents
par: He, Pengfei, et autres
Publié: (2026)
par: He, Pengfei, et autres
Publié: (2026)
LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers
par: Yu, Enda, et autres
Publié: (2025)
par: Yu, Enda, et autres
Publié: (2025)
AutoBencher: Towards Declarative Benchmark Construction
par: Li, Xiang Lisa, et autres
Publié: (2024)
par: Li, Xiang Lisa, et autres
Publié: (2024)
Dynamic Quality-Latency Aware Routing for LLM Inference in Wireless Edge-Device Networks
par: Bao, Rui, et autres
Publié: (2025)
par: Bao, Rui, et autres
Publié: (2025)
Towards Generalizable Neural Solvers for Vehicle Routing Problems via Ensemble with Transferrable Local Policy
par: Gao, Chengrui, et autres
Publié: (2023)
par: Gao, Chengrui, et autres
Publié: (2023)
Online Matching via Reinforcement Learning: An Expert Policy Orchestration Strategy
par: Mignacco, Chiara, et autres
Publié: (2025)
par: Mignacco, Chiara, et autres
Publié: (2025)
Documents similaires
-
Conflict-Free Policy Languages for Probabilistic ML Predicates: A Framework and Case Study with the Semantic Router DSL
par: Liu, Xunzhuo, et autres
Publié: (2026) -
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
par: Chen, Huamin, et autres
Publié: (2026) -
Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference
par: Chen, Huamin, et autres
Publié: (2026) -
The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project
par: Chen, Huamin, et autres
Publié: (2026) -
FleetOpt: Analytical Fleet Provisioning for LLM Inference with Compress-and-Route as Implementation Mechanism
par: Chen, Huamin, et autres
Publié: (2026)