Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xunzhuo, He, Bowei, Liu, Xue, Luo, Andy, Zhang, Haichen, Chen, Huamin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Vision-Language Model Routing for Computer Use Agents
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
98$\times$ Faster LLM Routing Without a Dedicated GPU: Flash Attention, Prompt Compression, and Near-Streaming for the vLLM Semantic Router
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
FleetOpt: Analytical Fleet Provisioning for LLM Inference with Compress-and-Route as Implementation Mechanism
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
The 1/W Law: An Analytical Study of Context-Length Routing Topology and GPU Generation Gains for LLM Inference Energy Efficiency
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
inference-fleet-sim: A Queueing-Theory-Grounded Fleet Capacity Planner for LLM Inference
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Conflict-Free Policy Languages for Probabilistic ML Predicates: A Framework and Case Study with the Semantic Router DSL
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation
par: He, Bowei, et autres
Publié: (2026)
par: He, Bowei, et autres
Publié: (2026)
Beyond One-Size-Fits-All Pruning via Evolutionary Metric Search for Large Language Models
par: Liu, Shuqi, et autres
Publié: (2025)
par: Liu, Shuqi, et autres
Publié: (2025)
The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Reasoning in Action: MCTS-Driven Knowledge Retrieval for Large Language Models
par: Liu, Shuqi, et autres
Publié: (2025)
par: Liu, Shuqi, et autres
Publié: (2025)
When to Reason: Semantic Router for vLLM
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs
par: Feng, Tao, et autres
Publié: (2026)
par: Feng, Tao, et autres
Publié: (2026)
Guardrails Beat Guidance: A Large-Scale Study of Rules, Skills, and Persistent Configuration for Coding Agents
par: Zhang, Xing, et autres
Publié: (2026)
par: Zhang, Xing, et autres
Publié: (2026)
RAGRouter: Learning to Route Queries to Multiple Retrieval-Augmented Language Models
par: Zhang, Jiarui, et autres
Publié: (2025)
par: Zhang, Jiarui, et autres
Publié: (2025)
Scaling Mobile Agent Systems: From Capability Density to Collective Intelligence
par: He, Bowei
Publié: (2026)
par: He, Bowei
Publié: (2026)
MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning
par: Tan, Xingyu, et autres
Publié: (2025)
par: Tan, Xingyu, et autres
Publié: (2025)
What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA
par: He, Xinjie, et autres
Publié: (2026)
par: He, Xinjie, et autres
Publié: (2026)
Enhancing Large Language Models (LLMs) for Telecommunications using Knowledge Graphs and Retrieval-Augmented Generation
par: Yuan, Dun, et autres
Publié: (2025)
par: Yuan, Dun, et autres
Publié: (2025)
Bi-Chainer: Automated Large Language Models Reasoning with Bidirectional Chaining
par: Liu, Shuqi, et autres
Publié: (2024)
par: Liu, Shuqi, et autres
Publié: (2024)
Memory in the Age of AI Agents
par: Hu, Yuyang, et autres
Publié: (2025)
par: Hu, Yuyang, et autres
Publié: (2025)
Awakening Augmented Generation: Learning to Awaken Internal Knowledge of Large Language Models for Question Answering
par: Liao, Huanxuan, et autres
Publié: (2024)
par: Liao, Huanxuan, et autres
Publié: (2024)
Lifelong Knowledge Editing for LLMs with Retrieval-Augmented Continuous Prompt Learning
par: Chen, Qizhou, et autres
Publié: (2024)
par: Chen, Qizhou, et autres
Publié: (2024)
MemLong: Memory-Augmented Retrieval for Long Text Modeling
par: Liu, Weijie, et autres
Publié: (2024)
par: Liu, Weijie, et autres
Publié: (2024)
MemInsight: Autonomous Memory Augmentation for LLM Agents
par: Salama, Rana, et autres
Publié: (2025)
par: Salama, Rana, et autres
Publié: (2025)
Interweaving Memories of a Siamese Large Language Model
par: Song, Xin, et autres
Publié: (2024)
par: Song, Xin, et autres
Publié: (2024)
Memory-Augmented Agent Training for Business Document Understanding
par: Liu, Jiale, et autres
Publié: (2024)
par: Liu, Jiale, et autres
Publié: (2024)
Baba Is AI: Break the Rules to Beat the Benchmark
par: Cloos, Nathan, et autres
Publié: (2024)
par: Cloos, Nathan, et autres
Publié: (2024)
Semantic XPath: Structured Agentic Memory Access for Conversational AI
par: Liu, Yifan Simon, et autres
Publié: (2026)
par: Liu, Yifan Simon, et autres
Publié: (2026)
AgentsCourt: Building Judicial Decision-Making Agents with Court Debate Simulation and Legal Knowledge Augmentation
par: He, Zhitao, et autres
Publié: (2024)
par: He, Zhitao, et autres
Publié: (2024)
Routing Absorption in Sparse Attention: Why Random Gates Are Hard to Beat
par: Aquino-Michaels, Keston
Publié: (2026)
par: Aquino-Michaels, Keston
Publié: (2026)
ClinicalBench: Can LLMs Beat Traditional ML Models in Clinical Prediction?
par: Chen, Canyu, et autres
Publié: (2024)
par: Chen, Canyu, et autres
Publié: (2024)
Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation
par: Bai, Haoyue, et autres
Publié: (2025)
par: Bai, Haoyue, et autres
Publié: (2025)
Knowledge-Augmented Large Language Model Agents for Explainable Financial Decision-Making
par: Zhang, Qingyuan, et autres
Publié: (2025)
par: Zhang, Qingyuan, et autres
Publié: (2025)
Let the Agent Search: Autonomous Exploration Beats Rigid Workflows in Temporal Question Answering
par: Lv, Xufei, et autres
Publié: (2026)
par: Lv, Xufei, et autres
Publié: (2026)
Documents similaires
-
Adaptive Vision-Language Model Routing for Computer Use Agents
par: Liu, Xunzhuo, et autres
Publié: (2026) -
Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving
par: Liu, Xunzhuo, et autres
Publié: (2026) -
98$\times$ Faster LLM Routing Without a Dedicated GPU: Flash Attention, Prompt Compression, and Near-Streaming for the vLLM Semantic Router
par: Liu, Xunzhuo, et autres
Publié: (2026) -
Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents
par: Liu, Xunzhuo, et autres
Publié: (2026) -
Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems
par: Liu, Xunzhuo, et autres
Publié: (2026)