Dynamic Mixed-Precision Routing for Efficient Multi-step LLM Interaction
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yuanzhe, Deng, Jianing, Hu, Jingtong, Chen, Tianlong, Wang, Song, Yang, Huanrui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
por: Deng, Jianing, et al.
Publicado: (2026)
por: Deng, Jianing, et al.
Publicado: (2026)
FIER: Fine-Grained and Efficient KV Cache Retrieval for Long-context LLM Inference
por: Wang, Dongwei, et al.
Publicado: (2025)
por: Wang, Dongwei, et al.
Publicado: (2025)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
por: Hu, Yuanzhe, et al.
Publicado: (2025)
por: Hu, Yuanzhe, et al.
Publicado: (2025)
Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
por: Hu, Tianyu, et al.
Publicado: (2025)
por: Hu, Tianyu, et al.
Publicado: (2025)
Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization
por: Wang, Dongwei, et al.
Publicado: (2024)
por: Wang, Dongwei, et al.
Publicado: (2024)
DLF: Disentangled-Language-Focused Multimodal Sentiment Analysis
por: Wang, Pan, et al.
Publicado: (2024)
por: Wang, Pan, et al.
Publicado: (2024)
MixLLM: Dynamic Routing in Mixed Large Language Models
por: Wang, Xinyuan, et al.
Publicado: (2025)
por: Wang, Xinyuan, et al.
Publicado: (2025)
Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization
por: Wang, Xudong, et al.
Publicado: (2026)
por: Wang, Xudong, et al.
Publicado: (2026)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
por: Xu, Haoning, et al.
Publicado: (2025)
por: Xu, Haoning, et al.
Publicado: (2025)
RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents
por: Wang, Jize, et al.
Publicado: (2026)
por: Wang, Jize, et al.
Publicado: (2026)
Efficient Dynamic Ensembling for Multiple LLM Experts
por: Hu, Jinwu, et al.
Publicado: (2024)
por: Hu, Jinwu, et al.
Publicado: (2024)
AnyMAC: Cascading Flexible Multi-Agent Collaboration via Next-Agent Prediction
por: Wang, Song, et al.
Publicado: (2025)
por: Wang, Song, et al.
Publicado: (2025)
MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning
por: Zhang, Yutong, et al.
Publicado: (2026)
por: Zhang, Yutong, et al.
Publicado: (2026)
RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference
por: Gautam, Arpit Singh, et al.
Publicado: (2026)
por: Gautam, Arpit Singh, et al.
Publicado: (2026)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
por: Wang, Dongwei, et al.
Publicado: (2026)
por: Wang, Dongwei, et al.
Publicado: (2026)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
por: Zhang, Linghua, et al.
Publicado: (2026)
por: Zhang, Linghua, et al.
Publicado: (2026)
From Sparsity to Simplicity: Enabling Simpler Sequential Replacements via Sparse Attention Distillation
por: Ren, Yuxin, et al.
Publicado: (2026)
por: Ren, Yuxin, et al.
Publicado: (2026)
Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration
por: Yun, Sukwon, et al.
Publicado: (2026)
por: Yun, Sukwon, et al.
Publicado: (2026)
MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings
por: Zhang, Yiqun, et al.
Publicado: (2026)
por: Zhang, Yiqun, et al.
Publicado: (2026)
Bypassing the Exponential Dependency: Looped Transformers Efficiently Learn In-context by Multi-step Gradient Descent
por: Chen, Bo, et al.
Publicado: (2024)
por: Chen, Bo, et al.
Publicado: (2024)
OxyGent: Making Multi-Agent Systems Modular, Observable, and Evolvable via Oxy Abstraction
por: Hu, Junxing, et al.
Publicado: (2026)
por: Hu, Junxing, et al.
Publicado: (2026)
LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing
por: Li, Hao, et al.
Publicado: (2026)
por: Li, Hao, et al.
Publicado: (2026)
D$^{2}$MoE: Dual Routing and Dynamic Scheduling for Efficient On-Device MoE-based LLM Serving
por: Wang, Haodong, et al.
Publicado: (2025)
por: Wang, Haodong, et al.
Publicado: (2025)
Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy
por: Li, Pingzhi, et al.
Publicado: (2023)
por: Li, Pingzhi, et al.
Publicado: (2023)
IRT-Router: Effective and Interpretable Multi-LLM Routing via Item Response Theory
por: Song, Wei, et al.
Publicado: (2025)
por: Song, Wei, et al.
Publicado: (2025)
SARHAchat: An LLM-Based Chatbot for Sexual and Reproductive Health Counseling
por: Yang, Jiaye, et al.
Publicado: (2025)
por: Yang, Jiaye, et al.
Publicado: (2025)
RouterBench: A Benchmark for Multi-LLM Routing System
por: Hu, Qitian Jason, et al.
Publicado: (2024)
por: Hu, Qitian Jason, et al.
Publicado: (2024)
Beyond Redundancy: Diverse and Specialized Multi-Expert Sparse Autoencoder
por: Xu, Zhen, et al.
Publicado: (2025)
por: Xu, Zhen, et al.
Publicado: (2025)
D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training
por: Xu, Yuanjian, et al.
Publicado: (2026)
por: Xu, Yuanjian, et al.
Publicado: (2026)
Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement
por: Zhang, Yunjian, et al.
Publicado: (2026)
por: Zhang, Yunjian, et al.
Publicado: (2026)
SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
por: Shen, Yuanzhe, et al.
Publicado: (2025)
por: Shen, Yuanzhe, et al.
Publicado: (2025)
Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning
por: Wang, Chaojie, et al.
Publicado: (2024)
por: Wang, Chaojie, et al.
Publicado: (2024)
Orchestrating Intelligence: Confidence-Aware Routing for Efficient Multi-Agent Collaboration across Multi-Scale Models
por: Wang, Jingbo, et al.
Publicado: (2026)
por: Wang, Jingbo, et al.
Publicado: (2026)
ICL-Router: In-Context Learned Model Representations for LLM Routing
por: Wang, Chenxu, et al.
Publicado: (2025)
por: Wang, Chenxu, et al.
Publicado: (2025)
RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory
por: Liu, Jun, et al.
Publicado: (2025)
por: Liu, Jun, et al.
Publicado: (2025)
DPRF: A Generalizable Dynamic Persona Refinement Framework for Optimizing Behavior Alignment Between Personalized LLM Role-Playing Agents and Humans
por: Yao, Bingsheng, et al.
Publicado: (2025)
por: Yao, Bingsheng, et al.
Publicado: (2025)
AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions
por: Chen, Minghao, et al.
Publicado: (2026)
por: Chen, Minghao, et al.
Publicado: (2026)
PAHQ: Accelerating Automated Circuit Discovery through Mixed-Precision Inference Optimization
por: Wang, Xinhai, et al.
Publicado: (2025)
por: Wang, Xinhai, et al.
Publicado: (2025)
CPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning Tasks
por: Wang, Tianlong, et al.
Publicado: (2024)
por: Wang, Tianlong, et al.
Publicado: (2024)
DyTopo: Dynamic Topology Routing for Multi-Agent Reasoning via Semantic Matching
por: Lu, Yuxing, et al.
Publicado: (2026)
por: Lu, Yuxing, et al.
Publicado: (2026)
Ejemplares similares
-
GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
por: Deng, Jianing, et al.
Publicado: (2026) -
FIER: Fine-Grained and Efficient KV Cache Retrieval for Long-context LLM Inference
por: Wang, Dongwei, et al.
Publicado: (2025) -
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
por: Hu, Yuanzhe, et al.
Publicado: (2025) -
Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
por: Hu, Tianyu, et al.
Publicado: (2025) -
Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization
por: Wang, Dongwei, et al.
Publicado: (2024)