GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zeng, Wenhao, Zhang, Xuteng, Shi, Yuling, Hu, Chao, Chen, Yuting, Shen, Beijun, Gu, Xiaodong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
In Line with Context: Repository-Level Code Generation via Context Inlining
von: Hu, Chao, et al.
Veröffentlicht: (2026)
von: Hu, Chao, et al.
Veröffentlicht: (2026)
Neuron-Guided Interpretation of Code LLMs: Where, Why, and How?
von: Yin, Zhe, et al.
Veröffentlicht: (2025)
von: Yin, Zhe, et al.
Veröffentlicht: (2025)
Just-In-Time Software Defect Prediction via Bi-modal Change Representation Learning
von: Jiang, Yuze, et al.
Veröffentlicht: (2024)
von: Jiang, Yuze, et al.
Veröffentlicht: (2024)
Empowering AI to Generate Better AI Code: Guided Generation of Deep Learning Projects with LLMs
von: Xie, Chen, et al.
Veröffentlicht: (2025)
von: Xie, Chen, et al.
Veröffentlicht: (2025)
Transplant Then Regenerate: A New Paradigm for Text Data Augmentation
von: Wang, Guangzhan, et al.
Veröffentlicht: (2025)
von: Wang, Guangzhan, et al.
Veröffentlicht: (2025)
Anti-adversarial Learning: Desensitizing Prompts for Large Language Models
von: Li, Xuan, et al.
Veröffentlicht: (2025)
von: Li, Xuan, et al.
Veröffentlicht: (2025)
EvoC2Rust: A Skeleton-guided Framework for Project-Level C-to-Rust Translation
von: Wang, Chaofan, et al.
Veröffentlicht: (2025)
von: Wang, Chaofan, et al.
Veröffentlicht: (2025)
TCAndon-Router: Adaptive Reasoning Router for Multi-Agent Collaboration
von: Zhao, Jiuzhou, et al.
Veröffentlicht: (2026)
von: Zhao, Jiuzhou, et al.
Veröffentlicht: (2026)
Rethinking Code Complexity Through the Lens of Large Language Models
von: Xie, Chen, et al.
Veröffentlicht: (2026)
von: Xie, Chen, et al.
Veröffentlicht: (2026)
TensorOpera Router: A Multi-Model Router for Efficient LLM Inference
von: Stripelis, Dimitris, et al.
Veröffentlicht: (2024)
von: Stripelis, Dimitris, et al.
Veröffentlicht: (2024)
LightRouter: Towards Efficient LLM Collaboration with Minimal Overhead
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
SecureRouter: Encrypted Routing for Efficient Secure Inference
von: Zhang, Yukuan, et al.
Veröffentlicht: (2026)
von: Zhang, Yukuan, et al.
Veröffentlicht: (2026)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
AttentionRAG: Attention-Guided Context Pruning in Retrieval-Augmented Generation
von: Fang, Yixiong, et al.
Veröffentlicht: (2025)
von: Fang, Yixiong, et al.
Veröffentlicht: (2025)
GraphRouter: A Graph-based Router for LLM Selections
von: Feng, Tao, et al.
Veröffentlicht: (2024)
von: Feng, Tao, et al.
Veröffentlicht: (2024)
Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal
von: Zeng, Wenhao, et al.
Veröffentlicht: (2025)
von: Zeng, Wenhao, et al.
Veröffentlicht: (2025)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
von: Lin, Kuanwei, et al.
Veröffentlicht: (2026)
von: Lin, Kuanwei, et al.
Veröffentlicht: (2026)
Between Lines of Code: Unraveling the Distinct Patterns of Machine and Human Programmers
von: Shi, Yuling, et al.
Veröffentlicht: (2024)
von: Shi, Yuling, et al.
Veröffentlicht: (2024)
Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents
von: Chen, Zhi, et al.
Veröffentlicht: (2026)
von: Chen, Zhi, et al.
Veröffentlicht: (2026)
Diagnosing Memorization in Chain-of-Thought Reasoning, One Token at a Time
von: Li, Huihan, et al.
Veröffentlicht: (2025)
von: Li, Huihan, et al.
Veröffentlicht: (2025)
Reasoning with Autoregressive-Diffusion Collaborative Thoughts
von: Yuan, Mu, et al.
Veröffentlicht: (2026)
von: Yuan, Mu, et al.
Veröffentlicht: (2026)
LastingBench: Defend Benchmarks Against Knowledge Leakage
von: Fang, Yixiong, et al.
Veröffentlicht: (2025)
von: Fang, Yixiong, et al.
Veröffentlicht: (2025)
State of AI: An Empirical 100 Trillion Token Study with OpenRouter
von: Aubakirova, Malika, et al.
Veröffentlicht: (2026)
von: Aubakirova, Malika, et al.
Veröffentlicht: (2026)
Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems
von: Wu, Wanxing, et al.
Veröffentlicht: (2026)
von: Wu, Wanxing, et al.
Veröffentlicht: (2026)
LongCodeZip: Compress Long Context for Code Language Models
von: Shi, Yuling, et al.
Veröffentlicht: (2025)
von: Shi, Yuling, et al.
Veröffentlicht: (2025)
A*-Decoding: Token-Efficient Inference Scaling
von: Chatziveroglou, Giannis
Veröffentlicht: (2025)
von: Chatziveroglou, Giannis
Veröffentlicht: (2025)
Performance Characterization of Expert Router for Scalable LLM Inference
von: Pichlmeier, Josef, et al.
Veröffentlicht: (2024)
von: Pichlmeier, Josef, et al.
Veröffentlicht: (2024)
Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing
von: Wang, Miao, et al.
Veröffentlicht: (2026)
von: Wang, Miao, et al.
Veröffentlicht: (2026)
OrcaRouter: A Production-Oriented LLM Router with Hybrid Offline-Online Learning
von: Bao, Zhenghua, et al.
Veröffentlicht: (2026)
von: Bao, Zhenghua, et al.
Veröffentlicht: (2026)
Fed-SE: Federated Self-Evolution for Privacy-Constrained Multi-Environment LLM Agents
von: Chen, Xiang, et al.
Veröffentlicht: (2025)
von: Chen, Xiang, et al.
Veröffentlicht: (2025)
Mixture of Routers
von: Zhang, Jia-Chen, et al.
Veröffentlicht: (2025)
von: Zhang, Jia-Chen, et al.
Veröffentlicht: (2025)
From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging
von: Shi, Yuling, et al.
Veröffentlicht: (2024)
von: Shi, Yuling, et al.
Veröffentlicht: (2024)
Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference
von: Han, Chao, et al.
Veröffentlicht: (2025)
von: Han, Chao, et al.
Veröffentlicht: (2025)
Latent Action Reparameterization for Efficient Agent Inference
von: Huang, Wenhao, et al.
Veröffentlicht: (2026)
von: Huang, Wenhao, et al.
Veröffentlicht: (2026)
Lodestar: An Online-Learning LLM Inference Router
von: Lim, Gangmuk, et al.
Veröffentlicht: (2026)
von: Lim, Gangmuk, et al.
Veröffentlicht: (2026)
ExpertFlow: Efficient Mixture-of-Experts Inference via Predictive Expert Caching and Token Scheduling
von: He, Xin, et al.
Veröffentlicht: (2024)
von: He, Xin, et al.
Veröffentlicht: (2024)
ESTAR: Early-Stopping Token-Aware Reasoning For Efficient Inference
von: Wang, Junda, et al.
Veröffentlicht: (2026)
von: Wang, Junda, et al.
Veröffentlicht: (2026)
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
von: Chen, Huamin, et al.
Veröffentlicht: (2026)
von: Chen, Huamin, et al.
Veröffentlicht: (2026)
Test vs Mutant: Adversarial LLM Agents for Robust Unit Test Generation
von: Chang, Pengyu, et al.
Veröffentlicht: (2026)
von: Chang, Pengyu, et al.
Veröffentlicht: (2026)
OneLatent: Single-Token Compression for Visual Latent Reasoning
von: Lv, Bo, et al.
Veröffentlicht: (2026)
von: Lv, Bo, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
In Line with Context: Repository-Level Code Generation via Context Inlining
von: Hu, Chao, et al.
Veröffentlicht: (2026) -
Neuron-Guided Interpretation of Code LLMs: Where, Why, and How?
von: Yin, Zhe, et al.
Veröffentlicht: (2025) -
Just-In-Time Software Defect Prediction via Bi-modal Change Representation Learning
von: Jiang, Yuze, et al.
Veröffentlicht: (2024) -
Empowering AI to Generate Better AI Code: Guided Generation of Deep Learning Projects with LLMs
von: Xie, Chen, et al.
Veröffentlicht: (2025) -
Transplant Then Regenerate: A New Paradigm for Text Data Augmentation
von: Wang, Guangzhan, et al.
Veröffentlicht: (2025)