Adaptive Computation Depth via Learned Token Routing in Transformers
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Mohammed, Ahmed Abdelmuniem Abdalla |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing
par: Filippova, Anastasiia, et autres
Publié: (2026)
par: Filippova, Anastasiia, et autres
Publié: (2026)
How Transformers Learn to Plan via Multi-Token Prediction
par: Huang, Jianhao, et autres
Publié: (2026)
par: Huang, Jianhao, et autres
Publié: (2026)
Learning to Route LLMs with Confidence Tokens
par: Chuang, Yu-Neng, et autres
Publié: (2024)
par: Chuang, Yu-Neng, et autres
Publié: (2024)
Learning to Route: Per-Sample Adaptive Routing for Multimodal Multitask Prediction
par: Ajirak, Marzieh, et autres
Publié: (2025)
par: Ajirak, Marzieh, et autres
Publié: (2025)
TARo: Token-level Adaptive Routing for LLM Test-time Alignment
par: Rai, Arushi, et autres
Publié: (2026)
par: Rai, Arushi, et autres
Publié: (2026)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
par: Wang, Jiaxuan, et autres
Publié: (2026)
par: Wang, Jiaxuan, et autres
Publié: (2026)
Global-Lens Transformers: Adaptive Token Mixing for Dynamic Link Prediction
par: Zou, Tao, et autres
Publié: (2025)
par: Zou, Tao, et autres
Publié: (2025)
Token-Level LLM Collaboration via FusionRoute
par: Xiong, Nuoya, et autres
Publié: (2026)
par: Xiong, Nuoya, et autres
Publié: (2026)
CADENCE: Context-Adaptive Depth Estimation for Navigation and Computational Efficiency
par: Johnsen, Timothy K, et autres
Publié: (2026)
par: Johnsen, Timothy K, et autres
Publié: (2026)
Directional Routing in Transformers
par: Taylor, Kevin
Publié: (2026)
par: Taylor, Kevin
Publié: (2026)
BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute
par: Ding, Dujian, et autres
Publié: (2025)
par: Ding, Dujian, et autres
Publié: (2025)
Route Experts by Sequence, not by Token
par: Wen, Tiansheng, et autres
Publié: (2025)
par: Wen, Tiansheng, et autres
Publié: (2025)
An Adaptive Simulated Annealing-Based Machine Learning Approach for Developing an E-Triage Tool for Hospital Emergency Operations
par: Ahmed, Abdulaziz, et autres
Publié: (2022)
par: Ahmed, Abdulaziz, et autres
Publié: (2022)
Probing the Embedding Space of Transformers via Minimal Token Perturbations
par: Conti, Eddie, et autres
Publié: (2025)
par: Conti, Eddie, et autres
Publié: (2025)
Cross-Domain Few-Shot Learning via Adaptive Transformer Networks
par: Paeedeh, Naeem, et autres
Publié: (2024)
par: Paeedeh, Naeem, et autres
Publié: (2024)
VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing
par: Wang, Yixiao, et autres
Publié: (2025)
par: Wang, Yixiao, et autres
Publié: (2025)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
par: Wieser, Frederico, et autres
Publié: (2025)
par: Wieser, Frederico, et autres
Publié: (2025)
Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
par: Zhang, Zeyu, et autres
Publié: (2026)
par: Zhang, Zeyu, et autres
Publié: (2026)
Geometric Mixture-of-Experts with Curvature-Guided Adaptive Routing for Graph Representation Learning
par: Cao, Haifang, et autres
Publié: (2026)
par: Cao, Haifang, et autres
Publié: (2026)
Depth-Adaptive Graph Neural Networks via Learnable Bakry-'Emery Curvature
par: Hevapathige, Asela, et autres
Publié: (2025)
par: Hevapathige, Asela, et autres
Publié: (2025)
Token-Level Prompt Mixture with Parameter-Free Routing for Federated Domain Generalization
par: Gong, Shuai, et autres
Publié: (2025)
par: Gong, Shuai, et autres
Publié: (2025)
SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning
par: Xu, Zhongling, et autres
Publié: (2026)
par: Xu, Zhongling, et autres
Publié: (2026)
Adaptive Computation Pruning for the Forgetting Transformer
par: Lin, Zhixuan, et autres
Publié: (2025)
par: Lin, Zhixuan, et autres
Publié: (2025)
Efficient Real-Time Aircraft ETA Prediction via Feature Tokenization Transformer
par: Huang, Liping, et autres
Publié: (2025)
par: Huang, Liping, et autres
Publié: (2025)
SliceMoE: Routing Embedding Slices Instead of Tokens for Fine-Grained and Balanced Transformer Scaling
par: Vejendla, Harshil
Publié: (2025)
par: Vejendla, Harshil
Publié: (2025)
MedFormer-UR: Uncertainty-Routed Transformer for Medical Image Classification
par: Sibhai, Mohammed Maaz, et autres
Publié: (2026)
par: Sibhai, Mohammed Maaz, et autres
Publié: (2026)
Graph Tokenization for Bridging Graphs and Transformers
par: Guo, Zeyuan, et autres
Publié: (2026)
par: Guo, Zeyuan, et autres
Publié: (2026)
Adaptive Token-Weighted Differential Privacy for LLMs: Not All Tokens Require Equal Protection
par: Yu, Manjiang, et autres
Publié: (2025)
par: Yu, Manjiang, et autres
Publié: (2025)
Adaptive Information Routing for Multimodal Time Series Forecasting
par: Seo, Jun, et autres
Publié: (2025)
par: Seo, Jun, et autres
Publié: (2025)
SkillOrchestra: Learning to Route Agents via Skill Transfer
par: Wang, Jiayu, et autres
Publié: (2026)
par: Wang, Jiayu, et autres
Publié: (2026)
Enhancing Cross-Problem Vehicle Routing via Federated Learning
par: Meng, Xiangchi, et autres
Publié: (2026)
par: Meng, Xiangchi, et autres
Publié: (2026)
PR-CapsNet: Pseudo-Riemannian Capsule Network with Adaptive Curvature Routing for Graph Learning
par: Qin, Ye, et autres
Publié: (2025)
par: Qin, Ye, et autres
Publié: (2025)
Enhanced Graph Transformer with Serialized Graph Tokens
par: Wang, Ruixiang, et autres
Publié: (2026)
par: Wang, Ruixiang, et autres
Publié: (2026)
Rethinking Tokenized Graph Transformers for Node Classification
par: Chen, Jinsong, et autres
Publié: (2025)
par: Chen, Jinsong, et autres
Publié: (2025)
RouteFormer: A Transformer-Based Routing Framework for Autonomous Vehicles
par: Youssef, Yazan, et autres
Publié: (2025)
par: Youssef, Yazan, et autres
Publié: (2025)
SaDiT: Efficient Protein Backbone Design via Latent Structural Tokenization and Diffusion Transformers
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
ARROW: An Adaptive Rollout and Routing Method for Global Weather Forecasting
par: Tian, Jindong, et autres
Publié: (2025)
par: Tian, Jindong, et autres
Publié: (2025)
The Depth Delusion: Why Transformers Should Be Wider, Not Deeper
par: Fahim, Md Muhtasim Munif, et autres
Publié: (2026)
par: Fahim, Md Muhtasim Munif, et autres
Publié: (2026)
Adaptive Online Learning with LSTM Networks for Energy Price Prediction
par: Salihoglu, Salih, et autres
Publié: (2025)
par: Salihoglu, Salih, et autres
Publié: (2025)
ANCRe: Adaptive Neural Connection Reassignment for Efficient Depth Scaling
par: Zhang, Yilang, et autres
Publié: (2026)
par: Zhang, Yilang, et autres
Publié: (2026)
Documents similaires
-
Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing
par: Filippova, Anastasiia, et autres
Publié: (2026) -
How Transformers Learn to Plan via Multi-Token Prediction
par: Huang, Jianhao, et autres
Publié: (2026) -
Learning to Route LLMs with Confidence Tokens
par: Chuang, Yu-Neng, et autres
Publié: (2024) -
Learning to Route: Per-Sample Adaptive Routing for Multimodal Multitask Prediction
par: Ajirak, Marzieh, et autres
Publié: (2025) -
TARo: Token-level Adaptive Routing for LLM Test-time Alignment
par: Rai, Arushi, et autres
Publié: (2026)