Enregistré dans:
| Auteur principal: | Ferrari, Alan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.28384 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference
par: Jaber, Jaber, et autres
Publié: (2026)
par: Jaber, Jaber, et autres
Publié: (2026)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
par: Jo, Dongwon, et autres
Publié: (2026)
par: Jo, Dongwon, et autres
Publié: (2026)
CAST: Clustering Self-Attention using Surrogate Tokens for Efficient Transformers
par: van Engelenhoven, Adjorn, et autres
Publié: (2024)
par: van Engelenhoven, Adjorn, et autres
Publié: (2024)
Learning to Route: Per-Sample Adaptive Routing for Multimodal Multitask Prediction
par: Ajirak, Marzieh, et autres
Publié: (2025)
par: Ajirak, Marzieh, et autres
Publié: (2025)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
par: Zheng, Wenhao, et autres
Publié: (2025)
par: Zheng, Wenhao, et autres
Publié: (2025)
VecFormer: Towards Efficient and Generalizable Graph Transformer with Graph Token Attention
par: Zhou, Jingbo, et autres
Publié: (2026)
par: Zhou, Jingbo, et autres
Publié: (2026)
Transformers Can Do Bayesian Inference
par: Müller, Samuel, et autres
Publié: (2021)
par: Müller, Samuel, et autres
Publié: (2021)
The Bayesian Geometry of Transformer Attention
par: Agarwal, Naman, et autres
Publié: (2025)
par: Agarwal, Naman, et autres
Publié: (2025)
Attention Once Is All You Need: Efficient Streaming Inference with Stateful Transformers
par: Norgren, Victor
Publié: (2026)
par: Norgren, Victor
Publié: (2026)
Adaptive Computation Depth via Learned Token Routing in Transformers
par: Mohammed, Ahmed Abdelmuniem Abdalla
Publié: (2026)
par: Mohammed, Ahmed Abdelmuniem Abdalla
Publié: (2026)
Token-Efficient RL for LLM Reasoning
par: Lee, Alan, et autres
Publié: (2025)
par: Lee, Alan, et autres
Publié: (2025)
Flow: Per-Instance Personalized Federated Learning Through Dynamic Routing
par: Panchal, Kunjal, et autres
Publié: (2022)
par: Panchal, Kunjal, et autres
Publié: (2022)
Transformers with Joint Tokens and Local-Global Attention for Efficient Human Pose Estimation
par: Kinfu, Kaleab A., et autres
Publié: (2025)
par: Kinfu, Kaleab A., et autres
Publié: (2025)
Universal Model Routing for Efficient LLM Inference
par: Jitkrittum, Wittawat, et autres
Publié: (2025)
par: Jitkrittum, Wittawat, et autres
Publié: (2025)
ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference
par: Zhang, Haoyue, et autres
Publié: (2025)
par: Zhang, Haoyue, et autres
Publié: (2025)
DTRNet: Dynamic Token Routing Network to Reduce Quadratic Costs in Transformers
par: Sharma, Aman, et autres
Publié: (2025)
par: Sharma, Aman, et autres
Publié: (2025)
KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
Can Transformers Learn Full Bayesian Inference in Context?
par: Reuter, Arik, et autres
Publié: (2025)
par: Reuter, Arik, et autres
Publié: (2025)
xPerT: Extended Persistence Transformer
par: Kim, Sehun
Publié: (2024)
par: Kim, Sehun
Publié: (2024)
Bayesian Inverse Problems Meet Flow Matching: Efficient and Flexible Inference via Transformers
par: Sherki, Daniil, et autres
Publié: (2025)
par: Sherki, Daniil, et autres
Publié: (2025)
Jetfire: Efficient and Accurate Transformer Pretraining with INT8 Data Flow and Per-Block Quantization
par: Xi, Haocheng, et autres
Publié: (2024)
par: Xi, Haocheng, et autres
Publié: (2024)
Conv-Basis: A New Paradigm for Efficient Attention Inference and Gradient Computation in Transformers
par: Liang, Yingyu, et autres
Publié: (2024)
par: Liang, Yingyu, et autres
Publié: (2024)
STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference
par: Guo, Yichen, et autres
Publié: (2025)
par: Guo, Yichen, et autres
Publié: (2025)
STS: Efficient Sparse Attention with Speculative Token Sparsity
par: Xu, Ceyu, et autres
Publié: (2026)
par: Xu, Ceyu, et autres
Publié: (2026)
Adaptive Semantic Token Communication for Transformer-based Edge Inference
par: Devoto, Alessio, et autres
Publié: (2025)
par: Devoto, Alessio, et autres
Publié: (2025)
Neural Bayesian Sequential Routing
par: Huang, Yongchao
Publié: (2026)
par: Huang, Yongchao
Publié: (2026)
In-Context Learning Is Provably Bayesian Inference: A Generalization Theory for Meta-Learning
par: Wakayama, Tomoya, et autres
Publié: (2025)
par: Wakayama, Tomoya, et autres
Publié: (2025)
Token Statistics Transformer: Linear-Time Attention via Variational Rate Reduction
par: Wu, Ziyang, et autres
Publié: (2024)
par: Wu, Ziyang, et autres
Publié: (2024)
Semiparametric Efficient Inference in Adaptive Experiments
par: Cook, Thomas, et autres
Publié: (2023)
par: Cook, Thomas, et autres
Publié: (2023)
IntAttention: A Fully Integer Attention Pipeline for Efficient Edge Inference
par: Zhong, Wanli, et autres
Publié: (2025)
par: Zhong, Wanli, et autres
Publié: (2025)
SparQ Attention: Bandwidth-Efficient LLM Inference
par: Ribar, Luka, et autres
Publié: (2023)
par: Ribar, Luka, et autres
Publié: (2023)
Learning to Explain: Supervised Token Attribution from Transformer Attention Patterns
par: Mihaila, George
Publié: (2026)
par: Mihaila, George
Publié: (2026)
Value-State Gated Attention for Mitigating Extreme-Token Phenomena in Transformers
par: Bu, Rui, et autres
Publié: (2025)
par: Bu, Rui, et autres
Publié: (2025)
Unsupervised Multi-Attention Meta Transformer for Rotating Machinery Fault Diagnosis
par: Wang, Hanyang, et autres
Publié: (2025)
par: Wang, Hanyang, et autres
Publié: (2025)
Route Experts by Sequence, not by Token
par: Wen, Tiansheng, et autres
Publié: (2025)
par: Wen, Tiansheng, et autres
Publié: (2025)
Variational Routing: A Scalable Bayesian Framework for Calibrated Mixture-of-Experts Transformers
par: Li, Albus Yizhuo, et autres
Publié: (2026)
par: Li, Albus Yizhuo, et autres
Publié: (2026)
Token Sample Complexity of Attention
par: Bohbot, Léa, et autres
Publié: (2025)
par: Bohbot, Léa, et autres
Publié: (2025)
Assessing Per-Sample Membership Inference Vulnerability without Retraining
par: Dorseuil, Valentin, et autres
Publié: (2026)
par: Dorseuil, Valentin, et autres
Publié: (2026)
Distribution Transformers: Fast Approximate Bayesian Inference With On-The-Fly Prior Adaptation
par: Whittle, George, et autres
Publié: (2025)
par: Whittle, George, et autres
Publié: (2025)
Improving Routing in Sparse Mixture of Experts with Graph of Tokens
par: Nguyen, Tam, et autres
Publié: (2025)
par: Nguyen, Tam, et autres
Publié: (2025)
Documents similaires
-
TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference
par: Jaber, Jaber, et autres
Publié: (2026) -
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
par: Jo, Dongwon, et autres
Publié: (2026) -
CAST: Clustering Self-Attention using Surrogate Tokens for Efficient Transformers
par: van Engelenhoven, Adjorn, et autres
Publié: (2024) -
Learning to Route: Per-Sample Adaptive Routing for Multimodal Multitask Prediction
par: Ajirak, Marzieh, et autres
Publié: (2025) -
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
par: Zheng, Wenhao, et autres
Publié: (2025)