Enregistré dans:
| Auteurs principaux: | Chelba, Ciprian, Chen, Mia, Bapna, Ankur, Shazeer, Noam |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2001.04589 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Coupling Speech Encoders with Downstream Text Models
par: Chelba, Ciprian, et autres
Publié: (2024)
par: Chelba, Ciprian, et autres
Publié: (2024)
Lossless Acceleration of Large Language Model via Adaptive N-gram Parallel Decoding
par: Ou, Jie, et autres
Publié: (2024)
par: Ou, Jie, et autres
Publié: (2024)
Understanding Transformers via N-gram Statistics
par: Nguyen, Timothy
Publié: (2024)
par: Nguyen, Timothy
Publié: (2024)
Self-Speculative Biased Decoding for Faster Re-Translation
par: Zeng, Linxiao, et autres
Publié: (2025)
par: Zeng, Linxiao, et autres
Publié: (2025)
Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers
par: Lou, Chao, et autres
Publié: (2024)
par: Lou, Chao, et autres
Publié: (2024)
Transformers Can Represent $n$-gram Language Models
par: Svete, Anej, et autres
Publié: (2024)
par: Svete, Anej, et autres
Publié: (2024)
FlashDecoding++: Faster Large Language Model Inference on GPUs
par: Hong, Ke, et autres
Publié: (2023)
par: Hong, Ke, et autres
Publié: (2023)
Faster Cascades via Speculative Decoding
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
AdaSplash-2: Faster Differentiable Sparse Attention
par: Gonçalves, Nuno, et autres
Publié: (2026)
par: Gonçalves, Nuno, et autres
Publié: (2026)
SEA: Sparse Linear Attention with Estimated Attention Mask
par: Lee, Heejun, et autres
Publié: (2023)
par: Lee, Heejun, et autres
Publié: (2023)
Sparser, Faster, Lighter Transformer Language Models
par: Cetin, Edoardo, et autres
Publié: (2026)
par: Cetin, Edoardo, et autres
Publié: (2026)
Not All Denoising Steps Are Equal: Model Scheduling for Faster Masked Diffusion Language Models
par: Sedykh, Ivan, et autres
Publié: (2026)
par: Sedykh, Ivan, et autres
Publié: (2026)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
par: Ganesan, Mugilan, et autres
Publié: (2025)
par: Ganesan, Mugilan, et autres
Publié: (2025)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
par: Bachmann, Gregor, et autres
Publié: (2025)
par: Bachmann, Gregor, et autres
Publié: (2025)
Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2022)
par: Lin, Tzu-Quan, et autres
Publié: (2022)
Entropic-Time Inference: Self-Organizing Large Language Model Decoding Beyond Attention
par: Kiruluta, Andrew
Publié: (2026)
par: Kiruluta, Andrew
Publié: (2026)
Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding
par: Oba, Daisuke, et autres
Publié: (2026)
par: Oba, Daisuke, et autres
Publié: (2026)
A2SF: Accumulative Attention Scoring with Forgetting Factor for Token Pruning in Transformer Decoder
par: Jo, Hyun-rae, et autres
Publié: (2024)
par: Jo, Hyun-rae, et autres
Publié: (2024)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
par: Boreiko, Valentyn, et autres
Publié: (2024)
par: Boreiko, Valentyn, et autres
Publié: (2024)
Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
par: Chen, Ziyu, et autres
Publié: (2025)
par: Chen, Ziyu, et autres
Publié: (2025)
Hardware-Efficient Attention for Fast Decoding
par: Zadouri, Ted, et autres
Publié: (2025)
par: Zadouri, Ted, et autres
Publié: (2025)
Enhancing Bangla Language Next Word Prediction and Sentence Completion through Extended RNN with Bi-LSTM Model On N-gram Language
par: Islam, Md Robiul, et autres
Publié: (2024)
par: Islam, Md Robiul, et autres
Publié: (2024)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
par: Shoham, Ofir Ben
Publié: (2026)
par: Shoham, Ofir Ben
Publié: (2026)
DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models
par: Goyal, Satyam, et autres
Publié: (2026)
par: Goyal, Satyam, et autres
Publié: (2026)
Improving Rare Word Translation With Dictionaries and Attention Masking
par: Sible, Kenneth J., et autres
Publié: (2024)
par: Sible, Kenneth J., et autres
Publié: (2024)
Block Sparse Flash Attention
par: Ohayon, Daniel, et autres
Publié: (2025)
par: Ohayon, Daniel, et autres
Publié: (2025)
Tree Attention: Topology-aware Decoding for Long-Context Attention on GPU clusters
par: Shyam, Vasudev, et autres
Publié: (2024)
par: Shyam, Vasudev, et autres
Publié: (2024)
TidalDecode: Fast and Accurate LLM Decoding with Position Persistent Sparse Attention
par: Yang, Lijie, et autres
Publié: (2024)
par: Yang, Lijie, et autres
Publié: (2024)
Trainable Dynamic Mask Sparse Attention
par: Shi, Jingze, et autres
Publié: (2025)
par: Shi, Jingze, et autres
Publié: (2025)
Learnable Multi-Scale Wavelet Transformer: A Novel Alternative to Self-Attention
par: Kiruluta, Andrew, et autres
Publié: (2025)
par: Kiruluta, Andrew, et autres
Publié: (2025)
Efficiently Dispatching Flash Attention For Partially Filled Attention Masks
par: Sharma, Agniv, et autres
Publié: (2024)
par: Sharma, Agniv, et autres
Publié: (2024)
EntmaxKV: Support-Aware Decoding for Entmax Attention
par: Duarte, Gonçalo, et autres
Publié: (2026)
par: Duarte, Gonçalo, et autres
Publié: (2026)
Mixture of Attentions For Speculative Decoding
par: Zimmer, Matthieu, et autres
Publié: (2024)
par: Zimmer, Matthieu, et autres
Publié: (2024)
On The Adaptation of Unlimiformer for Decoder-Only Transformers
par: Ahrabian, Kian, et autres
Publié: (2024)
par: Ahrabian, Kian, et autres
Publié: (2024)
Mask-Enhanced Autoregressive Prediction: Pay Less Attention to Learn More
par: Zhuang, Xialie, et autres
Publié: (2025)
par: Zhuang, Xialie, et autres
Publié: (2025)
Beyond Self Attention: A Subquadratic Fourier Wavelet Transformer with Multi Modal Fusion
par: Kiruluta, Andrew, et autres
Publié: (2021)
par: Kiruluta, Andrew, et autres
Publié: (2021)
Masked Hard-Attention Transformers Recognize Exactly the Star-Free Languages
par: Yang, Andy, et autres
Publié: (2023)
par: Yang, Andy, et autres
Publié: (2023)
Exclusive Self Attention
par: Zhai, Shuangfei
Publié: (2026)
par: Zhai, Shuangfei
Publié: (2026)
Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM
par: Fan, Zehao, et autres
Publié: (2025)
par: Fan, Zehao, et autres
Publié: (2025)
RecurFormer: Not All Transformer Heads Need Self-Attention
par: Yan, Ruiqing, et autres
Publié: (2024)
par: Yan, Ruiqing, et autres
Publié: (2024)
Documents similaires
-
Coupling Speech Encoders with Downstream Text Models
par: Chelba, Ciprian, et autres
Publié: (2024) -
Lossless Acceleration of Large Language Model via Adaptive N-gram Parallel Decoding
par: Ou, Jie, et autres
Publié: (2024) -
Understanding Transformers via N-gram Statistics
par: Nguyen, Timothy
Publié: (2024) -
Self-Speculative Biased Decoding for Faster Re-Translation
par: Zeng, Linxiao, et autres
Publié: (2025) -
Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers
par: Lou, Chao, et autres
Publié: (2024)