SpecAttn: Speculating Sparse Attention
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Shah, Harsh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
par: Shukla, Shikhar
Publié: (2026)
par: Shukla, Shikhar
Publié: (2026)
ProxyAttn: Guided Sparse Attention via Representative Heads
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
STS: Efficient Sparse Attention with Speculative Token Sparsity
par: Xu, Ceyu, et autres
Publié: (2026)
par: Xu, Ceyu, et autres
Publié: (2026)
State Space Models as Foundation Models: A Control Theoretic Overview
par: Alonso, Carmen Amo, et autres
Publié: (2024)
par: Alonso, Carmen Amo, et autres
Publié: (2024)
SysCaps: Language Interfaces for Simulation Surrogates of Complex Systems
par: Emami, Patrick, et autres
Publié: (2024)
par: Emami, Patrick, et autres
Publié: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
par: Kumar, Avinash, et autres
Publié: (2025)
par: Kumar, Avinash, et autres
Publié: (2025)
AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
par: Song, Dinghong, et autres
Publié: (2025)
par: Song, Dinghong, et autres
Publié: (2025)
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
par: Plaksin, Anton, et autres
Publié: (2026)
par: Plaksin, Anton, et autres
Publié: (2026)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
par: Zhou, Yongchao, et autres
Publié: (2023)
par: Zhou, Yongchao, et autres
Publié: (2023)
Sparse Attention-driven Quality Prediction for Production Process Optimization in Digital Twins
par: Yin, Yanlei, et autres
Publié: (2024)
par: Yin, Yanlei, et autres
Publié: (2024)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
par: Georganas, Evangelos, et autres
Publié: (2025)
par: Georganas, Evangelos, et autres
Publié: (2025)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
par: Yang, Rubing, et autres
Publié: (2025)
par: Yang, Rubing, et autres
Publié: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
par: Huang, Kaixuan, et autres
Publié: (2024)
par: Huang, Kaixuan, et autres
Publié: (2024)
ACING: Actor-Critic for Instruction Learning in Black-Box LLMs
par: Kharrat, Salma, et autres
Publié: (2024)
par: Kharrat, Salma, et autres
Publié: (2024)
ControlAgent: Automating Control System Design via Novel Integration of LLM Agents and Domain Expertise
par: Guo, Xingang, et autres
Publié: (2024)
par: Guo, Xingang, et autres
Publié: (2024)
LogicGuard: Improving Embodied LLM agents through Temporal Logic based Critics
par: Gokhale, Anand, et autres
Publié: (2025)
par: Gokhale, Anand, et autres
Publié: (2025)
Fine-tuning Smaller Language Models for Question Answering over Financial Documents
par: Phogat, Karmvir Singh, et autres
Publié: (2024)
par: Phogat, Karmvir Singh, et autres
Publié: (2024)
Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
par: Chen, Lingjiao, et autres
Publié: (2024)
par: Chen, Lingjiao, et autres
Publié: (2024)
Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement
par: Xie, Guanwen, et autres
Publié: (2024)
par: Xie, Guanwen, et autres
Publié: (2024)
PreFT: Prefill-only finetuning for efficient inference
par: Lanpouthakoun, Andrew, et autres
Publié: (2026)
par: Lanpouthakoun, Andrew, et autres
Publié: (2026)
Most Likely Sequence Generation for $n$-Grams, Transformers, HMMs, and Markov Chains, by Using Rollout Algorithms
par: Li, Yuchao, et autres
Publié: (2024)
par: Li, Yuchao, et autres
Publié: (2024)
Fake-Mamba: Real-Time Speech Deepfake Detection Using Bidirectional Mamba as Self-Attention's Alternative
par: Xuan, Xi, et autres
Publié: (2025)
par: Xuan, Xi, et autres
Publié: (2025)
Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP
par: Bogdanov, Igor, et autres
Publié: (2026)
par: Bogdanov, Igor, et autres
Publié: (2026)
FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast
par: Bogdanov, Igor, et autres
Publié: (2026)
par: Bogdanov, Igor, et autres
Publié: (2026)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
par: Wen, Zhuofan, et autres
Publié: (2026)
par: Wen, Zhuofan, et autres
Publié: (2026)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
par: Zhang, Jinbin, et autres
Publié: (2025)
par: Zhang, Jinbin, et autres
Publié: (2025)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
par: Li, Shenggui, et autres
Publié: (2026)
par: Li, Shenggui, et autres
Publié: (2026)
BASS: Batched Attention-optimized Speculative Sampling
par: Qian, Haifeng, et autres
Publié: (2024)
par: Qian, Haifeng, et autres
Publié: (2024)
Spatial Language Likelihood Grounding Network for Bayesian Fusion of Human-Robot Observations
par: Sitdhipol, Supawich, et autres
Publié: (2025)
par: Sitdhipol, Supawich, et autres
Publié: (2025)
Multi-Bin Batching for Increasing LLM Inference Throughput
par: Guldogan, Ozgur, et autres
Publié: (2024)
par: Guldogan, Ozgur, et autres
Publié: (2024)
On the Relation of State Space Models and Hidden Markov Models
par: Ghojogh, Aydin, et autres
Publié: (2026)
par: Ghojogh, Aydin, et autres
Publié: (2026)
A Survey on Large Language Model-empowered Autonomous Driving
par: Zhu, Yuxuan, et autres
Publié: (2024)
par: Zhu, Yuxuan, et autres
Publié: (2024)
SpecTr: Fast Speculative Decoding via Optimal Transport
par: Sun, Ziteng, et autres
Publié: (2023)
par: Sun, Ziteng, et autres
Publié: (2023)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
par: Zhao, Weilin, et autres
Publié: (2025)
par: Zhao, Weilin, et autres
Publié: (2025)
AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers
par: Achtibat, Reduan, et autres
Publié: (2024)
par: Achtibat, Reduan, et autres
Publié: (2024)
$\partial$CBDs: Differentiable Causal Block Diagrams
par: Beckers, Thomas, et autres
Publié: (2026)
par: Beckers, Thomas, et autres
Publié: (2026)
Mixture of Attentions For Speculative Decoding
par: Zimmer, Matthieu, et autres
Publié: (2024)
par: Zimmer, Matthieu, et autres
Publié: (2024)
Temporal Logic Imitation: Learning Plan-Satisficing Motion Policies from Demonstrations
par: Wang, Yanwei, et autres
Publié: (2022)
par: Wang, Yanwei, et autres
Publié: (2022)
Documents similaires
-
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
par: Shukla, Shikhar
Publié: (2026) -
ProxyAttn: Guided Sparse Attention via Representative Heads
par: Wang, Yixuan, et autres
Publié: (2025) -
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
par: Xiao, Zilin, et autres
Publié: (2024) -
STS: Efficient Sparse Attention with Speculative Token Sparsity
par: Xu, Ceyu, et autres
Publié: (2026) -
State Space Models as Foundation Models: A Control Theoretic Overview
par: Alonso, Carmen Amo, et autres
Publié: (2024)