Salvato in:
| Autori principali: | Lin, Chaofan, Tang, Jiaming, Yang, Shuo, Wang, Hanshuo, Tang, Tian, Tian, Boyu, Stoica, Ion, Han, Song, Gao, Mingyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.02770 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Post-Training Sparse Attention with Double Sparsity
di: Yang, Shuo, et al.
Pubblicazione: (2024)
di: Yang, Shuo, et al.
Pubblicazione: (2024)
HashAttention: Semantic Sparsity for Faster Inference
di: Desai, Aditya, et al.
Pubblicazione: (2024)
di: Desai, Aditya, et al.
Pubblicazione: (2024)
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
di: Tang, Jiaming, et al.
Pubblicazione: (2024)
di: Tang, Jiaming, et al.
Pubblicazione: (2024)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
di: Xu, Peng, et al.
Pubblicazione: (2024)
di: Xu, Peng, et al.
Pubblicazione: (2024)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
di: Zhao, Yilong, et al.
Pubblicazione: (2025)
di: Zhao, Yilong, et al.
Pubblicazione: (2025)
Break the Sequential Dependency of LLM Inference Using Lookahead Decoding
di: Fu, Yichao, et al.
Pubblicazione: (2024)
di: Fu, Yichao, et al.
Pubblicazione: (2024)
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
di: Yang, Shang, et al.
Pubblicazione: (2025)
di: Yang, Shang, et al.
Pubblicazione: (2025)
Frustratingly Easy Task-aware Pruning for Large Language Models
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
di: Huang, Yuxiang, et al.
Pubblicazione: (2026)
di: Huang, Yuxiang, et al.
Pubblicazione: (2026)
A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention
di: Xiu, Di, et al.
Pubblicazione: (2025)
di: Xiu, Di, et al.
Pubblicazione: (2025)
SpAtten: Efficient Sparse Attention Architecture with Cascade Token and Head Pruning
di: Wang, Hanrui, et al.
Pubblicazione: (2020)
di: Wang, Hanrui, et al.
Pubblicazione: (2020)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
di: Tan, Sijun, et al.
Pubblicazione: (2024)
di: Tan, Sijun, et al.
Pubblicazione: (2024)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
Tactic: Adaptive Sparse Attention with Clustering and Distribution Fitting for Long-Context LLMs
di: Zhu, Kan, et al.
Pubblicazione: (2025)
di: Zhu, Kan, et al.
Pubblicazione: (2025)
DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models
di: Gao, Shangqian, et al.
Pubblicazione: (2024)
di: Gao, Shangqian, et al.
Pubblicazione: (2024)
PocketLLM: Ultimate Compression of Large Language Models via Meta Networks
di: Tian, Ye, et al.
Pubblicazione: (2025)
di: Tian, Ye, et al.
Pubblicazione: (2025)
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
Prompt-to-Leaderboard
di: Frick, Evan, et al.
Pubblicazione: (2025)
di: Frick, Evan, et al.
Pubblicazione: (2025)
Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution
di: Park, Jongseok, et al.
Pubblicazione: (2026)
di: Park, Jongseok, et al.
Pubblicazione: (2026)
Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
di: Jain, Naman, et al.
Pubblicazione: (2025)
di: Jain, Naman, et al.
Pubblicazione: (2025)
depyf: Open the Opaque Box of PyTorch Compiler for Machine Learning Researchers
di: You, Kaichao, et al.
Pubblicazione: (2024)
di: You, Kaichao, et al.
Pubblicazione: (2024)
STS: Efficient Sparse Attention with Speculative Token Sparsity
di: Xu, Ceyu, et al.
Pubblicazione: (2026)
di: Xu, Ceyu, et al.
Pubblicazione: (2026)
GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning
di: Tian, Kaiyuan, et al.
Pubblicazione: (2026)
di: Tian, Kaiyuan, et al.
Pubblicazione: (2026)
Adaptive Computation Pruning for the Forgetting Transformer
di: Lin, Zhixuan, et al.
Pubblicazione: (2025)
di: Lin, Zhixuan, et al.
Pubblicazione: (2025)
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
di: Liu, Jun, et al.
Pubblicazione: (2024)
di: Liu, Jun, et al.
Pubblicazione: (2024)
High-Layer Attention Pruning with Rescaling
di: Liu, Songtao, et al.
Pubblicazione: (2025)
di: Liu, Songtao, et al.
Pubblicazione: (2025)
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
di: Xiao, Guangxuan, et al.
Pubblicazione: (2024)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2024)
Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning
di: Cao, Mingyu, et al.
Pubblicazione: (2024)
di: Cao, Mingyu, et al.
Pubblicazione: (2024)
UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective
di: Xiong, Jing, et al.
Pubblicazione: (2024)
di: Xiong, Jing, et al.
Pubblicazione: (2024)
GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
di: Shetty, Manish, et al.
Pubblicazione: (2025)
di: Shetty, Manish, et al.
Pubblicazione: (2025)
Pay Less Attention to Function Words for Free Robustness of Vision-Language Models
di: Tian, Qiwei, et al.
Pubblicazione: (2025)
di: Tian, Qiwei, et al.
Pubblicazione: (2025)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
Enhanced Structured State Space Models via Grouped FIR Filtering and Attention Sink Mechanisms
di: Meng, Tian, et al.
Pubblicazione: (2024)
di: Meng, Tian, et al.
Pubblicazione: (2024)
TELEClass: Taxonomy Enrichment and LLM-Enhanced Hierarchical Text Classification with Minimal Supervision
di: Zhang, Yunyi, et al.
Pubblicazione: (2024)
di: Zhang, Yunyi, et al.
Pubblicazione: (2024)
Earley-Driven Dynamic Pruning for Efficient Structured Decoding
di: Sun, Xintong, et al.
Pubblicazione: (2025)
di: Sun, Xintong, et al.
Pubblicazione: (2025)
Crafting Interpretable Embeddings by Asking LLMs Questions
di: Benara, Vinamra, et al.
Pubblicazione: (2024)
di: Benara, Vinamra, et al.
Pubblicazione: (2024)
Beyond Linear Approximations: A Novel Pruning Approach for Attention Matrix
di: Liang, Yingyu, et al.
Pubblicazione: (2024)
di: Liang, Yingyu, et al.
Pubblicazione: (2024)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Post-Training Sparse Attention with Double Sparsity
di: Yang, Shuo, et al.
Pubblicazione: (2024) -
HashAttention: Semantic Sparsity for Faster Inference
di: Desai, Aditya, et al.
Pubblicazione: (2024) -
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
di: Tang, Jiaming, et al.
Pubblicazione: (2024) -
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
di: Xu, Peng, et al.
Pubblicazione: (2024) -
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
di: Zhao, Yilong, et al.
Pubblicazione: (2025)