Sirius: Contextual Sparsity with Correction for Efficient LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yang, Chen, Zhuoming, Xu, Zhaozhuo, Lin, Victoria, Chen, Beidi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
Kinetics: Rethinking Test-Time Scaling Laws
par: Sadhukhan, Ranajoy, et autres
Publié: (2025)
par: Sadhukhan, Ranajoy, et autres
Publié: (2025)
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
par: Svirschevski, Ruslan, et autres
Publié: (2024)
par: Svirschevski, Ruslan, et autres
Publié: (2024)
Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding
par: Chen, Zhuoming, et autres
Publié: (2024)
par: Chen, Zhuoming, et autres
Publié: (2024)
Learn To be Efficient: Build Structured Sparsity in Large Language Models
par: Zheng, Haizhong, et autres
Publié: (2024)
par: Zheng, Haizhong, et autres
Publié: (2024)
MagicPIG: LSH Sampling for Efficient LLM Generation
par: Chen, Zhuoming, et autres
Publié: (2024)
par: Chen, Zhuoming, et autres
Publié: (2024)
Do LLMs Know to Respect Copyright Notice?
par: Xu, Jialiang, et autres
Publié: (2024)
par: Xu, Jialiang, et autres
Publié: (2024)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024)
par: Liu, Zirui, et autres
Publié: (2024)
Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models
par: Wu, Yuheng, et autres
Publié: (2025)
par: Wu, Yuheng, et autres
Publié: (2025)
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding
par: Sadhukhan, Ranajoy, et autres
Publié: (2024)
par: Sadhukhan, Ranajoy, et autres
Publié: (2024)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
par: Li, Minghan, et autres
Publié: (2024)
par: Li, Minghan, et autres
Publié: (2024)
WWW.Serve: Interconnecting Global LLM Services through Decentralization
par: Wang, Huanyu, et autres
Publié: (2026)
par: Wang, Huanyu, et autres
Publié: (2026)
Efficient Streaming Language Models with Attention Sinks
par: Xiao, Guangxuan, et autres
Publié: (2023)
par: Xiao, Guangxuan, et autres
Publié: (2023)
Detecting Contextual Hallucinations in LLMs with Frequency-Aware Attention
par: Qi, Siya, et autres
Publié: (2026)
par: Qi, Siya, et autres
Publié: (2026)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
par: Liu, Jingyu, et autres
Publié: (2025)
par: Liu, Jingyu, et autres
Publié: (2025)
Towards Extreme Pruning of LLMs with Plug-and-Play Mixed Sparsity
par: Xu, Chi, et autres
Publié: (2025)
par: Xu, Chi, et autres
Publié: (2025)
Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity
par: Tang, Yehui, et autres
Publié: (2025)
par: Tang, Yehui, et autres
Publié: (2025)
CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models
par: Lee, Donghyun, et autres
Publié: (2024)
par: Lee, Donghyun, et autres
Publié: (2024)
Self-Correction Makes LLMs Better Parsers
par: Zhang, Ziyan, et autres
Publié: (2025)
par: Zhang, Ziyan, et autres
Publié: (2025)
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
par: Yan, Ran, et autres
Publié: (2025)
par: Yan, Ran, et autres
Publié: (2025)
Supervised Optimism Correction: Be Confident When LLMs Are Sure
par: Zhang, Junjie, et autres
Publié: (2025)
par: Zhang, Junjie, et autres
Publié: (2025)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
par: Zhong, Yiwu, et autres
Publié: (2024)
par: Zhong, Yiwu, et autres
Publié: (2024)
The Diminishing Returns of Early-Exit Decoding in Modern LLMs
par: Wei, Rui, et autres
Publié: (2026)
par: Wei, Rui, et autres
Publié: (2026)
SFR-RAG: Towards Contextually Faithful LLMs
par: Nguyen, Xuan-Phi, et autres
Publié: (2024)
par: Nguyen, Xuan-Phi, et autres
Publié: (2024)
When Does Sparsity Mitigate the Curse of Depth in LLMs
par: Muhtar, Dilxat, et autres
Publié: (2026)
par: Muhtar, Dilxat, et autres
Publié: (2026)
Enhancing Cross-Tokenizer Knowledge Distillation with Contextual Dynamical Mapping
par: Chen, Yijie, et autres
Publié: (2025)
par: Chen, Yijie, et autres
Publié: (2025)
Instruction Tuning and CoT Prompting for Contextual Medical QA with LLMs
par: Le, Chenqian, et autres
Publié: (2025)
par: Le, Chenqian, et autres
Publié: (2025)
Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMs
par: Yang, Zhe, et autres
Publié: (2024)
par: Yang, Zhe, et autres
Publié: (2024)
Long Exposure: Accelerating Parameter-Efficient Fine-Tuning for LLMs under Shadowy Sparsity
par: Wang, Tuowei, et autres
Publié: (2025)
par: Wang, Tuowei, et autres
Publié: (2025)
STS: Efficient Sparse Attention with Speculative Token Sparsity
par: Xu, Ceyu, et autres
Publié: (2026)
par: Xu, Ceyu, et autres
Publié: (2026)
LoCoCo: Dropping In Convolutions for Long Context Compression
par: Cai, Ruisi, et autres
Publié: (2024)
par: Cai, Ruisi, et autres
Publié: (2024)
SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language Models
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length
par: Ma, Xuezhe, et autres
Publié: (2024)
par: Ma, Xuezhe, et autres
Publié: (2024)
Token-wise Influential Training Data Retrieval for Large Language Models
par: Lin, Huawei, et autres
Publié: (2024)
par: Lin, Huawei, et autres
Publié: (2024)
Speech LLMs are Contextual Reasoning Transcribers
par: Deng, Keqi, et autres
Publié: (2026)
par: Deng, Keqi, et autres
Publié: (2026)
Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
ShadowLLM: Predictor-based Contextual Sparsity for Large Language Models
par: Akhauri, Yash, et autres
Publié: (2024)
par: Akhauri, Yash, et autres
Publié: (2024)
DEL-ToM: Inference-Time Scaling for Theory-of-Mind Reasoning via Dynamic Epistemic Logic
par: Wu, Yuheng, et autres
Publié: (2025)
par: Wu, Yuheng, et autres
Publié: (2025)
Documents similaires
-
GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?
par: Zhou, Yang, et autres
Publié: (2025) -
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
par: Sun, Hanshi, et autres
Publié: (2024) -
Kinetics: Rethinking Test-Time Scaling Laws
par: Sadhukhan, Ranajoy, et autres
Publié: (2025) -
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
par: Svirschevski, Ruslan, et autres
Publié: (2024) -
Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding
par: Chen, Zhuoming, et autres
Publié: (2024)