ShadowLLM: Predictor-based Contextual Sparsity for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Akhauri, Yash, AbouElhamayed, Ahmed F, Dotzel, Jordan, Zhang, Zhiru, Rush, Alexander M, Huda, Safeen, Abdelfattah, Mohamed S |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Radial Networks: Dynamic Layer Routing for High-Performance Large Language Models
par: Dotzel, Jordan, et autres
Publié: (2024)
par: Dotzel, Jordan, et autres
Publié: (2024)
Attamba: Attending To Multi-Token States
par: Akhauri, Yash, et autres
Publié: (2024)
par: Akhauri, Yash, et autres
Publié: (2024)
SplitReason: Learning To Offload Reasoning
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025)
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025)
TokenButler: Token Importance is Predictable
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
Beyond Inference: Performance Analysis of DNN Server Overheads for Computer Vision
par: AbouElhamayed, Ahmed F., et autres
Publié: (2024)
par: AbouElhamayed, Ahmed F., et autres
Publié: (2024)
On Latency Predictors for Neural Architecture Search
par: Akhauri, Yash, et autres
Publié: (2024)
par: Akhauri, Yash, et autres
Publié: (2024)
Compute Where it Counts: Self Optimizing Language Models
par: Akhauri, Yash, et autres
Publié: (2026)
par: Akhauri, Yash, et autres
Publié: (2026)
Encodings for Prediction-based Neural Architecture Search
par: Akhauri, Yash, et autres
Publié: (2024)
par: Akhauri, Yash, et autres
Publié: (2024)
Exploring the Limits of Semantic Image Compression at Micro-bits per Pixel
par: Dotzel, Jordan, et autres
Publié: (2024)
par: Dotzel, Jordan, et autres
Publié: (2024)
Semantic Compression of 3D Objects for Open and Collaborative Virtual Worlds
par: Dotzel, Jordan, et autres
Publié: (2025)
par: Dotzel, Jordan, et autres
Publié: (2025)
PQA: Exploring the Potential of Product Quantization in DNN Hardware Acceleration
par: AbouElhamayed, Ahmed F., et autres
Publié: (2023)
par: AbouElhamayed, Ahmed F., et autres
Publié: (2023)
BitMoD: Bit-serial Mixture-of-Datatype LLM Acceleration
par: Chen, Yuzong, et autres
Publié: (2024)
par: Chen, Yuzong, et autres
Publié: (2024)
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion
par: Hu, Zhanqiu, et autres
Publié: (2025)
par: Hu, Zhanqiu, et autres
Publié: (2025)
Regression Language Models for Code
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
Learning from Students: Applying t-Distributions to Explore Accurate and Efficient Formats for LLMs
par: Dotzel, Jordan, et autres
Publié: (2024)
par: Dotzel, Jordan, et autres
Publié: (2024)
SVD Contextual Sparsity Predictors for Fast LLM Inference
par: Serbin, Georgii, et autres
Publié: (2026)
par: Serbin, Georgii, et autres
Publié: (2026)
HALO: Hardware-aware quantization with low critical-path-delay weights for LLM acceleration
par: Juneja, Rohan, et autres
Publié: (2025)
par: Juneja, Rohan, et autres
Publié: (2025)
OverFill: Two-Stage Models for Efficient Language Model Decoding
par: Kim, Woojeong, et autres
Publié: (2025)
par: Kim, Woojeong, et autres
Publié: (2025)
Kratos: An FPGA Benchmark for Unrolled DNNs with Fine-Grained Sparsity and Mixed Precision
par: Dai, Xilai, et autres
Publié: (2024)
par: Dai, Xilai, et autres
Publié: (2024)
FLIQS: One-Shot Mixed-Precision Floating-Point and Integer Quantization Search
par: Dotzel, Jordan, et autres
Publié: (2023)
par: Dotzel, Jordan, et autres
Publié: (2023)
Performance Prediction for Large Systems via Text-to-Text Regression
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
NITRO: LLM Inference on Intel Laptop NPUs
par: Fei, Anthony, et autres
Publié: (2024)
par: Fei, Anthony, et autres
Publié: (2024)
BBS: Bi-directional Bit-level Sparsity for Deep Learning Acceleration
par: Chen, Yuzong, et autres
Publié: (2024)
par: Chen, Yuzong, et autres
Publié: (2024)
Contextual Document Embeddings
par: Morris, John X., et autres
Publié: (2024)
par: Morris, John X., et autres
Publié: (2024)
Auditable Early Stopping for Agentic Routing: Ledger-Verified Run-Wise Certificates under Local DP
par: Akhauri, Shivam
Publié: (2025)
par: Akhauri, Shivam
Publié: (2025)
CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models
par: Lee, Donghyun, et autres
Publié: (2024)
par: Lee, Donghyun, et autres
Publié: (2024)
EVCAR-KG: A Knowledge-Infused Multi-Agent Reinforcement Learning Framework for Resilient Electric Vehicle Charging Network Recovery
par: Abdelfattah, Mohamed
Publié: (2025)
par: Abdelfattah, Mohamed
Publié: (2025)
Polar Sparsity: High Throughput Batched LLM Inferencing with Scalable Contextual Sparsity
par: Shrestha, Susav, et autres
Publié: (2025)
par: Shrestha, Susav, et autres
Publié: (2025)
Shadow, Sparsity of Radiation and Energy Emission Rate in Skyrmion Black Holes
par: Ahmed, Faizuddin, et autres
Publié: (2026)
par: Ahmed, Faizuddin, et autres
Publié: (2026)
Applications of Ion Exchange in Environmental Remediation: Removal of Heavy Metals From Wastewater
par: Mohamed Ahmed Reda Hamed, et autres
Publié: (2024)
par: Mohamed Ahmed Reda Hamed, et autres
Publié: (2024)
SparseLoRA: Accelerating LLM Fine-Tuning with Contextual Sparsity
par: Khaki, Samir, et autres
Publié: (2025)
par: Khaki, Samir, et autres
Publié: (2025)
A Usage-Aware Sequent Calculus for Differential Dynamic Logic
par: Dotzel, Myra, et autres
Publié: (2023)
par: Dotzel, Myra, et autres
Publié: (2023)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
par: Chang, Chi-Chih, et autres
Publié: (2025)
par: Chang, Chi-Chih, et autres
Publié: (2025)
Advanced Bidirectional Three-Phase Power Factor correctors (PFC) for DC Microgrids
par: Abdelfattah, Ahmed Yahia Farag
Publié: (2025)
par: Abdelfattah, Ahmed Yahia Farag
Publié: (2025)
Particle Dynamics, Shadow and Hawking Sparsity of a Kalb-Ramond Black Hole Coupled to Nonlinear Electrodynamics
par: Ahmed, Faizuddin, et autres
Publié: (2026)
par: Ahmed, Faizuddin, et autres
Publié: (2026)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
Dynamics of bacterial recombination in the human gut microbiome - SNV data
par: Liu, Zhiru
Publié: (2025)
par: Liu, Zhiru
Publié: (2025)
Sirius: Contextual Sparsity with Correction for Efficient LLMs
par: Zhou, Yang, et autres
Publié: (2024)
par: Zhou, Yang, et autres
Publié: (2024)
Shadow, Quasinormal Modes, Sparsity, and Energy Emission Rate of Euler-Heisenberg Black Hole Surrounded by Perfect Fluid Dark Matter
par: Silva, Edilberto O., et autres
Publié: (2026)
par: Silva, Edilberto O., et autres
Publié: (2026)
Documents similaires
-
Radial Networks: Dynamic Layer Routing for High-Performance Large Language Models
par: Dotzel, Jordan, et autres
Publié: (2024) -
Attamba: Attending To Multi-Token States
par: Akhauri, Yash, et autres
Publié: (2024) -
SplitReason: Learning To Offload Reasoning
par: Akhauri, Yash, et autres
Publié: (2025) -
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025) -
TokenButler: Token Importance is Predictable
par: Akhauri, Yash, et autres
Publié: (2025)