Tender: Accelerating Large Language Models via Tensor Decomposition and Runtime Requantization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lee, Jungi, Lee, Wonbeom, Sim, Jaewoong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
von: Lee, Jungi, et al.
Veröffentlicht: (2025)
von: Lee, Jungi, et al.
Veröffentlicht: (2025)
MoNDE: Mixture of Near-Data Experts for Large-Scale Sparse Models
von: Kim, Taehyun, et al.
Veröffentlicht: (2024)
von: Kim, Taehyun, et al.
Veröffentlicht: (2024)
GRTX: Efficient Ray Tracing for 3D Gaussian-Based Rendering
von: Lee, Junseo, et al.
Veröffentlicht: (2026)
von: Lee, Junseo, et al.
Veröffentlicht: (2026)
InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management
von: Lee, Wonbeom, et al.
Veröffentlicht: (2024)
von: Lee, Wonbeom, et al.
Veröffentlicht: (2024)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
von: Kim, Wonung, et al.
Veröffentlicht: (2025)
von: Kim, Wonung, et al.
Veröffentlicht: (2025)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
von: Ma, Shaobo, et al.
Veröffentlicht: (2024)
von: Ma, Shaobo, et al.
Veröffentlicht: (2024)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
von: Zhang, Chengming, et al.
Veröffentlicht: (2024)
von: Zhang, Chengming, et al.
Veröffentlicht: (2024)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
SCRec: A Scalable Computational Storage System with Statistical Sharding and Tensor-train Decomposition for Recommendation Models
von: Yang, Jinho, et al.
Veröffentlicht: (2025)
von: Yang, Jinho, et al.
Veröffentlicht: (2025)
GPT4AIGChip: Towards Next-Generation AI Accelerator Design Automation via Large Language Models
von: Fu, Yonggan, et al.
Veröffentlicht: (2023)
von: Fu, Yonggan, et al.
Veröffentlicht: (2023)
Accelerating Neural Networks for Large Language Models and Graph Processing with Silicon Photonics
von: Afifi, Salma, et al.
Veröffentlicht: (2024)
von: Afifi, Salma, et al.
Veröffentlicht: (2024)
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
von: Sharma, Amit
Veröffentlicht: (2025)
von: Sharma, Amit
Veröffentlicht: (2025)
Accelerating Sparse Graph Neural Networks with Tensor Core Optimization
von: Wu, Ka Wai
Veröffentlicht: (2024)
von: Wu, Ka Wai
Veröffentlicht: (2024)
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction
von: Kulp, Gabriel, et al.
Veröffentlicht: (2024)
von: Kulp, Gabriel, et al.
Veröffentlicht: (2024)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
InstantFT: An FPGA-Based Runtime Subsecond Fine-tuning of CNN Models
von: Sugiura, Keisuke, et al.
Veröffentlicht: (2025)
von: Sugiura, Keisuke, et al.
Veröffentlicht: (2025)
Token-Picker: Accelerating Attention in Text Generation with Minimized Memory Transfer via Probability Estimation
von: Park, Junyoung, et al.
Veröffentlicht: (2024)
von: Park, Junyoung, et al.
Veröffentlicht: (2024)
Smart-Infinity: Fast Large Language Model Training using Near-Storage Processing on a Real System
von: Jang, Hongsun, et al.
Veröffentlicht: (2024)
von: Jang, Hongsun, et al.
Veröffentlicht: (2024)
A Runtime-Adaptive Transformer Neural Network Accelerator on FPGAs
von: Kabir, Ehsan, et al.
Veröffentlicht: (2024)
von: Kabir, Ehsan, et al.
Veröffentlicht: (2024)
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
von: Yun, Sungmin, et al.
Veröffentlicht: (2024)
von: Yun, Sungmin, et al.
Veröffentlicht: (2024)
LLM-Aided Compilation for Tensor Accelerators
von: Hong, Charles, et al.
Veröffentlicht: (2024)
von: Hong, Charles, et al.
Veröffentlicht: (2024)
GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design
von: You, Haoran, et al.
Veröffentlicht: (2021)
von: You, Haoran, et al.
Veröffentlicht: (2021)
Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications
von: Li, Yang, et al.
Veröffentlicht: (2024)
von: Li, Yang, et al.
Veröffentlicht: (2024)
LEGO: Spatial Accelerator Generation and Optimization for Tensor Applications
von: Lin, Yujun, et al.
Veröffentlicht: (2025)
von: Lin, Yujun, et al.
Veröffentlicht: (2025)
TCL: Enabling Fast and Efficient Cross-Hardware Tensor Program Optimization via Continual Learning
von: Shen, Chaoyao, et al.
Veröffentlicht: (2026)
von: Shen, Chaoyao, et al.
Veröffentlicht: (2026)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
von: Koo, Jahyun, et al.
Veröffentlicht: (2024)
von: Koo, Jahyun, et al.
Veröffentlicht: (2024)
LLM-USO: Large Language Model-based Universal Sizing Optimizer
von: S, Karthik Somayaji N., et al.
Veröffentlicht: (2025)
von: S, Karthik Somayaji N., et al.
Veröffentlicht: (2025)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
von: Duan, Bowen, et al.
Veröffentlicht: (2026)
von: Duan, Bowen, et al.
Veröffentlicht: (2026)
SNIP: An Adaptive Mixed Precision Framework for Subbyte Large Language Model Training
von: Pan, Yunjie, et al.
Veröffentlicht: (2026)
von: Pan, Yunjie, et al.
Veröffentlicht: (2026)
Accelerating Diffusion Models for Generative AI Applications with Silicon Photonics
von: Suresh, Tharini, et al.
Veröffentlicht: (2026)
von: Suresh, Tharini, et al.
Veröffentlicht: (2026)
Periodic Online Testing for Sparse Systolic Tensor Arrays
von: Peltekis, Christodoulos, et al.
Veröffentlicht: (2025)
von: Peltekis, Christodoulos, et al.
Veröffentlicht: (2025)
Memory Access Characterization of Large Language Models in CPU Environment and its Potential Impacts
von: Banasik, Spencer
Veröffentlicht: (2025)
von: Banasik, Spencer
Veröffentlicht: (2025)
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
von: Zhang, Zixi, et al.
Veröffentlicht: (2023)
von: Zhang, Zixi, et al.
Veröffentlicht: (2023)
ITERA-LLM: Boosting Sub-8-Bit Large Language Model Inference via Iterative Tensor Decomposition
von: Zheng, Keran, et al.
Veröffentlicht: (2025)
von: Zheng, Keran, et al.
Veröffentlicht: (2025)
DOSA: Differentiable Model-Based One-Loop Search for DNN Accelerators
von: Hong, Charles, et al.
Veröffentlicht: (2025)
von: Hong, Charles, et al.
Veröffentlicht: (2025)
ESACT: An End-to-End Sparse Accelerator for Compute-Intensive Transformers via Local Similarity
von: Liu, Hongxiang, et al.
Veröffentlicht: (2025)
von: Liu, Hongxiang, et al.
Veröffentlicht: (2025)
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
von: Cho, Eunyeong, et al.
Veröffentlicht: (2026)
von: Cho, Eunyeong, et al.
Veröffentlicht: (2026)
A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
von: Killian, Earl
Veröffentlicht: (2026)
von: Killian, Earl
Veröffentlicht: (2026)
ReducedLUT: Table Decomposition with "Don't Care" Conditions
von: Cassidy, Oliver, et al.
Veröffentlicht: (2024)
von: Cassidy, Oliver, et al.
Veröffentlicht: (2024)
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
von: Ma, Shaobo, et al.
Veröffentlicht: (2025)
von: Ma, Shaobo, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
von: Lee, Jungi, et al.
Veröffentlicht: (2025) -
MoNDE: Mixture of Near-Data Experts for Large-Scale Sparse Models
von: Kim, Taehyun, et al.
Veröffentlicht: (2024) -
GRTX: Efficient Ray Tracing for 3D Gaussian-Based Rendering
von: Lee, Junseo, et al.
Veröffentlicht: (2026) -
InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management
von: Lee, Wonbeom, et al.
Veröffentlicht: (2024) -
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
von: Kim, Wonung, et al.
Veröffentlicht: (2025)