Online Pseudo-average Shifting Attention(PASA) for Robust Low-precision LLM Inference: Algorithms and Numerical Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheng, Long, Liao, Qichen, Wu, Fan, Mu, Junlin, Han, Tengfei, Qiu, Zhe, Li, Lianqiang, Liu, Tianyi, Miao, Fangzheng, Gao, Keming, Wang, Liang, Zhang, Zhen, Yin, Qiande |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Extending the Network Calculus Algorithmic Toolbox for Ultimately Pseudo-Periodic Functions: Pseudo-Inverse and Composition
di: Zippo, Raffaele, et al.
Pubblicazione: (2022)
di: Zippo, Raffaele, et al.
Pubblicazione: (2022)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
di: Fu, Zizhuo, et al.
Pubblicazione: (2025)
di: Fu, Zizhuo, et al.
Pubblicazione: (2025)
LRAMM -- Low precision approximates GEMM via RSVD
di: Gu, Hongyaoxing
Pubblicazione: (2024)
di: Gu, Hongyaoxing
Pubblicazione: (2024)
Numerical Kernels on a Spatial Accelerator: A Study of Tenstorrent Wormhole
di: Taylor, Maya, et al.
Pubblicazione: (2026)
di: Taylor, Maya, et al.
Pubblicazione: (2026)
Performance evaluation of accelerated complex multiple-precision LU decomposition
di: Kouya, Tomonori
Pubblicazione: (2024)
di: Kouya, Tomonori
Pubblicazione: (2024)
Dissecting Embedding Bag Performance in DLRM Inference
di: Ambati, Chandrish, et al.
Pubblicazione: (2025)
di: Ambati, Chandrish, et al.
Pubblicazione: (2025)
Secure Password Generator Based on Secure Pseudo-Random Number Generator
di: Chen, Abel C. H.
Pubblicazione: (2025)
di: Chen, Abel C. H.
Pubblicazione: (2025)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
Statistical Modeling and Uncertainty Estimation of LLM Inference Systems
di: Ray, Kaustabha, et al.
Pubblicazione: (2025)
di: Ray, Kaustabha, et al.
Pubblicazione: (2025)
Two Criteria for Performance Analysis of Optimization Algorithms
di: Jing, Yunpeng, et al.
Pubblicazione: (2024)
di: Jing, Yunpeng, et al.
Pubblicazione: (2024)
AttentionEngine: A Versatile Framework for Efficient Attention Mechanisms on Diverse Hardware Platforms
di: Chen, Feiyang, et al.
Pubblicazione: (2025)
di: Chen, Feiyang, et al.
Pubblicazione: (2025)
Machine Learning-Guided Memory Optimization for DLRM Inference on Tiered Memory
di: Ren, Jie, et al.
Pubblicazione: (2025)
di: Ren, Jie, et al.
Pubblicazione: (2025)
Characterize LSM-tree Compaction Performance via On-Device LLM Inference
di: Ding, Jiabiao, et al.
Pubblicazione: (2026)
di: Ding, Jiabiao, et al.
Pubblicazione: (2026)
Meta-Metrics and Best Practices for System-Level Inference Performance Benchmarking
di: Salaria, Shweta, et al.
Pubblicazione: (2025)
di: Salaria, Shweta, et al.
Pubblicazione: (2025)
Performance evaluation of accelerated real and complex multiple-precision sparse matrix-vector multiplication
di: Kouya, Tomonori
Pubblicazione: (2024)
di: Kouya, Tomonori
Pubblicazione: (2024)
CAPSim: A Fast CPU Performance Simulator Using Attention-based Predictor
di: Xu, Buqing, et al.
Pubblicazione: (2025)
di: Xu, Buqing, et al.
Pubblicazione: (2025)
Explainable Port Mapping Inference with Sparse Performance Counters for AMD's Zen Architectures
di: Ritter, Fabian, et al.
Pubblicazione: (2024)
di: Ritter, Fabian, et al.
Pubblicazione: (2024)
Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
di: Benazir, Afsara, et al.
Pubblicazione: (2025)
di: Benazir, Afsara, et al.
Pubblicazione: (2025)
SparseInfer: Training-free Prediction of Activation Sparsity for Fast LLM Inference
di: Shin, Jiho, et al.
Pubblicazione: (2024)
di: Shin, Jiho, et al.
Pubblicazione: (2024)
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
di: Yin, Wangsong, et al.
Pubblicazione: (2025)
di: Yin, Wangsong, et al.
Pubblicazione: (2025)
Inference performance evaluation for LLMs on edge devices with a novel benchmarking framework and metric
di: Chen, Hao, et al.
Pubblicazione: (2025)
di: Chen, Hao, et al.
Pubblicazione: (2025)
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention
di: Lee, Younjoo, et al.
Pubblicazione: (2026)
di: Lee, Younjoo, et al.
Pubblicazione: (2026)
Can Increasing the Hit Ratio Hurt Cache Throughput? (Long Version)
di: Qiu, Ziyue, et al.
Pubblicazione: (2024)
di: Qiu, Ziyue, et al.
Pubblicazione: (2024)
Spatiotemporal Non-Uniformity-Aware Online Task Scheduling in Collaborative Edge Computing for Industrial Internet of Things
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
TINA: Acceleration of Non-NN Signal Processing Algorithms Using NN Accelerators
di: Boerkamp, Christiaan, et al.
Pubblicazione: (2024)
di: Boerkamp, Christiaan, et al.
Pubblicazione: (2024)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
Long-term Monitoring of Kernel and Hardware Events to Understand Latency Variance
di: Zhou, Fang, et al.
Pubblicazione: (2026)
di: Zhou, Fang, et al.
Pubblicazione: (2026)
Computational Algorithms for the Product Form Solution of Closed Queuing Networks with Finite Buffers and Skip-Over Policy
di: Balbo, Gianfranco, et al.
Pubblicazione: (2024)
di: Balbo, Gianfranco, et al.
Pubblicazione: (2024)
HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing
di: Huang, Haochen, et al.
Pubblicazione: (2025)
di: Huang, Haochen, et al.
Pubblicazione: (2025)
Tail Optimality and Performance Analysis of the Nudge*(M) Scheduling Algorithm
di: Charlet, Nils, et al.
Pubblicazione: (2024)
di: Charlet, Nils, et al.
Pubblicazione: (2024)
Iterative Layer Pruning for Efficient Translation Inference
di: Moslem, Yasmin, et al.
Pubblicazione: (2025)
di: Moslem, Yasmin, et al.
Pubblicazione: (2025)
Anatomizing Deep Learning Inference in Web Browsers
di: Wang, Qipeng, et al.
Pubblicazione: (2024)
di: Wang, Qipeng, et al.
Pubblicazione: (2024)
Application Research On Real-Time Perception Of Device Performance Status
di: Wang, Zhe, et al.
Pubblicazione: (2024)
di: Wang, Zhe, et al.
Pubblicazione: (2024)
Conformer-Based Speech Recognition On Extreme Edge-Computing Devices
di: Xu, Mingbin, et al.
Pubblicazione: (2023)
di: Xu, Mingbin, et al.
Pubblicazione: (2023)
SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving
di: Zhang, Quqing, et al.
Pubblicazione: (2026)
di: Zhang, Quqing, et al.
Pubblicazione: (2026)
Forecasting GPU Performance for Deep Learning Training and Inference
di: Lee, Seonho, et al.
Pubblicazione: (2024)
di: Lee, Seonho, et al.
Pubblicazione: (2024)
An Inquiry into Datacenter TCO for LLM Inference with FP8
di: Kim, Jiwoo, et al.
Pubblicazione: (2025)
di: Kim, Jiwoo, et al.
Pubblicazione: (2025)
Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants
di: You, Bozhi, et al.
Pubblicazione: (2025)
di: You, Bozhi, et al.
Pubblicazione: (2025)
Cloud Computing Energy Consumption Prediction Based on Kernel Extreme Learning Machine Algorithm Improved by Vector Weighted Average Algorithm
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Extending the Network Calculus Algorithmic Toolbox for Ultimately Pseudo-Periodic Functions: Pseudo-Inverse and Composition
di: Zippo, Raffaele, et al.
Pubblicazione: (2022) -
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
di: Jiang, Jevin, et al.
Pubblicazione: (2026) -
H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
di: Fu, Zizhuo, et al.
Pubblicazione: (2025) -
LRAMM -- Low precision approximates GEMM via RSVD
di: Gu, Hongyaoxing
Pubblicazione: (2024) -
Numerical Kernels on a Spatial Accelerator: A Study of Tenstorrent Wormhole
di: Taylor, Maya, et al.
Pubblicazione: (2026)