Energy-Efficient Transformer Inference: Optimization Strategies for Time Series Classification
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kermani, Arshia, Zeraatkar, Ehsan, Irani, Habib |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Time Series Embedding Methods for Classification Tasks: A Review
von: Irani, Habib, et al.
Veröffentlicht: (2025)
von: Irani, Habib, et al.
Veröffentlicht: (2025)
Rapid Augmentations for Time Series (RATS): A High-Performance Library for Time Series Augmentation
von: Skaf, Wadie, et al.
Veröffentlicht: (2026)
von: Skaf, Wadie, et al.
Veröffentlicht: (2026)
Time-Efficient Hybrid Hyperparameter Tuning Approach for Cardiovascular Disease Classification
von: Pathak, Abhay Kumar, et al.
Veröffentlicht: (2024)
von: Pathak, Abhay Kumar, et al.
Veröffentlicht: (2024)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
von: Shao, Zishan, et al.
Veröffentlicht: (2025)
von: Shao, Zishan, et al.
Veröffentlicht: (2025)
EcoSpa: Efficient Transformer Training with Coupled Sparsity
von: Xiao, Jinqi, et al.
Veröffentlicht: (2025)
von: Xiao, Jinqi, et al.
Veröffentlicht: (2025)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
von: Yao, Feiyu, et al.
Veröffentlicht: (2026)
von: Yao, Feiyu, et al.
Veröffentlicht: (2026)
FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast
von: Wu, Wenhao, et al.
Veröffentlicht: (2026)
von: Wu, Wenhao, et al.
Veröffentlicht: (2026)
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
von: Tyukin, Georgy
Veröffentlicht: (2024)
von: Tyukin, Georgy
Veröffentlicht: (2024)
Physics-Guided Transformer (PGT): Physics-Aware Attention Mechanism for PINNs
von: Zeraatkar, Ehsan, et al.
Veröffentlicht: (2026)
von: Zeraatkar, Ehsan, et al.
Veröffentlicht: (2026)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
von: Zhao, Yushang, et al.
Veröffentlicht: (2025)
von: Zhao, Yushang, et al.
Veröffentlicht: (2025)
On the Sustainability of AI Inferences in the Edge
von: Sobhani, Ghazal, et al.
Veröffentlicht: (2025)
von: Sobhani, Ghazal, et al.
Veröffentlicht: (2025)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
von: Yin, Yishu, et al.
Veröffentlicht: (2025)
von: Yin, Yishu, et al.
Veröffentlicht: (2025)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
von: Chu, Kexin, et al.
Veröffentlicht: (2025)
von: Chu, Kexin, et al.
Veröffentlicht: (2025)
Pushing the Envelope of LLM Inference on AI-PC and Intel GPUs
von: Georganas, Evangelos, et al.
Veröffentlicht: (2025)
von: Georganas, Evangelos, et al.
Veröffentlicht: (2025)
Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
von: Panigrahy, Deepak, et al.
Veröffentlicht: (2026)
von: Panigrahy, Deepak, et al.
Veröffentlicht: (2026)
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
von: Yin, Wangsong, et al.
Veröffentlicht: (2025)
von: Yin, Wangsong, et al.
Veröffentlicht: (2025)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
von: Jiang, Jevin, et al.
Veröffentlicht: (2026)
von: Jiang, Jevin, et al.
Veröffentlicht: (2026)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
Model Compression and Efficient Inference for Large Language Models: A Survey
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
von: Knoop, Jonathan, et al.
Veröffentlicht: (2026)
von: Knoop, Jonathan, et al.
Veröffentlicht: (2026)
FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
von: Qiao, Liang, et al.
Veröffentlicht: (2025)
von: Qiao, Liang, et al.
Veröffentlicht: (2025)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
The Power of Training: How Different Neural Network Setups Influence the Energy Demand
von: Geißler, Daniel, et al.
Veröffentlicht: (2024)
von: Geißler, Daniel, et al.
Veröffentlicht: (2024)
Quantum Neural Networks for Wind Energy Forecasting: A Comparative Study of Performance and Scalability with Classical Models
von: Hangun, Batuhan, et al.
Veröffentlicht: (2025)
von: Hangun, Batuhan, et al.
Veröffentlicht: (2025)
EDGC: Entropy-driven Dynamic Gradient Compression for Efficient LLM Training
von: Yi, Qingao, et al.
Veröffentlicht: (2025)
von: Yi, Qingao, et al.
Veröffentlicht: (2025)
Knowledge Grafting: A Mechanism for Optimizing AI Model Deployment in Resource-Constrained Environments
von: Almurshed, Osama, et al.
Veröffentlicht: (2025)
von: Almurshed, Osama, et al.
Veröffentlicht: (2025)
FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system
von: Li, Zeyuan, et al.
Veröffentlicht: (2024)
von: Li, Zeyuan, et al.
Veröffentlicht: (2024)
Leveraging Speculative Sampling and KV-Cache Optimizations Together for Generative AI using OpenVINO
von: Barad, Haim, et al.
Veröffentlicht: (2023)
von: Barad, Haim, et al.
Veröffentlicht: (2023)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
von: Jha, Mayank
Veröffentlicht: (2026)
von: Jha, Mayank
Veröffentlicht: (2026)
A Systematic Evaluation of LLM Strategies for Mental Health Text Analysis: Fine-tuning vs. Prompt Engineering vs. RAG
von: Kermani, Arshia, et al.
Veröffentlicht: (2025)
von: Kermani, Arshia, et al.
Veröffentlicht: (2025)
Quantum-Enhanced Transformers for Robust Acoustic Scene Classification in IoT Environments
von: Quan, Minh K., et al.
Veröffentlicht: (2025)
von: Quan, Minh K., et al.
Veröffentlicht: (2025)
Enhancing Energy-Awareness in Deep Learning through Fine-Grained Energy Measurement
von: Rajput, Saurabhsingh, et al.
Veröffentlicht: (2023)
von: Rajput, Saurabhsingh, et al.
Veröffentlicht: (2023)
Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling
von: Patwari, Rajeev, et al.
Veröffentlicht: (2025)
von: Patwari, Rajeev, et al.
Veröffentlicht: (2025)
Bench360: Benchmarking Local LLM Inference from 360 Degrees
von: Stuhlmann, Linus, et al.
Veröffentlicht: (2025)
von: Stuhlmann, Linus, et al.
Veröffentlicht: (2025)
Neuralink: Fast LLM Inference on Smartphones with Neuron Co-Activation Linking
von: Wang, Tuowei, et al.
Veröffentlicht: (2024)
von: Wang, Tuowei, et al.
Veröffentlicht: (2024)
Optimizing the Deployment of Tiny Transformers on Low-Power MCUs
von: Jung, Victor J. B., et al.
Veröffentlicht: (2024)
von: Jung, Victor J. B., et al.
Veröffentlicht: (2024)
A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search
von: Ellis-Mohr, Austin R., et al.
Veröffentlicht: (2025)
von: Ellis-Mohr, Austin R., et al.
Veröffentlicht: (2025)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
von: Chhugani, Jatin, et al.
Veröffentlicht: (2026)
von: Chhugani, Jatin, et al.
Veröffentlicht: (2026)
Online Pseudo-average Shifting Attention(PASA) for Robust Low-precision LLM Inference: Algorithms and Numerical Analysis
von: Cheng, Long, et al.
Veröffentlicht: (2025)
von: Cheng, Long, et al.
Veröffentlicht: (2025)
MambaNetBurst: Direct Byte-level Network Traffic Classification without Tokenization or Pretraining
von: Kulatilleke, Gayan K., et al.
Veröffentlicht: (2026)
von: Kulatilleke, Gayan K., et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Time Series Embedding Methods for Classification Tasks: A Review
von: Irani, Habib, et al.
Veröffentlicht: (2025) -
Rapid Augmentations for Time Series (RATS): A High-Performance Library for Time Series Augmentation
von: Skaf, Wadie, et al.
Veröffentlicht: (2026) -
Time-Efficient Hybrid Hyperparameter Tuning Approach for Cardiovascular Disease Classification
von: Pathak, Abhay Kumar, et al.
Veröffentlicht: (2024) -
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
von: Shao, Zishan, et al.
Veröffentlicht: (2025) -
EcoSpa: Efficient Transformer Training with Coupled Sparsity
von: Xiao, Jinqi, et al.
Veröffentlicht: (2025)