Design Space Exploration of Approximate Computing Techniques with a Reinforcement Learning Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Saeedi, Sepide, Savino, Alessandro, Di Carlo, Stefano |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
D-com: Accelerating Iterative Processing to Enable Low-rank Decomposition of Activations
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2025)
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2025)
OPTIMA: Design-Space Exploration of Discharge-Based In-SRAM Computing: Quantifying Energy-Accuracy Trade-Offs
di: Seyedfaraji, Saeed, et al.
Pubblicazione: (2024)
di: Seyedfaraji, Saeed, et al.
Pubblicazione: (2024)
DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance
di: Palaniappan, Kathiravan
Pubblicazione: (2026)
di: Palaniappan, Kathiravan
Pubblicazione: (2026)
A2Q+: Improving Accumulator-Aware Weight Quantization
di: Colbert, Ian, et al.
Pubblicazione: (2024)
di: Colbert, Ian, et al.
Pubblicazione: (2024)
Toward A Formalized Approach for Spike Sorting Algorithms and Hardware Evaluation
di: Zhang, Tim, et al.
Pubblicazione: (2022)
di: Zhang, Tim, et al.
Pubblicazione: (2022)
SONIQ: System-Optimized Noise-Injected Ultra-Low-Precision Quantization with Full-Precision Parity
di: Zhou, Cyrus, et al.
Pubblicazione: (2023)
di: Zhou, Cyrus, et al.
Pubblicazione: (2023)
ACALSim: A Scalable Parallel Simulation Framework for High-Performance System Design Space Exploration
di: Lin, Wei-Fen, et al.
Pubblicazione: (2026)
di: Lin, Wei-Fen, et al.
Pubblicazione: (2026)
GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning
di: Wang, Jiaqi, et al.
Pubblicazione: (2026)
di: Wang, Jiaqi, et al.
Pubblicazione: (2026)
Fast NF4 Dequantization Kernels for Large Language Model Inference
di: Qi, Xiangbo, et al.
Pubblicazione: (2026)
di: Qi, Xiangbo, et al.
Pubblicazione: (2026)
USEFUSE: Uniform Stride for Enhanced Performance in Fused Layer Architecture of Deep Neural Networks
di: Ibrahim, Muhammad Sohail, et al.
Pubblicazione: (2024)
di: Ibrahim, Muhammad Sohail, et al.
Pubblicazione: (2024)
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
di: Saha, Rappy, et al.
Pubblicazione: (2026)
di: Saha, Rappy, et al.
Pubblicazione: (2026)
Search Your Block Floating Point Scales!
di: Gupta, Tanmaey, et al.
Pubblicazione: (2026)
di: Gupta, Tanmaey, et al.
Pubblicazione: (2026)
Concorde: Fast and Accurate CPU Performance Modeling with Compositional Analytical-ML Fusion
di: Nasr-Esfahany, Arash, et al.
Pubblicazione: (2025)
di: Nasr-Esfahany, Arash, et al.
Pubblicazione: (2025)
Understanding the Performance Horizon of the Latest ML Workloads with NonGEMM Workloads
di: Karami, Rachid, et al.
Pubblicazione: (2024)
di: Karami, Rachid, et al.
Pubblicazione: (2024)
Prefill vs. Decode Bottlenecks: SRAM-Frequency Tradeoffs and the Memory-Bandwidth Ceiling
di: Atmer, Hannah, et al.
Pubblicazione: (2025)
di: Atmer, Hannah, et al.
Pubblicazione: (2025)
Graph neural networks with configuration cross-attention for tensor compilers
di: Khizbullin, Dmitrii, et al.
Pubblicazione: (2024)
di: Khizbullin, Dmitrii, et al.
Pubblicazione: (2024)
LLM-Driven Design Space Exploration of FPGA-based Accelerators
di: Sharma, Vinamra, et al.
Pubblicazione: (2026)
di: Sharma, Vinamra, et al.
Pubblicazione: (2026)
Taming Wild Branches: Overcoming Hard-to-Predict Branches using the Bullseye Predictor
di: Behrendt, Emet, et al.
Pubblicazione: (2025)
di: Behrendt, Emet, et al.
Pubblicazione: (2025)
GDEV-AI: A Generalized Evaluation of Deep Learning Inference Scaling and Architectural Saturation
di: Palaniappan, Kathiravan
Pubblicazione: (2026)
di: Palaniappan, Kathiravan
Pubblicazione: (2026)
Explainable Fuzzy Neural Network with Multi-Fidelity Reinforcement Learning for Micro-Architecture Design Space Exploration
di: Fan, Hanwei, et al.
Pubblicazione: (2024)
di: Fan, Hanwei, et al.
Pubblicazione: (2024)
Gem5-AcceSys: Enabling System-Level Exploration of Standard Interconnects for Novel Accelerators
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
Characterizing and Optimizing Realistic Workloads on a Commercial Compute-in-SRAM Device
di: Zhang, Niansong, et al.
Pubblicazione: (2025)
di: Zhang, Niansong, et al.
Pubblicazione: (2025)
PPU: Design and Implementation of a Pipelined Full Posit Processing Unit
di: Rossi, Federico, et al.
Pubblicazione: (2023)
di: Rossi, Federico, et al.
Pubblicazione: (2023)
NSFlow: An End-to-End FPGA Framework with Scalable Dataflow Architecture for Neuro-Symbolic AI
di: Yang, Hanchen, et al.
Pubblicazione: (2025)
di: Yang, Hanchen, et al.
Pubblicazione: (2025)
Improving the Serving Performance of Multi-LoRA Large Language Models via Efficient LoRA and KV Cache Management
di: Zhang, Hang, et al.
Pubblicazione: (2025)
di: Zhang, Hang, et al.
Pubblicazione: (2025)
Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling
di: Patwari, Rajeev, et al.
Pubblicazione: (2025)
di: Patwari, Rajeev, et al.
Pubblicazione: (2025)
Automatic Generation of Fast and Accurate Performance Models for Deep Neural Network Accelerators
di: Lübeck, Konstantin, et al.
Pubblicazione: (2024)
di: Lübeck, Konstantin, et al.
Pubblicazione: (2024)
LowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits
di: Zhou, Zikai, et al.
Pubblicazione: (2025)
di: Zhou, Zikai, et al.
Pubblicazione: (2025)
Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes
di: Hendria, Willy Fitra
Pubblicazione: (2026)
di: Hendria, Willy Fitra
Pubblicazione: (2026)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2025)
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2025)
RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis
di: Bi, Zhen, et al.
Pubblicazione: (2026)
di: Bi, Zhen, et al.
Pubblicazione: (2026)
FlexiSAGA: A Flexible Systolic Array GEMM Accelerator for Sparse and Dense Processing
di: Müller, Mika Markus, et al.
Pubblicazione: (2025)
di: Müller, Mika Markus, et al.
Pubblicazione: (2025)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
di: Chhugani, Jatin, et al.
Pubblicazione: (2026)
di: Chhugani, Jatin, et al.
Pubblicazione: (2026)
It's all about PR -- Smart Benchmarking AI Accelerators using Performance Representatives
di: Jung, Alexander Louis-Ferdinand, et al.
Pubblicazione: (2024)
di: Jung, Alexander Louis-Ferdinand, et al.
Pubblicazione: (2024)
Characterizing and Understanding HGNN Training on GPUs
di: Han, Dengke, et al.
Pubblicazione: (2024)
di: Han, Dengke, et al.
Pubblicazione: (2024)
Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEs
di: Chrapek, Marcin, et al.
Pubblicazione: (2025)
di: Chrapek, Marcin, et al.
Pubblicazione: (2025)
CXL-Interference: Analysis and Characterization in Modern Computer Systems
di: Mao, Shunyu, et al.
Pubblicazione: (2024)
di: Mao, Shunyu, et al.
Pubblicazione: (2024)
An Analytical Cost Model for Fast Evaluation of Multiple Compute-Engine CNN Accelerators
di: Qararyah, Fareed, et al.
Pubblicazione: (2025)
di: Qararyah, Fareed, et al.
Pubblicazione: (2025)
Evaluating Emerging AI/ML Accelerators: IPU, RDU, and NVIDIA/AMD GPUs
di: Peng, Hongwu, et al.
Pubblicazione: (2023)
di: Peng, Hongwu, et al.
Pubblicazione: (2023)
Towards CPU Performance Prediction: New Challenge Benchmark Dataset and Novel Approach
di: Liu, Xiaoman
Pubblicazione: (2024)
di: Liu, Xiaoman
Pubblicazione: (2024)
Documenti analoghi
-
D-com: Accelerating Iterative Processing to Enable Low-rank Decomposition of Activations
di: Tahmasebi, Faraz, et al.
Pubblicazione: (2025) -
OPTIMA: Design-Space Exploration of Discharge-Based In-SRAM Computing: Quantifying Energy-Accuracy Trade-Offs
di: Seyedfaraji, Saeed, et al.
Pubblicazione: (2024) -
DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance
di: Palaniappan, Kathiravan
Pubblicazione: (2026) -
A2Q+: Improving Accumulator-Aware Weight Quantization
di: Colbert, Ian, et al.
Pubblicazione: (2024) -
Toward A Formalized Approach for Spike Sorting Algorithms and Hardware Evaluation
di: Zhang, Tim, et al.
Pubblicazione: (2022)