Gespeichert in:
| Hauptverfasser: | Pan, Yunjie, Yang, Yongyi, Yang, Hanmei, Mahlke, Scott |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2602.01410 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
von: Chhugani, Jatin, et al.
Veröffentlicht: (2026)
von: Chhugani, Jatin, et al.
Veröffentlicht: (2026)
MiCo: End-to-End Mixed Precision Neural Network Co-Exploration Framework for Edge AI
von: Jiang, Zijun, et al.
Veröffentlicht: (2025)
von: Jiang, Zijun, et al.
Veröffentlicht: (2025)
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
von: Kim, Daeun, et al.
Veröffentlicht: (2025)
von: Kim, Daeun, et al.
Veröffentlicht: (2025)
MaRVIn: A Cross-Layer Mixed-Precision RISC-V Framework for DNN Inference, from ISA Extension to Hardware Acceleration
von: Armeniakos, Giorgos, et al.
Veröffentlicht: (2025)
von: Armeniakos, Giorgos, et al.
Veröffentlicht: (2025)
A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
von: Killian, Earl
Veröffentlicht: (2026)
von: Killian, Earl
Veröffentlicht: (2026)
vTrain: A Simulation Framework for Evaluating Cost-effective and Compute-optimal Large Language Model Training
von: Bang, Jehyeon, et al.
Veröffentlicht: (2023)
von: Bang, Jehyeon, et al.
Veröffentlicht: (2023)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
von: Hooper, Coleman, et al.
Veröffentlicht: (2025)
von: Hooper, Coleman, et al.
Veröffentlicht: (2025)
Smart-Infinity: Fast Large Language Model Training using Near-Storage Processing on a Real System
von: Jang, Hongsun, et al.
Veröffentlicht: (2024)
von: Jang, Hongsun, et al.
Veröffentlicht: (2024)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
Leveraging Stochastic Depth Training for Adaptive Inference
von: Korol, Guilherme, et al.
Veröffentlicht: (2025)
von: Korol, Guilherme, et al.
Veröffentlicht: (2025)
FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs
von: Xie, Xilong, et al.
Veröffentlicht: (2025)
von: Xie, Xilong, et al.
Veröffentlicht: (2025)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
von: Ma, Shaobo, et al.
Veröffentlicht: (2024)
von: Ma, Shaobo, et al.
Veröffentlicht: (2024)
SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision
von: Choi, Yuseon, et al.
Veröffentlicht: (2025)
von: Choi, Yuseon, et al.
Veröffentlicht: (2025)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
von: Huang, Wei, et al.
Veröffentlicht: (2023)
von: Huang, Wei, et al.
Veröffentlicht: (2023)
LLM-USO: Large Language Model-based Universal Sizing Optimizer
von: S, Karthik Somayaji N., et al.
Veröffentlicht: (2025)
von: S, Karthik Somayaji N., et al.
Veröffentlicht: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
von: Zhang, Chengming, et al.
Veröffentlicht: (2024)
von: Zhang, Chengming, et al.
Veröffentlicht: (2024)
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
von: Sharma, Amit
Veröffentlicht: (2025)
von: Sharma, Amit
Veröffentlicht: (2025)
Accelerating Neural Networks for Large Language Models and Graph Processing with Silicon Photonics
von: Afifi, Salma, et al.
Veröffentlicht: (2024)
von: Afifi, Salma, et al.
Veröffentlicht: (2024)
Tender: Accelerating Large Language Models via Tensor Decomposition and Runtime Requantization
von: Lee, Jungi, et al.
Veröffentlicht: (2024)
von: Lee, Jungi, et al.
Veröffentlicht: (2024)
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
von: Lee, Jungi, et al.
Veröffentlicht: (2025)
von: Lee, Jungi, et al.
Veröffentlicht: (2025)
Memory Access Characterization of Large Language Models in CPU Environment and its Potential Impacts
von: Banasik, Spencer
Veröffentlicht: (2025)
von: Banasik, Spencer
Veröffentlicht: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
von: Kim, Wonung, et al.
Veröffentlicht: (2025)
von: Kim, Wonung, et al.
Veröffentlicht: (2025)
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
von: Zhang, Zixi, et al.
Veröffentlicht: (2023)
von: Zhang, Zixi, et al.
Veröffentlicht: (2023)
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
von: Gimenes, Pedro, et al.
Veröffentlicht: (2025)
von: Gimenes, Pedro, et al.
Veröffentlicht: (2025)
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
von: Cho, Eunyeong, et al.
Veröffentlicht: (2026)
von: Cho, Eunyeong, et al.
Veröffentlicht: (2026)
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
von: Yun, Sungmin, et al.
Veröffentlicht: (2024)
von: Yun, Sungmin, et al.
Veröffentlicht: (2024)
Energy Efficient Software Hardware CoDesign for Machine Learning: From TinyML to Large Language Models
von: Vahdatpour, Mohammad Saleh, et al.
Veröffentlicht: (2026)
von: Vahdatpour, Mohammad Saleh, et al.
Veröffentlicht: (2026)
GPT4AIGChip: Towards Next-Generation AI Accelerator Design Automation via Large Language Models
von: Fu, Yonggan, et al.
Veröffentlicht: (2023)
von: Fu, Yonggan, et al.
Veröffentlicht: (2023)
LLM-VeriPPA: Power, Performance, and Area Optimization aware Verilog Code Generation with Large Language Models
von: Thorat, Kiran, et al.
Veröffentlicht: (2025)
von: Thorat, Kiran, et al.
Veröffentlicht: (2025)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
von: Cong, Rongqing, et al.
Veröffentlicht: (2024)
von: Cong, Rongqing, et al.
Veröffentlicht: (2024)
Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications
von: Li, Yang, et al.
Veröffentlicht: (2024)
von: Li, Yang, et al.
Veröffentlicht: (2024)
Intelligent4DSE: Optimizing High-Level Synthesis Design Space Exploration with Graph Neural Networks and Large Language Models
von: Xu, Lei, et al.
Veröffentlicht: (2025)
von: Xu, Lei, et al.
Veröffentlicht: (2025)
Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification
von: Pinckney, Nathaniel, et al.
Veröffentlicht: (2025)
von: Pinckney, Nathaniel, et al.
Veröffentlicht: (2025)
CIMFlow: An Integrated Framework for Systematic Design and Evaluation of Digital CIM Architectures
von: Qi, Yingjie, et al.
Veröffentlicht: (2025)
von: Qi, Yingjie, et al.
Veröffentlicht: (2025)
ChipExpert: The Open-Source Integrated-Circuit-Design-Specific Large Language Model
von: Xu, Ning, et al.
Veröffentlicht: (2024)
von: Xu, Ning, et al.
Veröffentlicht: (2024)
Rescaling-Aware Training for Efficient Deployment of Deep Learning Models on Full-Integer Hardware
von: Mueller, Lion, et al.
Veröffentlicht: (2025)
von: Mueller, Lion, et al.
Veröffentlicht: (2025)
HDLxGraph: Bridging Large Language Models and HDL Repositories via HDL Graph Databases
von: Zheng, Pingqing, et al.
Veröffentlicht: (2025)
von: Zheng, Pingqing, et al.
Veröffentlicht: (2025)
SONIQ: System-Optimized Noise-Injected Ultra-Low-Precision Quantization with Full-Precision Parity
von: Zhou, Cyrus, et al.
Veröffentlicht: (2023)
von: Zhou, Cyrus, et al.
Veröffentlicht: (2023)
Efficient VQ-QAT and Mixed Vector/Linear quantized Neural Networks
von: Gou, Terry, et al.
Veröffentlicht: (2026)
von: Gou, Terry, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
von: Chhugani, Jatin, et al.
Veröffentlicht: (2026) -
MiCo: End-to-End Mixed Precision Neural Network Co-Exploration Framework for Edge AI
von: Jiang, Zijun, et al.
Veröffentlicht: (2025) -
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
von: Kim, Daeun, et al.
Veröffentlicht: (2025) -
MaRVIn: A Cross-Layer Mixed-Precision RISC-V Framework for DNN Inference, from ISA Extension to Hardware Acceleration
von: Armeniakos, Giorgos, et al.
Veröffentlicht: (2025) -
A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
von: Killian, Earl
Veröffentlicht: (2026)