Enregistré dans:
| Auteurs principaux: | S, Karthik Somayaji N., Li, Peng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.02764 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLM-VeriPPA: Power, Performance, and Area Optimization aware Verilog Code Generation with Large Language Models
par: Thorat, Kiran, et autres
Publié: (2025)
par: Thorat, Kiran, et autres
Publié: (2025)
LLM-based AI Agent for Sizing of Analog and Mixed Signal Circuit
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
par: Zhang, Chengming, et autres
Publié: (2024)
par: Zhang, Chengming, et autres
Publié: (2024)
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
par: Zhang, Zixi, et autres
Publié: (2023)
par: Zhang, Zixi, et autres
Publié: (2023)
EEsizer: LLM-Based AI Agent for Sizing of Analog and Mixed Signal Circuit
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
par: Cho, Eunyeong, et autres
Publié: (2026)
par: Cho, Eunyeong, et autres
Publié: (2026)
Intelligent4DSE: Optimizing High-Level Synthesis Design Space Exploration with Graph Neural Networks and Large Language Models
par: Xu, Lei, et autres
Publié: (2025)
par: Xu, Lei, et autres
Publié: (2025)
GPT4AIGChip: Towards Next-Generation AI Accelerator Design Automation via Large Language Models
par: Fu, Yonggan, et autres
Publié: (2023)
par: Fu, Yonggan, et autres
Publié: (2023)
Learning-driven Physically-aware Large-scale Circuit Gate Sizing
par: Ye, Yuyang, et autres
Publié: (2024)
par: Ye, Yuyang, et autres
Publié: (2024)
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
par: Sharma, Amit
Publié: (2025)
par: Sharma, Amit
Publié: (2025)
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
par: Lee, Jungi, et autres
Publié: (2025)
par: Lee, Jungi, et autres
Publié: (2025)
SNIP: An Adaptive Mixed Precision Framework for Subbyte Large Language Model Training
par: Pan, Yunjie, et autres
Publié: (2026)
par: Pan, Yunjie, et autres
Publié: (2026)
Accelerating Neural Networks for Large Language Models and Graph Processing with Silicon Photonics
par: Afifi, Salma, et autres
Publié: (2024)
par: Afifi, Salma, et autres
Publié: (2024)
Tender: Accelerating Large Language Models via Tensor Decomposition and Runtime Requantization
par: Lee, Jungi, et autres
Publié: (2024)
par: Lee, Jungi, et autres
Publié: (2024)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
par: Chen, Yanru, et autres
Publié: (2025)
par: Chen, Yanru, et autres
Publié: (2025)
Memory Access Characterization of Large Language Models in CPU Environment and its Potential Impacts
par: Banasik, Spencer
Publié: (2025)
par: Banasik, Spencer
Publié: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
par: Kim, Wonung, et autres
Publié: (2025)
par: Kim, Wonung, et autres
Publié: (2025)
A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
par: Killian, Earl
Publié: (2026)
par: Killian, Earl
Publié: (2026)
AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
par: Ahmadzadeh, Mohsen, et autres
Publié: (2025)
par: Ahmadzadeh, Mohsen, et autres
Publié: (2025)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
par: Wolters, Christopher, et autres
Publié: (2024)
par: Wolters, Christopher, et autres
Publié: (2024)
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
par: Yun, Sungmin, et autres
Publié: (2024)
par: Yun, Sungmin, et autres
Publié: (2024)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
par: Yadav, Divakar Kumar, et autres
Publié: (2026)
par: Yadav, Divakar Kumar, et autres
Publié: (2026)
Energy Efficient Software Hardware CoDesign for Machine Learning: From TinyML to Large Language Models
par: Vahdatpour, Mohammad Saleh, et autres
Publié: (2026)
par: Vahdatpour, Mohammad Saleh, et autres
Publié: (2026)
Smart-Infinity: Fast Large Language Model Training using Near-Storage Processing on a Real System
par: Jang, Hongsun, et autres
Publié: (2024)
par: Jang, Hongsun, et autres
Publié: (2024)
Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification
par: Pinckney, Nathaniel, et autres
Publié: (2025)
par: Pinckney, Nathaniel, et autres
Publié: (2025)
An FPGA-Based Accelerator Enabling Efficient Support for CNNs with Arbitrary Kernel Sizes
par: Wang, Miaoxin, et autres
Publié: (2024)
par: Wang, Miaoxin, et autres
Publié: (2024)
Zero-Space Cost Fault Tolerance for Transformer-based Language Models on ReRAM
par: Li, Bingbing, et autres
Publié: (2024)
par: Li, Bingbing, et autres
Publié: (2024)
AutoPPA: Automated Circuit PPA Optimization via Contrastive Code-based Rule Library Learning
par: Li, Chongxiao, et autres
Publié: (2026)
par: Li, Chongxiao, et autres
Publié: (2026)
Hardware Software Optimizations for Fast Model Recovery on Reconfigurable Architectures
par: Xu, Bin, et autres
Publié: (2025)
par: Xu, Bin, et autres
Publié: (2025)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
par: Xiang, Maoyang, et autres
Publié: (2025)
par: Xiang, Maoyang, et autres
Publié: (2025)
KLLM: Fast LLM Inference with K-Means Quantization
par: Wu, Xueying, et autres
Publié: (2025)
par: Wu, Xueying, et autres
Publié: (2025)
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
par: Yubeaton, Patrick, et autres
Publié: (2025)
par: Yubeaton, Patrick, et autres
Publié: (2025)
FP6-LLM: Efficiently Serving Large Language Models Through FP6-Centric Algorithm-System Co-Design
par: Xia, Haojun, et autres
Publié: (2024)
par: Xia, Haojun, et autres
Publié: (2024)
CATransformers: Carbon Aware Transformers Through Joint Model-Hardware Optimization
par: Wang, Irene, et autres
Publié: (2025)
par: Wang, Irene, et autres
Publié: (2025)
When Forgetting Builds Reliability: LLM Unlearning for Reliable Hardware Code Generation
par: Liang, Yiwen, et autres
Publié: (2025)
par: Liang, Yiwen, et autres
Publié: (2025)
MPM-LLM4DSE: Reaching the Pareto Frontier in HLS with Multimodal Learning and LLM-Driven Exploration
par: Xu, Lei, et autres
Publié: (2026)
par: Xu, Lei, et autres
Publié: (2026)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
par: Duan, Bowen, et autres
Publié: (2026)
par: Duan, Bowen, et autres
Publié: (2026)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
par: Chen, Yuzong, et autres
Publié: (2025)
par: Chen, Yuzong, et autres
Publié: (2025)
Designing Efficient LLM Accelerators for Edge Devices
par: Haris, Jude, et autres
Publié: (2024)
par: Haris, Jude, et autres
Publié: (2024)
Documents similaires
-
LLM-VeriPPA: Power, Performance, and Area Optimization aware Verilog Code Generation with Large Language Models
par: Thorat, Kiran, et autres
Publié: (2025) -
LLM-based AI Agent for Sizing of Analog and Mixed Signal Circuit
par: Liu, Chang, et autres
Publié: (2025) -
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
par: Zhang, Chengming, et autres
Publié: (2024) -
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
par: Zhang, Zixi, et autres
Publié: (2023) -
EEsizer: LLM-Based AI Agent for Sizing of Analog and Mixed Signal Circuit
par: Liu, Chang, et autres
Publié: (2025)