Pushing the Limits of BFP on Narrow Precision LLM Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Hui, Cheng, Yuan, Han, Xiaomeng, Zhao, Zhengpeng, Yang, Dawei, Jiang, Zhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NVR: Vector Runahead on NPUs for Sparse Memory Access
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
From Characterization to Microarchitecture: Designing an Elegant and Reliable BFP-Based NPU
di: Zhang, Jie, et al.
Pubblicazione: (2026)
di: Zhang, Jie, et al.
Pubblicazione: (2026)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
ReChisel: Effective Automatic Chisel Code Generation by LLM with Reflection
di: Niu, Juxin, et al.
Pubblicazione: (2025)
di: Niu, Juxin, et al.
Pubblicazione: (2025)
LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
di: He, Zifan, et al.
Pubblicazione: (2025)
di: He, Zifan, et al.
Pubblicazione: (2025)
Insights from Verification: Training a Verilog Generation LLM with Reinforcement Learning with Testbench Feedback
di: Wang, Ning, et al.
Pubblicazione: (2025)
di: Wang, Ning, et al.
Pubblicazione: (2025)
Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
di: Kim, Dowon, et al.
Pubblicazione: (2025)
di: Kim, Dowon, et al.
Pubblicazione: (2025)
BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models
di: Han, Xiaomeng, et al.
Pubblicazione: (2025)
di: Han, Xiaomeng, et al.
Pubblicazione: (2025)
From Concept to Practice: an Automated LLM-aided UVM Machine for RTL Verification
di: Ye, Junhao, et al.
Pubblicazione: (2025)
di: Ye, Junhao, et al.
Pubblicazione: (2025)
FlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs
di: Zeng, Shulin, et al.
Pubblicazione: (2024)
di: Zeng, Shulin, et al.
Pubblicazione: (2024)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
Efficient LLM inference solution on Intel GPU
di: Wu, Hui, et al.
Pubblicazione: (2023)
di: Wu, Hui, et al.
Pubblicazione: (2023)
Comparative Characterization of KV Cache Management Strategies for LLM Inference
di: Mamo, Oteo, et al.
Pubblicazione: (2026)
di: Mamo, Oteo, et al.
Pubblicazione: (2026)
ELSA: An ELastic SNN Inference Architecture for Efficient Neuromorphic Computing
di: You, Kang, et al.
Pubblicazione: (2026)
di: You, Kang, et al.
Pubblicazione: (2026)
Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts
di: Yun, Sungmin, et al.
Pubblicazione: (2025)
di: Yun, Sungmin, et al.
Pubblicazione: (2025)
Sangam: Chiplet-Based DRAM-PIM Accelerator with CXL Integration for LLM Inferencing
di: Kiyawat, Khyati, et al.
Pubblicazione: (2025)
di: Kiyawat, Khyati, et al.
Pubblicazione: (2025)
PIMphony: Overcoming Bandwidth and Capacity Inefficiency in PIM-based Long-Context LLM Inference System
di: Kwon, Hyucksung, et al.
Pubblicazione: (2024)
di: Kwon, Hyucksung, et al.
Pubblicazione: (2024)
When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference
di: Li, Pu, et al.
Pubblicazione: (2026)
di: Li, Pu, et al.
Pubblicazione: (2026)
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
di: Gimenes, Pedro, et al.
Pubblicazione: (2025)
di: Gimenes, Pedro, et al.
Pubblicazione: (2025)
Large Language Model for Verilog Generation with Code-Structure-Guided Reinforcement Learning
di: Wang, Ning, et al.
Pubblicazione: (2024)
di: Wang, Ning, et al.
Pubblicazione: (2024)
POET: Power-Oriented Evolutionary Tuning for LLM-Based RTL PPA Optimization
di: Ping, Heng, et al.
Pubblicazione: (2026)
di: Ping, Heng, et al.
Pubblicazione: (2026)
Production-Grade Local LLM Inference on Apple Silicon: A Comparative Study of MLX, MLC-LLM, Ollama, llama.cpp, and PyTorch MPS
di: Rajesh, Varun, et al.
Pubblicazione: (2025)
di: Rajesh, Varun, et al.
Pubblicazione: (2025)
HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference
di: Negi, Shubham, et al.
Pubblicazione: (2025)
di: Negi, Shubham, et al.
Pubblicazione: (2025)
ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators
di: Zou, Guoqiang, et al.
Pubblicazione: (2025)
di: Zou, Guoqiang, et al.
Pubblicazione: (2025)
LLM4EDA: Emerging Progress in Large Language Models for Electronic Design Automation
di: Zhong, Ruizhe, et al.
Pubblicazione: (2023)
di: Zhong, Ruizhe, et al.
Pubblicazione: (2023)
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
di: Ma, Shaobo, et al.
Pubblicazione: (2025)
di: Ma, Shaobo, et al.
Pubblicazione: (2025)
Location is Key: Leveraging Large Language Model for Functional Bug Localization in Verilog
di: Yao, Bingkun, et al.
Pubblicazione: (2024)
di: Yao, Bingkun, et al.
Pubblicazione: (2024)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
di: Fang, Yunhua, et al.
Pubblicazione: (2025)
di: Fang, Yunhua, et al.
Pubblicazione: (2025)
LLM-DSE: Searching Accelerator Parameters with LLM Agents
di: Wang, Hanyu, et al.
Pubblicazione: (2025)
di: Wang, Hanyu, et al.
Pubblicazione: (2025)
Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
di: Chen, Chun-Ting, et al.
Pubblicazione: (2025)
di: Chen, Chun-Ting, et al.
Pubblicazione: (2025)
KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
di: Deng, Lishuo, et al.
Pubblicazione: (2025)
di: Deng, Lishuo, et al.
Pubblicazione: (2025)
LUMINA: LLM-Guided GPU Architecture Exploration via Bottleneck Analysis
di: Zhang, Tao, et al.
Pubblicazione: (2026)
di: Zhang, Tao, et al.
Pubblicazione: (2026)
Enable Lightweight and Precision-Scalable Posit/IEEE-754 Arithmetic in RISC-V Cores for Transprecision Computing
di: Li, Qiong, et al.
Pubblicazione: (2025)
di: Li, Qiong, et al.
Pubblicazione: (2025)
VeriDebug: A Unified LLM for Verilog Debugging via Contrastive Embedding and Guided Correction
di: Wang, Ning, et al.
Pubblicazione: (2025)
di: Wang, Ning, et al.
Pubblicazione: (2025)
Silicon Showdown: Performance, Efficiency, and Ecosystem Barriers in Consumer-Grade LLM Inference
di: Javat, Abdurrahman, et al.
Pubblicazione: (2026)
di: Javat, Abdurrahman, et al.
Pubblicazione: (2026)
AssertLLM2: A Comprehensive LLM Benchmark for Assertion Generation from Design Specifications
di: Wu, Yuchao, et al.
Pubblicazione: (2026)
di: Wu, Yuchao, et al.
Pubblicazione: (2026)
STELLAR: Structure-guided LLM Assertion Retrieval and Generation for Formal Verification
di: Rajabi, Saeid, et al.
Pubblicazione: (2025)
di: Rajabi, Saeid, et al.
Pubblicazione: (2025)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
di: Liang, Yanbiao, et al.
Pubblicazione: (2025)
di: Liang, Yanbiao, et al.
Pubblicazione: (2025)
ChipMind: Retrieval-Augmented Reasoning for Long-Context Circuit Design Specifications
di: Xing, Changwen, et al.
Pubblicazione: (2025)
di: Xing, Changwen, et al.
Pubblicazione: (2025)
IICPilot: An Intelligent Integrated Circuit Backend Design Framework Using Open EDA
di: Jiang, Zesong, et al.
Pubblicazione: (2024)
di: Jiang, Zesong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
NVR: Vector Runahead on NPUs for Sparse Memory Access
di: Wang, Hui, et al.
Pubblicazione: (2025) -
From Characterization to Microarchitecture: Designing an Elegant and Reliable BFP-Based NPU
di: Zhang, Jie, et al.
Pubblicazione: (2026) -
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
di: Wang, Xinyu, et al.
Pubblicazione: (2026) -
ReChisel: Effective Automatic Chisel Code Generation by LLM with Reflection
di: Niu, Juxin, et al.
Pubblicazione: (2025) -
LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
di: He, Zifan, et al.
Pubblicazione: (2025)