Enregistré dans:
| Auteurs principaux: | Pan, Xiurui, Li, Endian, Li, Qiao, Liang, Shengwen, Shan, Yizhou, Zhou, Ke, Luo, Yingwei, Wang, Xiaolin, Zhang, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2409.04992 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Cost-Effective Near-Storage Processing Solution for Offline Inference of Long-Context LLMs
par: Jang, Hongsun, et autres
Publié: (2025)
par: Jang, Hongsun, et autres
Publié: (2025)
HillInfer: Efficient Long-Context LLM Inference on the Edge with Hierarchical KV Eviction using SmartSSD
par: Sun, He, et autres
Publié: (2026)
par: Sun, He, et autres
Publié: (2026)
GPU Acceleration of TFHE-Based High-Precision Nonlinear Layers for Encrypted LLM Inference
par: Chen, Guoci, et autres
Publié: (2026)
par: Chen, Guoci, et autres
Publié: (2026)
LLMulator: Generalizable Cost Modeling for Dataflow Accelerators with Input-Adaptive Control Flow
par: Chang, Kaiyan, et autres
Publié: (2025)
par: Chang, Kaiyan, et autres
Publié: (2025)
A Novel Extensible Simulation Framework for CXL-Enabled Systems
par: An, Yuda, et autres
Publié: (2024)
par: An, Yuda, et autres
Publié: (2024)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
par: Jayanth, Rakshith, et autres
Publié: (2026)
par: Jayanth, Rakshith, et autres
Publié: (2026)
Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference
par: Wu, Haoran, et autres
Publié: (2025)
par: Wu, Haoran, et autres
Publié: (2025)
An RDMA-First Object Storage System with SmartNIC Offload
par: Zhu, Yu, et autres
Publié: (2025)
par: Zhu, Yu, et autres
Publié: (2025)
UniCAIM: A Unified CAM/CIM Architecture with Static-Dynamic KV Cache Pruning for Efficient Long-Context LLM Inference
par: Xu, Weikai, et autres
Publié: (2025)
par: Xu, Weikai, et autres
Publié: (2025)
Cambricon-LLM: A Chiplet-Based Hybrid Architecture for On-Device Inference of 70B LLM
par: Yu, Zhongkai, et autres
Publié: (2024)
par: Yu, Zhongkai, et autres
Publié: (2024)
Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
Knowledge-Guided Attention-Inspired Learning for Task Offloading in Vehicle Edge Computing
par: Ma, Ke, et autres
Publié: (2025)
par: Ma, Ke, et autres
Publié: (2025)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
par: Meng, William, et autres
Publié: (2025)
par: Meng, William, et autres
Publié: (2025)
SSD Offloading for LLM Mixture-of-Experts Weights Considered Harmful in Energy Efficiency
par: Kyung, Kwanhee, et autres
Publié: (2025)
par: Kyung, Kwanhee, et autres
Publié: (2025)
Graphitron: A Domain Specific Language for FPGA-based Graph Processing Accelerator Generation
par: Zhang, Xinmiao, et autres
Publié: (2024)
par: Zhang, Xinmiao, et autres
Publié: (2024)
PIMphony: Overcoming Bandwidth and Capacity Inefficiency in PIM-based Long-Context LLM Inference System
par: Kwon, Hyucksung, et autres
Publié: (2024)
par: Kwon, Hyucksung, et autres
Publié: (2024)
L3: DIMM-PIM Integrated Architecture and Coordination for Scalable Long-Context LLM Inference
par: Liu, Qingyuan, et autres
Publié: (2025)
par: Liu, Qingyuan, et autres
Publié: (2025)
Lifecycle Cost-Effectiveness Modeling for Redundancy-Enhanced Multi-Chiplet Architectures
par: Liu, Zizhen, et autres
Publié: (2026)
par: Liu, Zizhen, et autres
Publié: (2026)
PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference
par: Hao, Mingbo, et autres
Publié: (2026)
par: Hao, Mingbo, et autres
Publié: (2026)
A Systematic Characterization of LLM Inference on GPUs
par: Wang, Haonan, et autres
Publié: (2025)
par: Wang, Haonan, et autres
Publié: (2025)
Convolutions Predictable Offloading to an Accelerator: Formalization and Optimization
par: Husson, Benjamin, et autres
Publié: (2026)
par: Husson, Benjamin, et autres
Publié: (2026)
TerEffic: Highly Efficient Ternary LLM Inference on FPGA
par: Yin, Chenyang, et autres
Publié: (2025)
par: Yin, Chenyang, et autres
Publié: (2025)
Bandwidth-Effective DRAM Cache for GPUs with Storage-Class Memory
par: Hong, Jeongmin, et autres
Publié: (2024)
par: Hong, Jeongmin, et autres
Publié: (2024)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
par: Liang, Yanbiao, et autres
Publié: (2025)
par: Liang, Yanbiao, et autres
Publié: (2025)
Mapping Space Exploration for Multi-Chiplet Accelerators Targeting LLM Inference Serving Workloads
par: Li, Boyu, et autres
Publié: (2025)
par: Li, Boyu, et autres
Publié: (2025)
Resilient and Secure Programmable System-on-Chip Accelerator Offload
par: Gouveia, Inês Pinto, et autres
Publié: (2024)
par: Gouveia, Inês Pinto, et autres
Publié: (2024)
OffRAC: Offloading Through Remote Accelerator Calls
par: Yang, Ziyi, et autres
Publié: (2025)
par: Yang, Ziyi, et autres
Publié: (2025)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
par: Xuan, Zihao, et autres
Publié: (2026)
par: Xuan, Zihao, et autres
Publié: (2026)
PermuteV: A Performant Side-channel-Resistant RISC-V Core Securing Edge AI Inference
par: Narkthong, Nuntipat, et autres
Publié: (2025)
par: Narkthong, Nuntipat, et autres
Publié: (2025)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
par: Jiang, Aojie, et autres
Publié: (2026)
par: Jiang, Aojie, et autres
Publié: (2026)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
par: Chen, Yanru, et autres
Publié: (2025)
par: Chen, Yanru, et autres
Publié: (2025)
Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts
par: Yun, Sungmin, et autres
Publié: (2025)
par: Yun, Sungmin, et autres
Publié: (2025)
Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding
par: Fan, Wang, et autres
Publié: (2026)
par: Fan, Wang, et autres
Publié: (2026)
Breaking the HBM Bit Cost Barrier: Domain-Specific ECC for AI Inference Infrastructure
par: Xie, Rui, et autres
Publié: (2025)
par: Xie, Rui, et autres
Publié: (2025)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Large Attention-Based Model Inference on Tile-Based Accelerators
par: Zhang, Chi, et autres
Publié: (2026)
par: Zhang, Chi, et autres
Publié: (2026)
Developing Cost-Effective Drones for 5G Non-Terrestrial Network Research and Experimentation
par: Cáceres, Carlos de Quinto, et autres
Publié: (2024)
par: Cáceres, Carlos de Quinto, et autres
Publié: (2024)
BitROM: Weight Reload-Free CiROM Architecture Towards Billion-Parameter 1.58-bit LLM Inference
par: Zhang, Wenlun, et autres
Publié: (2025)
par: Zhang, Wenlun, et autres
Publié: (2025)
T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
par: Wei, Jianyu, et autres
Publié: (2025)
par: Wei, Jianyu, et autres
Publié: (2025)
Documents similaires
-
A Cost-Effective Near-Storage Processing Solution for Offline Inference of Long-Context LLMs
par: Jang, Hongsun, et autres
Publié: (2025) -
HillInfer: Efficient Long-Context LLM Inference on the Edge with Hierarchical KV Eviction using SmartSSD
par: Sun, He, et autres
Publié: (2026) -
GPU Acceleration of TFHE-Based High-Precision Nonlinear Layers for Encrypted LLM Inference
par: Chen, Guoci, et autres
Publié: (2026) -
LLMulator: Generalizable Cost Modeling for Dataflow Accelerators with Input-Adaptive Control Flow
par: Chang, Kaiyan, et autres
Publié: (2025) -
A Novel Extensible Simulation Framework for CXL-Enabled Systems
par: An, Yuda, et autres
Publié: (2024)