AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zirui, Ma, Zhihua, Fan, Wenxing, Li, Haibin, Wu, Fulin, Zhang, Xiaochun, Ye, Wenming, Li |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Survey on Characterizing and Understanding GNNs from a Computer Architecture Perspective
von: Wu, Meng, et al.
Veröffentlicht: (2024)
von: Wu, Meng, et al.
Veröffentlicht: (2024)
StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer
von: Qin, Shantian, et al.
Veröffentlicht: (2025)
von: Qin, Shantian, et al.
Veröffentlicht: (2025)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
von: Wu, Haibin, et al.
Veröffentlicht: (2024)
von: Wu, Haibin, et al.
Veröffentlicht: (2024)
Accelerating Mini-batch HGNN Training by Reducing CUDA Kernels
von: Wu, Meng, et al.
Veröffentlicht: (2024)
von: Wu, Meng, et al.
Veröffentlicht: (2024)
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
von: He, Siyuan, et al.
Veröffentlicht: (2025)
von: He, Siyuan, et al.
Veröffentlicht: (2025)
A Systematic Characterization of LLM Inference on GPUs
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
von: Zhong, Linfeng, et al.
Veröffentlicht: (2025)
von: Zhong, Linfeng, et al.
Veröffentlicht: (2025)
GDR-HGNN: A Heterogeneous Graph Neural Networks Accelerator Frontend with Graph Decoupling and Recoupling
von: Xue, Runzhen, et al.
Veröffentlicht: (2024)
von: Xue, Runzhen, et al.
Veröffentlicht: (2024)
Overmind NSA: A Unified Neuro-Symbolic Computing Architecture with Approximate Nonlinear Activations and Preemptive Memory Bypass
von: Wang, Weilun, et al.
Veröffentlicht: (2026)
von: Wang, Weilun, et al.
Veröffentlicht: (2026)
From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
von: Zhao, Yushu, et al.
Veröffentlicht: (2025)
von: Zhao, Yushu, et al.
Veröffentlicht: (2025)
Cambricon-LLM: A Chiplet-Based Hybrid Architecture for On-Device Inference of 70B LLM
von: Yu, Zhongkai, et al.
Veröffentlicht: (2024)
von: Yu, Zhongkai, et al.
Veröffentlicht: (2024)
HiHGNN: Accelerating HGNNs through Parallelism and Data Reusability Exploitation
von: Xue, Runzhen, et al.
Veröffentlicht: (2023)
von: Xue, Runzhen, et al.
Veröffentlicht: (2023)
Linear Complexity Fermionic Simulation on Quantum Devices with Hardware Connectivity Constraints
von: Gao, Xiangyu, et al.
Veröffentlicht: (2026)
von: Gao, Xiangyu, et al.
Veröffentlicht: (2026)
ADE-HGNN: Accelerating HGNNs through Attention Disparity Exploitation
von: Han, Dengke, et al.
Veröffentlicht: (2024)
von: Han, Dengke, et al.
Veröffentlicht: (2024)
AssertGen: Enhancement of LLM-aided Assertion Generation through Cross-Layer Signal Bridging
von: Lyu, Hongqin, et al.
Veröffentlicht: (2025)
von: Lyu, Hongqin, et al.
Veröffentlicht: (2025)
TLV-HGNN: Thinking Like a Vertex for Memory-efficient HGNN Inference
von: Han, Dengke, et al.
Veröffentlicht: (2025)
von: Han, Dengke, et al.
Veröffentlicht: (2025)
CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device
von: Lin, Ye, et al.
Veröffentlicht: (2026)
von: Lin, Ye, et al.
Veröffentlicht: (2026)
NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference
von: Hao, Mingbo, et al.
Veröffentlicht: (2026)
von: Hao, Mingbo, et al.
Veröffentlicht: (2026)
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding
von: Dong, Pingcheng, et al.
Veröffentlicht: (2026)
von: Dong, Pingcheng, et al.
Veröffentlicht: (2026)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
von: Duan, Bowen, et al.
Veröffentlicht: (2026)
von: Duan, Bowen, et al.
Veröffentlicht: (2026)
Pushing up to the Limit of Memory Bandwidth and Capacity Utilization for Efficient LLM Decoding on Embedded FPGA
von: Li, Jindong, et al.
Veröffentlicht: (2025)
von: Li, Jindong, et al.
Veröffentlicht: (2025)
To Overlay or to Customize? Revisiting Architectural Choices in Heterogeneous Systems
von: Chen, Xingzhen, et al.
Veröffentlicht: (2026)
von: Chen, Xingzhen, et al.
Veröffentlicht: (2026)
Accelerating GNN Training through Locality-aware Dropout and Merge
von: Sun, Gongjian, et al.
Veröffentlicht: (2025)
von: Sun, Gongjian, et al.
Veröffentlicht: (2025)
LIMINAL: Exploring The Frontiers of LLM Decode Performance
von: Davies, Michael, et al.
Veröffentlicht: (2025)
von: Davies, Michael, et al.
Veröffentlicht: (2025)
PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
EdgeLLM: A Highly Efficient CPU-FPGA Heterogeneous Edge Accelerator for Large Language Models
von: Huang, Mingqiang, et al.
Veröffentlicht: (2024)
von: Huang, Mingqiang, et al.
Veröffentlicht: (2024)
Towards Generalized On-Chip Communication for Programmable Accelerators in Heterogeneous Architectures
von: Zuckerman, Joseph, et al.
Veröffentlicht: (2024)
von: Zuckerman, Joseph, et al.
Veröffentlicht: (2024)
RHS-TRNG: A Resilient High-Speed True Random Number Generator Based on STT-MTJ Device
von: Fu, Siqing, et al.
Veröffentlicht: (2023)
von: Fu, Siqing, et al.
Veröffentlicht: (2023)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
von: Xuan, Zihao, et al.
Veröffentlicht: (2026)
von: Xuan, Zihao, et al.
Veröffentlicht: (2026)
Benchmarking and Dissecting the Nvidia Hopper GPU Architecture
von: Luo, Weile, et al.
Veröffentlicht: (2024)
von: Luo, Weile, et al.
Veröffentlicht: (2024)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)
SAMIPS: A Synthesised Asynchronous Processor
von: Zhang, Qianyi, et al.
Veröffentlicht: (2024)
von: Zhang, Qianyi, et al.
Veröffentlicht: (2024)
Bitwise Logic Using Phase Change Memory Devices Based on the Pinatubo Architecture
von: Aflalo, Noa, et al.
Veröffentlicht: (2024)
von: Aflalo, Noa, et al.
Veröffentlicht: (2024)
Optimized Memory System Architecture for VESA VDC-M Decoder with Multi-Slice Support
von: Yang, Hannah, et al.
Veröffentlicht: (2025)
von: Yang, Hannah, et al.
Veröffentlicht: (2025)
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
von: Huang, Zhirui, et al.
Veröffentlicht: (2025)
von: Huang, Zhirui, et al.
Veröffentlicht: (2025)
MetaDSE: A Few-shot Meta-learning Framework for Cross-workload CPU Design Space Exploration
von: Xue, Runzhen, et al.
Veröffentlicht: (2025)
von: Xue, Runzhen, et al.
Veröffentlicht: (2025)
Rethinking Compute Substrates for 3D-Stacked Near-Memory LLM Decoding: Microarchitecture-Scheduling Co-Design
von: Ai, Chenyang, et al.
Veröffentlicht: (2026)
von: Ai, Chenyang, et al.
Veröffentlicht: (2026)
VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
MCPT-Solver: An Monte Carlo Algorithm Solver Using MTJ Devices for Particle Transport Problems
von: Fu, Siqing, et al.
Veröffentlicht: (2026)
von: Fu, Siqing, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Survey on Characterizing and Understanding GNNs from a Computer Architecture Perspective
von: Wu, Meng, et al.
Veröffentlicht: (2024) -
StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer
von: Qin, Shantian, et al.
Veröffentlicht: (2025) -
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
von: Wu, Haibin, et al.
Veröffentlicht: (2024) -
Accelerating Mini-batch HGNN Training by Reducing CUDA Kernels
von: Wu, Meng, et al.
Veröffentlicht: (2024) -
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
von: He, Siyuan, et al.
Veröffentlicht: (2025)