31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Dong, Pingcheng, Tan, Yonghao, Liu, Xuejiao, Luo, Peng, Liu, Yu, Pang, Di, Ma, Songchen, Huang, Xijie, Liu, Shih-Yang, Zhang, Dong, Lu, Zhichao, Liang, Luhong, Tsui, Chi-Ying, Tu, Fengbin, Zhao, Liang, Cheng, Kwang-Ting
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!

Ähnliche Einträge