31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Dong, Pingcheng, Tan, Yonghao, Liu, Xuejiao, Luo, Peng, Liu, Yu, Pang, Di, Ma, Songchen, Huang, Xijie, Liu, Shih-Yang, Zhang, Dong, Lu, Zhichao, Liang, Luhong, Tsui, Chi-Ying, Tu, Fengbin, Zhao, Liang, Cheng, Kwang-Ting
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!