Opt4GPTQ: Co-Optimizing Memory and Computation for 4-bit GPTQ Quantized LLM Inference on Heterogeneous Platforms

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Zhang, Yaozheng, Wang, Wei, Kong, Jie, Zhou, Jiehan, Zhang, Xianwei, Cui, Huanqing, Bao, Han, Liu, Yuhai
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!