Scaling Down, Serving Fast: Compressing and Deploying Efficient LLMs for Recommendation Systems

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Behdin, Kayhan, Fatahibaarzi, Ata, Song, Qingquan, Dai, Yun, Gupta, Aman, Wang, Zhipeng, Tang, Shao, Sang, Hejian, Dexter, Gregory, Zhu, Sirou, Zhu, Siyu, Dharamsi, Tejas, Kothapalli, Vignesh, Fu, Zhoutong, Cao, Yihan, Hsu, Pin-Lun, Borisyuk, Fedor, Pillai, Natesh, Simon, Luke, Mazumder, Rahul
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!

Ähnliche Einträge