Gao, B., He, Z., Sharma, P., Kang, Q., Jevdjic, D., Deng, J., . . . Zuo, P. (2024). Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention.
Chicago-Zitierstil (17. Ausg.)Gao, Bin, Zhuomin He, Puru Sharma, Qingxuan Kang, Djordje Jevdjic, Junbo Deng, Xingkun Yang, Zhou Yu, und Pengfei Zuo. Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention. 2024.
MLA-Zitierstil (9. Ausg.)Gao, Bin, et al. Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention. 2024.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.