FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Qiu, Zhaopeng, Yu, Shuang, Zhang, Jingqi, Zhang, Shuai, Huang, Xue, Yang, Jingyi, Lai, Junjie
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!