Continual Quantization-Aware Pre-Training: When to transition from 16-bit to 1.58-bit pre-training for BitNet language models?

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Nielsen, Jacob, Schneider-Kamp, Peter, Galke, Lukas
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!