Precision as a design choice
Quantization-aware training lets the model practise at lower precision instead of discovering the damage only after compression.