MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention
Researchers propose MXAttention, a data-free post-training quantization framework for MXFP4 attention that introduces Universal Optimal Scaling (UOS) with a distribution-independent optimal scaling bo…