04:00
2026-09-23
machinebrief.com
large-language-models
Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement
Researchers proposed Cross-layer Activation-aware Sensitivity Allocation (CASA), a two-phase mixed-precision quantization method that replaces scalar sensitivity proxies with an activation-aware metriβ¦