Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU
Researchers from UC Berkeley and UT Austin released FreeToken, an edge-native Mixture-of-Experts serving engine that runs the 753B-parameter GLM-5.2 model on a single workstation GPU, achieving 35B at…