Rapid-MLX - Installer un serveur IA local sur votre Mac Rapid-MLX, a local inference engine for Apple Silicon Macs maintained by Raullen Chai, directly uses Apple's MLX kernels without relying on llama.cpp or a Metal layer, offering a faster alternative to paid token-based services. It is a fork of vLLM-MLX by Wayner Barrios, with a more active release schedule. Si vous avez un Mac Apple Silicon et que vous en avez assez de payer des tokens à chaque requête, Rapid-MLX https://github.com/raullenchai/Rapid-MLX vaut le détour. C'est un moteur d'inférence local maintenu par Raullen Chai, qui tape directement dans les kernels MLX d'Apple, sans repli sur llama.cpp ni couche Metal intermédiaire. Et si le nom vous dit vaguement quelque chose, c'est normal puisque c'est un fork de vLLM-MLX, le serveur de Wayner Barrios dont je vous parlais en mai https://korben.info/vllm-mlx-serveur-inference-apple-silicon.html . Rapid-MLX a juste pris un rythme de publication plus soutenu des deux.