{"slug": "omlx-faites-tourner-vos-agents-ia-en-local-sur-votre-mac", "title": "oMLX – Faites tourner vos agents IA en local sur votre Mac", "summary": "OMLX, a new local AI server for macOS, persists the KV cache to disk in safetensors format, allowing AI agents to resume without recalculating tens of thousands of context tokens after a server restart. The server exposes both OpenAI and Anthropic APIs, enabling Claude Code to connect directly via localhost, and includes a dashboard for configuration. However, a default pip installation does not compile Metal kernels for models like GLM-5.2, MiniMax M3, and Qwen3.5, so users are advised to use the provided DMGs to avoid performance degradation.", "body_md": "# oMLX – Faites tourner vos agents IA en local sur votre Mac\n\n## Ce qu’il faut retenir Résumé généré par IA\n\n- oMLX persiste le cache KV sur disque au format safetensors, ce qui permet aux agents IA de reprendre sans recalculer des dizaines de milliers de tokens de contexte après un redémarrage du serveur\n- Le serveur oMLX expose les API OpenAI et Anthropic, permettant à Claude Code de se connecter directement sur localhost via un tableau de bord de configuration\n- L'installation par défaut via pip ne compile pas les kernels Metal pour certains modèles (GLM-5.2, MiniMax M3, Qwen3.5) ; il faut utiliser les DMG fournis pour éviter une dégradation de performance\n\n[Faire tourner un modèle en local](https://korben.info/rapid-mlx-installation-macos.html)\nsur un Mac, c'est réglé depuis un moment. Ce qui l'est moins par contre, c'est de brancher un agent de code dessus, parce qu'à chaque reprise de session, le serveur doit malheureusement remouliner des dizaines de milliers de tokens de contexte avant de sortir le premier mot...\n\nCe calcul, ça s'appelle le cache KV, et la plupart des serveurs le gardent en mémoire. Du coup, quand le modèle se décharge, le cache part avec dans le grand vide...\n\nC'est pourquoi\n[oMLX](https://github.com/jundot/omlx)\na pris le parti d'écrire ce cache sur le disque, au format safetensors, car le contexte déjà envoyé une fois, prompt système et fichiers lus compris, se recharge depuis le SSD au lieu d'être recalculé, y compris après un redémarrage du serveur.\n\nDe son côté,\n[LM Studio conserve lui aussi son cache MLX sur disque](https://lmstudio.ai/blog/mlx-engine-agentic-workloads)\n, mais dans un fichier temporaire qu'il efface quand le modèle se décharge. Les deux outils écrivent sur le disque, mais un seul conserve réellement son cache.\n\nCôté raccordement, le serveur oMLX\n[expose l'API OpenAI](https://korben.info/vllm-mlx-serveur-inference-apple-silicon.html)\net l'API Anthropic ce qui permet par exemple à Claude Code de taper directement sur localhost. Et y'a même un tableau de bord qui nous dit quoi faire dans le terminal pour brancher Claude Code ou d'autres avec oMLX.\n\nSur oMLX, le cache disque est donc actif d'office et son plafond par défaut, parce qu'il en faut bien un, se calcule à 10 % de la capacité du disque qui l'héberge. Sur un SSD d'un téraoctet par exemple, ça fait cent gigaoctets qui peuvent partir en cache sans que personne n'ait rien demandé. Donc prévoyez un peu de place... Après rassurez-vous, ça se vide d'un clic sur un bouton dans le tableau de bord et la taille peut se régler.\n\nLe deuxième piège est plus sournois puisqu'une installation par défaut via pip ne compile pas les kernels Metal, et les modèles GLM-5.2, MiniMax M3 et Qwen3.5 retombent alors sans prévenir sur un chemin générique... Donc je vous incite fortement à utiliser uniquement les DMG proposés qui contiennent déjà les kernels Metal compilés comme il faut.\n\nReste à savoir ce que ça donne vraiment dans un usage quotidien... Le cache attaque l'attente avant le premier mot mais pas la vitesse à laquelle les mots sortent ensuite donc tout dépend du modèle et de la machine que vous avez. Mais en tout cas, pour un usage avec des agents (coding par exemple), ce sera plus efficace d'utiliser oMLX que Ollama ou LMStudio.\n\nSource :\n[omlx.ai](https://omlx.ai/)", "url": "https://wpnews.pro/news/omlx-faites-tourner-vos-agents-ia-en-local-sur-votre-mac", "canonical_source": "https://korben.info/omlx-serveur-llm-local-apple-silicon.html?utm_source=rss&utm_medium=feed&utm_campaign=flux-complet", "published_at": "2026-08-20 06:31:50+00:00", "updated_at": "2026-08-20 07:13:22.501155+00:00", "lang": "en", "topics": ["ai-tools", "ai-infrastructure", "large-language-models"], "entities": ["oMLX", "OpenAI", "Anthropic", "Claude Code", "LM Studio", "GLM-5.2", "MiniMax M3", "Qwen3.5"], "alternates": {"html": "https://wpnews.pro/news/omlx-faites-tourner-vos-agents-ia-en-local-sur-votre-mac", "markdown": "https://wpnews.pro/news/omlx-faites-tourner-vos-agents-ia-en-local-sur-votre-mac.md", "text": "https://wpnews.pro/news/omlx-faites-tourner-vos-agents-ia-en-local-sur-votre-mac.txt", "jsonld": "https://wpnews.pro/news/omlx-faites-tourner-vos-agents-ia-en-local-sur-votre-mac.jsonld"}}