cd /news/ai-tools/omlx-faites-tourner-vos-agents-ia-en… · home topics ai-tools article
[ARTICLE · art-104082] src=korben.info ↗ pub= topic=ai-tools verified=true sentiment=· neutral

oMLX – Faites tourner vos agents IA en local sur votre Mac

OMLX, a new local AI server for macOS, persists the KV cache to disk in safetensors format, allowing AI agents to resume without recalculating tens of thousands of context tokens after a server restart. The server exposes both OpenAI and Anthropic APIs, enabling Claude Code to connect directly via localhost, and includes a dashboard for configuration. However, a default pip installation does not compile Metal kernels for models like GLM-5.2, MiniMax M3, and Qwen3.5, so users are advised to use the provided DMGs to avoid performance degradation.

read3 min views2 publishedAug 20, 2026
oMLX – Faites tourner vos agents IA en local sur votre Mac
Image: Korben (auto-discovered)

Ce qu’il faut retenir Résumé généré par IA #

  • oMLX persiste le cache KV sur disque au format safetensors, ce qui permet aux agents IA de reprendre sans recalculer des dizaines de milliers de tokens de contexte après un redémarrage du serveur
  • Le serveur oMLX expose les API OpenAI et Anthropic, permettant à Claude Code de se connecter directement sur localhost via un tableau de bord de configuration
  • L'installation par défaut via pip ne compile pas les kernels Metal pour certains modèles (GLM-5.2, MiniMax M3, Qwen3.5) ; il faut utiliser les DMG fournis pour éviter une dégradation de performance

Faire tourner un modèle en local sur un Mac, c'est réglé depuis un moment. Ce qui l'est moins par contre, c'est de brancher un agent de code dessus, parce qu'à chaque reprise de session, le serveur doit malheureusement remouliner des dizaines de milliers de tokens de contexte avant de sortir le premier mot...

Ce calcul, ça s'appelle le cache KV, et la plupart des serveurs le gardent en mémoire. Du coup, quand le modèle se décharge, le cache part avec dans le grand vide...

C'est pourquoi oMLX a pris le parti d'écrire ce cache sur le disque, au format safetensors, car le contexte déjà envoyé une fois, prompt système et fichiers lus compris, se recharge depuis le SSD au lieu d'être recalculé, y compris après un redémarrage du serveur.

De son côté, LM Studio conserve lui aussi son cache MLX sur disque , mais dans un fichier temporaire qu'il efface quand le modèle se décharge. Les deux outils écrivent sur le disque, mais un seul conserve réellement son cache.

Côté raccordement, le serveur oMLX expose l'API OpenAI et l'API Anthropic ce qui permet par exemple à Claude Code de taper directement sur localhost. Et y'a même un tableau de bord qui nous dit quoi faire dans le terminal pour brancher Claude Code ou d'autres avec oMLX.

Sur oMLX, le cache disque est donc actif d'office et son plafond par défaut, parce qu'il en faut bien un, se calcule à 10 % de la capacité du disque qui l'héberge. Sur un SSD d'un téraoctet par exemple, ça fait cent gigaoctets qui peuvent partir en cache sans que personne n'ait rien demandé. Donc prévoyez un peu de place... Après rassurez-vous, ça se vide d'un clic sur un bouton dans le tableau de bord et la taille peut se régler.

Le deuxième piège est plus sournois puisqu'une installation par défaut via pip ne compile pas les kernels Metal, et les modèles GLM-5.2, MiniMax M3 et Qwen3.5 retombent alors sans prévenir sur un chemin générique... Donc je vous incite fortement à utiliser uniquement les DMG proposés qui contiennent déjà les kernels Metal compilés comme il faut.

Reste à savoir ce que ça donne vraiment dans un usage quotidien... Le cache attaque l'attente avant le premier mot mais pas la vitesse à laquelle les mots sortent ensuite donc tout dépend du modèle et de la machine que vous avez. Mais en tout cas, pour un usage avec des agents (coding par exemple), ce sera plus efficace d'utiliser oMLX que Ollama ou LMStudio.

Source : omlx.ai

── more in #ai-tools 4 stories · sorted by recency
── more on @omlx 3 stories trending now
sponsored brought to you by zahid.host 4,200+ EU-deployed projects
reading about agents? ship yours in a single git push.

Run your AI side-project on zahid.host

EU-based hosting, git-push deploys, automatic HTTPS, no cold starts. Free tier with a custom domain — perfect for shipping the agent you just read about.

$git push zahid main
Live at https://your-agent.zahid.host
Get free account → Pricing
from €0/mo · no card required
LIVE [news/omlx-faites-tourner-…] indexed:0 read:3min 2026-08-20 ·