Guide · Agentique · août 2026
Claude Code avec un modèle local via Ollama
Depuis que Ollama expose une API compatible Anthropic, une architecture s’est imposée chez les devs frugaux : garder Claude Code comme harnais, et brancher un modèle local comme cerveau.
Par Chris Drakkeng · publié le 3 août 2026 · guide pratique, limites mesurées
- Le harnais (outils, fichiers, permissions) ≠ le modèle. On peut les découpler.
- Ollama en mode API Anthropic permet de brancher Qwen 3.6 / GLM-Flash derrière Claude Code.
- Ça marche très bien sur le volume borné ; ça reste en dessous sur les sessions d’une heure multi-modules.
- Mesurez VRAM + tokens/s avant de baisser votre forfait.
1. Pourquoi cette architecture existe
En avril 2026, le durcissement des forfaits Claude sur les outils tiers a rappelé une vérité : votre workflow ne doit pas dépendre d’un seul tuyau. Brancher un modèle local dans un harnais déjà maîtrisé, c’est un plan B stratégique — pas un hobby.
Détail forfaits / répartition local-cloud : étude chiffrée août 2026.
2. Ce que vous gardez vs ce que vous changez
| Couche | Rôle | En local ? |
|---|---|---|
| Claude Code (harnais) | Navigation repo, tools, boucles | Oui — client local |
| Pont API | Format messages / tools | Ollama (API Anthropic) |
| Modèle | Raisonnement + génération | Qwen 3.6, GLM-Flash, etc. |
| Juge / qualité ultime | Sessions longues critiques | Souvent cloud encore |
3. Prérequis machine (honnêtes)
- 16 Go VRAM : possible en q4 sur Qwen 3.6 27B, parfois juste.
- 24 Go : zone de confort pour agentique bornée + un peu d’air.
- 8–12 Go : utile pour le volume (résumés, petits edits), pas pour prétendre remplacer Fable.
Avant d’acheter quoi que ce soit : Mon PC peut-il ? puis Local Cockpit.
4. Démarche de mise en place (principe)
- Installer / mettre à jour Ollama et tirer un modèle de code (ex. Qwen 3.6 27B).
- Activer l’endpoint compatible Anthropic documenté par Ollama (janvier 2026+).
- Pointer Claude Code (ou client compatible) vers
localhostplutôt que l’API cloud. - Lancer une tâche réelle courte (fix test unitaire, petit refactor) et noter échecs / latence.
- Ne baisser le forfait cloud qu’après 1–2 semaines de friction mesurée, pas le jour J.
Les flags et chemins exacts bougent vite : suivez la doc Ollama du jour. Ici on fixe l’architecture, pas une version de CLI périmée dans trois semaines.
5. Limites (labo + terrain)
Compléments : Hermes vs Claude Code · Qwen vs GLM-Flash.
FAQ
Peut-on utiliser Claude Code avec un modèle local ?
Oui, via un pont compatible (Ollama expose une API au format Anthropic). Vous gardez le harnais Claude Code et changez le modèle derrière. La qualité dépend entièrement du modèle local et de votre VRAM.
Quel modèle local mettre derrière Claude Code en août 2026 ?
Sur 16–24 Go : Qwen 3.6 27B ou GLM-4.7-Flash. En dessous de 12 Go : restez sur du volume (petits modèles) et gardez le cloud pour le code agentique sérieux.
Est-ce légal / conforme aux conditions Claude ?
Vous utilisez le client/harnais et un backend local que vous contrôlez. Lisez toujours les conditions en vigueur de l’éditeur du client. L’intérêt de l’architecture, c’est aussi de réduire la dépendance à un seul fournisseur cloud.
Faut-il supprimer son abonnement cloud après ?
Non, pas d’emblée. Envoyez d’abord le volume vers le local, mesurez pendant quelques semaines, puis baissez d’un cran de forfait si la friction le permet.
Sources et méthode
- Ollama API Anthropic (janv. 2026+) : doc communautaire / guides techniques (ex. retours Habr & écosystème Ollama).
- Contexte forfaits avril 2026 : couverture presse (ex. TechRadar) + synthèse dans notre étude.
- Limites agentiques locales : mesures labo OutilsIA / Dragon.
- Catalogue VRAM : /materiel.
Chris Drakkeng — bâtisseur d'OutilsIA. Forge française d'outils pour tester, mesurer et faire tourner l'IA — en local d'abord.
Quand un chiffre n'est pas mesuré ici, l'article le dit. Pas d'affiliation Amazon sur ce contenu.