Étude · IA locale · août 2026
Remplacer Fable et Codex 5.6 par de l'IA locale : l'étude chiffrée
La question que tout développeur se pose en 2026 — et à laquelle personne ne répond avec des chiffres vérifiables. Voici l'étude complète : 40 modèles jaugés, 4 paliers de matériel, et un verdict que ni les vendeurs de GPU ni les vendeurs d'abonnements ne vous donneront.
Par Chris Drakkeng · publié le 3 août 2026 · données : catalogue OutilsIA v2026-07-24, tags Ollama vérifiés
Les forfaits IA haut de gamme coûtent aujourd'hui autour de 200 € par mois quand on empile un abonnement Claude niveau max et un ChatGPT/Codex pro. 2 400 € par an. Pour ce prix-là, on a les deux meilleurs agents de code du marché — et une question qui gratte : avec 2 400 €, on achète une sacrée carte graphique. Alors, août 2026 : est-ce que ça passe ?
Cette étude jauge 40 modèles locaux (VRAM réelle mesurée en q4 et q8), définit 4 paliers de matériel avec leur coût, calcule l'électricité et l'amortissement — et rend un verdict qui ne fera plaisir ni aux vendeurs de GPU, ni aux vendeurs d'abonnements.
1. Ce qu'il faudrait remplacer, exactement
Soyons précis sur la cible, parce que tout le monde triche sur ce point. « Remplacer Codex 5.6 » ne veut pas dire « avoir un chatbot qui code ». Ça veut dire : des sessions agentiques longues — l'IA lit un dépôt de 30 000 lignes, planifie, modifie douze fichiers, lance les tests, corrige, recommence, pendant une heure, sans perdre le fil. C'est ça qu'on paie 200 €/mois. Le chat qui explique une regex, lui, est déjà gratuit partout.
Et il se trouve que les équivalents open-weights de cette classe-là existent. On peut donc chiffrer exactement ce que coûterait le remplacement à qualité comparable :
| Modèle open-weights (classe frontière) | VRAM en q4 | VRAM en q8 | Machine requise |
|---|---|---|---|
| Kimi K2.7 Code (1T, A32B MoE) | 595 Go | 1 100 Go | Serveur multi-GPU datacenter |
| GLM-5.2 (744B, A40B MoE) | 430 Go | 820 Go | Serveur multi-GPU datacenter |
| Qwen 3 235B MoE | 142 Go | 260 Go | Workstation multi-GPU / Mac Studio 256 Go+ |
| Mistral Large 3 (123B) | 70 Go | 130 Go | Workstation 96 Go+ |
2. Ce que le local sait vraiment faire — les 40 modèles jaugés
Maintenant la partie intéressante : entre « le chatbot gratuit » et « le monstre à 600 Go », il s'est passé quelque chose en 2026. La génération MoE compacte (Qwen 3.6, GLM-4.7-Flash, Qwen 3 30B-A3B) a fait entrer le code agentique — le vrai, avec outils et contexte 256K — dans la fenêtre d'une carte graphique de gamer. Voici la synthèse du catalogue, par palier de VRAM :
Palier 0 — votre PC actuel (0 €, 4-12 Go de VRAM)
| Modèle | q4 | Ce qu'il vaut |
|---|---|---|
| Llama 3.2 3B / Qwen 3 4B / Gemma 3 4B | 2-2,5 Go | Chat léger, tourne même en CPU/RAM |
| Qwen 3 8B / Llama 3.1 8B / Hermes 3 8B | 5 Go | Le couteau suisse : résumé, extraction, français correct |
| Ornith 1.0 9B | 5,6 Go | La surprise 2026 : agentique local compact (terminal, correction de repo) |
| Gemma 4 12B | 7,6 Go | Le meilleur défaut récent sous 8 Go : raisonnement + multimodal |
| Qwen 3 14B / Phi-4 14B / DeepSeek R1 14B | 9 Go | Qualité supérieure, debug, raisonnement compact |
| Whisper Large v3 | 3 Go | Transcription audio locale — remplace un service payant, point |
Palier 1 — la carte à ~500-800 € (16-24 Go)
| Modèle | q4 | Ce qu'il vaut |
|---|---|---|
| Qwen 3.6 27B | 17 Go | Agentic coding, contexte 256K — le vrai palier « ça travaille » |
| GLM-4.7-Flash 30B-A3B | 19 Go | Coding agentique + outils + thinking (le grand GLM-4.7 a quitté Ollama le 15/07 — Flash reste) |
| Qwen 3 30B-A3B | 19 Go | Très bon généraliste du palier 24 Go, contexte 256K |
| Qwen 3 Coder 32B / DeepSeek R1 32B | 20 Go | Code avancé, analyse technique |
| Mistral Small 3 24B / Gemma 3 27B | 15-16 Go | Rédaction longue, qualité en français |
Palier 2 — la station à ~2 000-3 000 € (32-48 Go)
| Modèle | q4 | Ce qu'il vaut |
|---|---|---|
| Qwen 3.6 35B-A3B | 24 Go | Le haut du panier agentique local : Hermes/OpenCode en local sérieux |
| Llama 3.3 70B / DeepSeek R1 70B | 40 Go | Les gros denses classiques (dual-3090 ou 48 Go unifiés) |
| Laguna XS 2.1 33B-A3B | 20 Go | Agentic long-horizon 256K sur forte RAM |
Palier 3 — la workstation à 5 000-15 000 € (64-128 Go)
| Modèle | q4 | Ce qu'il vaut |
|---|---|---|
| Qwen3-Coder-Next 80B-A3B | 52 Go | Compréhension de repo 256K — le plus proche d'un « Codex local » |
| Mistral Medium 3.5 128B | 80 Go | Pro : raisonnement, code, vision, 256K |
| Nemotron 3 Super 120B MoE | 87 Go | Agents collaboratifs, workloads lourds |
| Llama 4 Maverick 109B MoE | 65 Go | Frontier local très lourd |
VRAM issues du catalogue OutilsIA (v2026-07-24), tags Ollama vérifiés. Les prix matériel bougent chaque semaine : les fourchettes de cette étude sont celles constatées début août 2026 — vérifiez le jour J.
3. Ce qu'en dit le terrain — et les deux faits qui ont tout changé en 2026
Ce n'est pas qu'une affaire de specs : deux événements de 2026 ont massivement poussé les développeurs vers le local, et la communauté a des chiffres.
Fait n°1 — avril 2026 : les forfaits se referment. Depuis le 4 avril, les abonnements Claude ne couvrent plus l'usage via des outils tiers comme OpenClaw. Le message est clair : le forfait s'utilise dans l'écosystème de l'éditeur. Pour tous ceux qui avaient bâti leurs workflows sur des outils ouverts, la question du local est passée de « hobby » à « plan B stratégique ».
Fait n°2 — janvier 2026 : Ollama parle l'API Anthropic. Conséquence énorme et sous-estimée : vous pouvez garder le harnais Claude Code et brancher un modèle local dedans. Le savoir-faire d'orchestration (fichiers, outils, permissions) reste ; seul le cerveau change. C'est exactement la répartition que cette étude recommande.
Et la communauté a mesuré. La plus grande communauté d'IA locale du web, r/LocalLLaMA (~749 000 membres à la mi-2026), converge sur un chiffre remarquablement proche du nôtre : environ 65 % du travail de code quotidien tourne à l'identique sur des modèles qui coûtent « essentiellement le prix de l'électricité ». Le même consensus pose les limites sans détour : sous 12-16 Go de VRAM, l'agentique locale reste « aspirationnelle » (l'offload CPU tue la vitesse), et sur les vraies sessions longues de 10-30 minutes, la cohérence d'intention se dégrade — précisément la frontière que nous avons mesurée au labo.
4. Le vrai calcul : amortissement contre abonnement
D'abord, tuons un mythe : l'électricité n'est pas le problème. Un GPU de 350 W sollicité 8 h par jour ouvré, c'est ~60 kWh/mois, soit environ 15 € au tarif français. Dix fois moins que le forfait. Le facteur limitant est et reste la VRAM.
Ensuite, le calcul que personne ne fait honnêtement. Le remplacement total étant exclu (section 1), la vraie question est : quelle part de votre usage le local peut-il absorber, et qu'est-ce que ça vous fait économiser ?
| Scénario | Investissement | Ce que le local absorbe | Économie cloud possible | Amortissement |
|---|---|---|---|---|
| PC actuel (8-12 Go) | 0 € | Résumés, extraction, RAG perso, transcription, brouillons — le VOLUME | ~40-60 €/mois (descendre d'un tiers de forfait) | immédiat |
| RTX 5060 Ti 16 Go (~500 €) | ~500 € | + Qwen 3.6 27B : tests unitaires, refactors courts, revue simple | ~80-100 €/mois | ~5-6 mois |
| RTX 3090 24 Go occasion (~700 €) | ~700 € | + GLM-4.7-Flash, Qwen 3 30B : boucles agentiques bornées | ~100 €/mois | ~7 mois |
| RTX 5090 32 Go (~2 400 €) | ~2 400 € | + Qwen 3.6 35B : le sérieux, mais… | ~100-120 €/mois | ~20-24 mois |
| Workstation 128 Go (8 000 €+) | 8 000 €+ | Qwen3-Coder-Next 80B — et toujours PAS Codex 5.6 | ~150 €/mois max | 4-5 ans, matériel obsolète avant |
Le tableau d'amortissement — coût CUMULÉ dans le temps
Le calcul que les fiches produit ne montrent jamais : le matériel se paie une fois, l'abonnement se paie pour toujours. Coût total cumulé (matériel + forfait résiduel + électricité ~15 €/mois quand GPU dédié) :
| Stratégie | 6 mois | 12 mois | 24 mois | 36 mois |
|---|---|---|---|---|
| Tout-cloud (200 €/mois fixes) | 1 200 € | 2 400 € | 4 800 € | 7 200 € |
| Hybride palier 0 — PC actuel, forfait allégé (~150 €/mois) | 900 € | 1 800 € | 3 600 € | 5 400 € |
| Hybride 5060 Ti 16 Go — 500 € + 100 €/mois + élec. | 1 190 € | 1 880 € | 3 260 € | 4 640 € |
| Hybride 3090 24 Go occ. — 700 € + 100 €/mois + élec. | 1 390 € | 2 080 € | 3 460 € | 4 840 € |
| Full local « équivalent » — serveur 430-595 Go VRAM | 20 000 € et plus à l'achat, qualité inférieure en q4 — jamais rentable | |||
Lisez la ligne 5060 Ti : elle croise le tout-cloud dès le sixième mois (1 190 € contre 1 200 €), et à 36 mois l'écart atteint 2 560 € d'économie — de quoi racheter deux générations de GPU. La 3090 d'occasion croise vers le neuvième mois. Et la ligne du bas rappelle pourquoi le « full local » est un fantasme comptable.
5. Ce que le local ne remplacera pas cette année — mesuré, pas supposé
Ce site a un laboratoire, alors disons-le avec nos propres mesures plutôt qu'avec des impressions. Nous avons fait tourner des boucles multi-agents locales sur des tâches de code réelles : sur les tâches simples, un petit modèle local seul suffit (100 % de réussite, mesuré, et empiler des modèles n'ajoute rien). Sur les tâches dures, solo comme équipe locale tombent à 0 % — ajouter des modèles locaux ne monte pas le plafond, il faut un modèle plus capable. Et dans notre labo Dragon, un LLM local mis dans le siège du chasseur a traqué plus mal que quatre lignes de code.
Concrètement, ce qui reste au cloud en août 2026 : les sessions agentiques longues (l'heure de travail autonome sur un vrai dépôt), la fiabilité du dernier kilomètre (le tool-use qui ne bafouille pas au 40e appel), et le très long contexte réellement exploité — pas juste affiché sur la fiche technique. C'est précisément ce que vous payez dans Fable ou Codex 5.6, et c'est la partie que leurs équivalents à 600 Go de VRAM sont seuls à approcher.
6. Le verdict final : ne les remplacez pas — payez-les pour ce qu'ils sont seuls à savoir faire
Voici la conclusion que les chiffres imposent — et qu'aucun des deux camps ne vous vendra :
Remplacer Fable et Codex 5.6 ? Non. Pas en août 2026, pas à budget humain. Leurs équivalents open-weights coûtent le prix d'une voiture en matériel, pour une qualité moindre en quantifié.
Les payer à faire du résumé de mail ? Non plus. C'est là que tout le monde perd de l'argent : 60 à 80 % du volume quotidien — résumés, extraction, reformulation, doc, commits, RAG sur vos fichiers, transcription — se traite très bien sur une machine à 0-700 €, pour 15 € d'électricité par mois.
La stratégie rationnelle est simple : le local prend le volume, le forfait descend d'un cran et se concentre sur ce que lui seul sait faire — les longues sessions agentiques. C'est le principe de l'arrangement suffisant : la bonne question n'est jamais « quel est le modèle le plus puissant ? », c'est « quel est le modèle le moins cher qui suffit à CETTE tâche ? ».
Trois gestes pour appliquer ça aujourd'hui : estimez ce que votre PC actuel sait déjà faire tourner (souvent plus que vous ne croyez), mesurez-le réellement avec Local Cockpit (gratuit — un benchmark vaut mille fiches techniques), et si l'amortissement de la section 4 vous parle, le catalogue matériel tient les configurations à jour par palier de VRAM.
FAQ
Peut-on remplacer totalement Claude (Fable) ou Codex 5.6 par de l'IA locale en 2026 ?
Non, pas à qualité égale. Les équivalents open-weights des modèles frontière (Kimi K2.7 Code 1T, GLM-5.2 744B) exigent 430 à 595 Go de VRAM en quantification 4 bits, soit une infrastructure serveur de plusieurs dizaines de milliers d'euros — plus cher que dix ans d'abonnement. En revanche, 60 à 80 % du volume de tâches quotidiennes se traite très bien en local.
Quel matériel pour faire tourner un bon modèle de code local en août 2026 ?
Le sweet spot est une carte de 16 à 24 Go de VRAM : une RTX 5060 Ti 16 Go ou une RTX 3090 24 Go d'occasion font tourner Qwen 3.6 27B (17 Go en q4), GLM-4.7-Flash (19 Go) ou Qwen 3 30B-A3B (19 Go) — les meilleurs modèles agentiques locaux du moment.
Combien coûte l'électricité d'une IA locale ?
Un GPU de 350 W sollicité 8 h par jour ouvré consomme environ 60 kWh par mois, soit autour de 15 € au tarif français moyen. C'est près de dix fois moins qu'un forfait IA haut de gamme — l'électricité n'est jamais le facteur bloquant, la VRAM l'est.
Que peut-on vraiment déléguer à un modèle local aujourd'hui ?
Dès 8 Go de VRAM : résumés, extraction, reformulation, documentation, messages de commit, RAG sur vos propres fichiers, transcription audio (Whisper), brouillons. À partir de 16-24 Go : tests unitaires, refactorings courts, revue de code simple et petites boucles agentiques bornées. Les longues sessions agentiques multi-outils restent le domaine du cloud.
Sources et méthode
- VRAM q4/q8 des 40 modèles : catalogue OutilsIA v2026-07-24 (maintenu contre les tags ollama.com — vérifications du 01-03/08/2026 ; GLM-4.7 retiré d'Ollama le 15/07, GLM-4.7-Flash disponible).
- Électricité : 350 W × 8 h × 22 j ≈ 62 kWh/mois, tarif réglementé FR ~0,25 €/kWh — détail dans notre étude consommation.
- Mesures agentiques locales : boucles multi-modèles sur tâches de code réelles (juge compile + tests, IC Wilson 95 %) et labo Dragon.
- Prix matériel : fourchettes constatées début août 2026, à re-vérifier le jour J sur le catalogue.
- Forfaits et outils tiers (avril 2026) : TechRadar. Claude Code sur modèles locaux via l'API Anthropic d'Ollama (janvier 2026) : guide technique.
- Sentiment communauté : synthèse de 300+ builders r/LocalLLaMA (le « 65 % du quotidien à prix d'électricité »), analyse de 265 posts, retours agentiques réels, KDnuggets top modèles locaux 2026.
Chris Drakkeng — bâtisseur d'OutilsIA. Forge française d'outils pour tester, mesurer et faire tourner l'IA — en local d'abord.
Toutes les mesures citées sont reproductibles ; quand un chiffre n'est pas mesuré, l'article le dit.