Timely · mi-août 2026
État de l'IA locale mi-août 2026 : hybrid, VRAM, ce qui suffit
Photo de la situation mi-août 2026 : le local n'est plus un jouet, le cloud n'est plus obligatoire pour tout, et le vrai skill c'est router — plus petit modèle qui suffit, mesuré sur votre PC.
Par Chris Drakkeng · 6 août 2026 · addendum 19 août 2026
- Hybrid first : local volume + cloud sessions longues.
- Addendum 19 août : Qwen 3.8 27B mesuré à 9,4 tok/s ·
OIA-OLLAMA-BENCH-20260819-QWEN38-27B-RTX4080S-WSLsur RTX 4080 SUPER 16 Go (28 % CPU / 72 % GPU). Détail : nouveautés outils fin août. - Coders locaux (famille Qwen via Ollama) = bras privacy/coût ; forfaits type Claude Code = bras agentique longue.
- VRAM : 12 / 16 / 24 Go restent les paliers utiles — guide profils.
- Mesure OutilsIA : 118,5 tok/s ·
OIA-LC-BENCH-20260727-HERMES3-8B-RTX4080SHermes 3 8B sur 4080 SUPER (27/07) — nos mesures. - Produit : Local Cockpit 0.1.1-beta téléchargeable ; Maestro 0.7.1 aperçu public (dogfood v0.7 documenté comme histoire).
1. Ce qui a changé depuis le printemps
Au printemps 2026, « IA locale » voulait encore dire « installer Ollama et croiser les doigts ». Mi-août, le discours mature est : privacy + coût + arrangement suffisant. Les modèles coder open-weight progressent assez pour absorber une grosse part du volume dev — sans prétendre cloner un Opus en session 2 h multi-repo.
Côté matériel, la pénurie/prix RAM (DDR5) reste un sujet (voir tendances prix août) : mesurer avant d'acheter n'est plus une posture, c'est de la survie budgétaire.
2. Stack type « power user frugal »
| Couche | Choix mi-août 2026 | Pourquoi |
|---|---|---|
| Runtime | Ollama (Windows/Linux) + mesure | Simple, catalogue vivant |
| Volume code/chat | Qwen 3.8 27B si 24 Go ; sinon 7–8B | Candidat 27B actuel dans Ollama |
| Sessions longues | Claude Code / Fable / Codex | Agentique robuste |
| Scan machine | Local Cockpit | VRAM, tok/s, verdict achat |
| Orchestre | Maestro 0.7.1 aperçu public | Multi-sessions bornées |
3. Trois lectures OutilsIA du mois
- Arrangement suffisant — le plus petit modèle qui fait le job.
- Qwen coder vs Claude Code — matrice de décision.
- Maestro v0.7 dogfood — preuve multi-IA (pas une roadmap vide).
4. Ce qu'on ne vous vend pas
- Pas de « top 10 GPU à acheter ce soir » sans scan.
- Pas de tokens/s inventés — seulement des mesures datées.
- Pas de promesse « téléchargez Maestro » tant que le canal public n'est pas prêt.
FAQ
Quelle est la tendance IA locale en août 2026 ?
Hybrid first : local pour le volume et la privacy, cloud pour les longues sessions agentiques. Mesurer la machine avant d'acheter.
Quel GPU viser pour démarrer ?
12 Go ticket d'entrée, 16 Go confort, 24 Go pour 32B quantifiés. Détail profils : quel PC/GPU.
Sources
- Mesures OutilsIA · Hub IA locale
- Articles août 2026 cluster (Fable/Codex, Qwen/GLM, arrangement, DDR5, Maestro dogfood).
Chris Drakkeng — OutilsIA. Timely mensuel · sans affiliation.