Comparatif · IA locale · août 2026
Qwen 3.6 vs GLM-4.7-Flash : quel modèle local pour coder ?
Deux modèles dominent les discussions « code en local » en août 2026 : Qwen 3.6 (surtout le 27B) et GLM-4.7-Flash. Même palier VRAM, usages proches — mais pas interchangeables.
Par Chris Drakkeng · publié le 3 août 2026 · données catalogue OutilsIA + tags Ollama
- Qwen 3.6 27B (~17 Go q4) : excellent défaut agentic coding 256K sur 16–24 Go.
- GLM-4.7-Flash (~19 Go q4) : coding + outils + thinking ; le full GLM-4.7 a quitté Ollama le 15/07 — Flash reste.
- Aucun des deux ne remplace une session Fable/Codex d’une heure sur gros dépôt.
- Choisissez avec une mesure (tokens/s + tâche réelle), pas une fiche marketing.
Ce comparatif ne vend ni carte graphique ni abonnement. Il répond à une question simple : si j’ai 16 à 24 Go de VRAM, lequel installer en premier pour coder en local ?
1. Ce qu’on compare vraiment
Pas « le meilleur LLM du monde ». La cible, c’est le code agentique borné : lire quelques fichiers, proposer un patch, lancer des tests, corriger une boucle courte — sur votre machine, sans envoyer le dépôt dans le cloud.
Les sessions d’une heure multi-outils multi-modules restent le domaine des forfaits cloud haut de gamme. On l’a chiffré dans notre étude Fable / Codex vs local.
2. Fiche machine (catalogue, pas marketing)
| Critère | Qwen 3.6 27B | GLM-4.7-Flash 30B-A3B |
|---|---|---|
| VRAM q4 (catalogue) | ~17 Go | ~19 Go |
| Contexte annoncé | 256K | long (fiche modèle) |
| Style | dense / agentic coding | MoE compact + tools/thinking |
| Dispo Ollama (août 2026) | stable | Flash oui · full 4.7 retiré 15/07 |
| Palier matériel | 16 Go tendu / 24 Go confort | 20–24 Go confort |
Sources VRAM : catalogue OutilsIA. Les tokens/s dépendent de votre GPU, quantif, drivers — mesurez-les.
3. Quand choisir Qwen 3.6
- Vous voulez un défaut unique pour coder + raisonner en local.
- Vous avez 16–17 Go libres en q4 (ou 24 Go pour respirer).
- Vous privilégiez l’écosystème Qwen (suite 3.x, Coder variants) déjà documenté sur le site.
Voir aussi : review Qwen 3.6 et RTX 3090 + Qwen 3.6.
4. Quand choisir GLM-4.7-Flash
- Vous voulez un profil tools + thinking sur un MoE compact.
- Vous acceptez ~19 Go q4 et un setup un peu plus pointu.
- Vous saviez que le grand GLM-4.7 a disparu d’Ollama : ne cherchez plus le full — prenez Flash.
5. Verdict opérationnel
Prochaine étape : estimer votre PC, puis mesurer avec Local Cockpit. Les tokens/s sur votre machine battent n’importe quel tableau web.
FAQ
Qwen 3.6 ou GLM-4.7-Flash : lequel pour coder en local en 2026 ?
Pour la plupart des machines 16–24 Go, commencez par Qwen 3.6 27B (~17 Go en q4). Ajoutez GLM-4.7-Flash (~19 Go) si vous voulez un second profil tools/thinking. Aucun des deux ne remplace une longue session cloud agentique.
Combien de VRAM pour Qwen 3.6 27B ?
Le catalogue OutilsIA indique environ 17 Go en quantification 4 bits. Comptez de la marge : 24 Go de VRAM est le confort réel si vous gardez d’autres apps ouvertes.
Pourquoi GLM-4.7 a disparu d’Ollama ?
Le tag GLM-4.7 « full » a été retiré d’Ollama le 15 juillet 2026. La voie locale documentée côté communauté et catalogue reste GLM-4.7-Flash.
Faut-il encore un abonnement Claude ou ChatGPT ?
Oui pour les sessions agentiques longues et le dernier kilomètre fiable. Non pour le volume quotidien (résumés, extractions, petits refactors) si votre local tient la route.
Sources et méthode
- VRAM q4 : catalogue OutilsIA v2026-07-24 / materiel (tags Ollama vérifiés 01–03/08/2026).
- Contexte amortissement forfaits : étude Fable/Codex vs local.
- Review sœur : Qwen 3.6 review.
- Pas de benchmark qualité inventé dans cet article : les verdicts sont des règles de choix machine + usage.
Chris Drakkeng — bâtisseur d'OutilsIA. Forge française d'outils pour tester, mesurer et faire tourner l'IA — en local d'abord.
Quand un chiffre n'est pas mesuré ici, l'article le dit. Pas d'affiliation Amazon sur ce contenu.