Tableau de compatibilité, pas tableau de benchmarks
Votre machine tranche mieux qu'une moyenne théorique.
OutilsIA Local Cockpit détecte le matériel réel, le runtime Ollama exact et les modèles déjà installés. Le tableau ci-dessous aide à présélectionner ; il ne doit pas transformer une taille de modèle ou une quantité de VRAM en vitesse mesurée.
Première preuve publiée : Hermes 3 8B à 118,5 tok/s sur RTX 4080 SUPER 16 Go via Ollama Windows, le 27 juillet 2026. Elle ne généralise pas les vitesses des 14 configurations du tableau.
Les recommandations d'achat viennent après la compatibilité. OutilsIA peut conclure qu'un modèle plus léger est préférable à un nouveau GPU.
Avant d'acheter
Recevoir le dossier de configuration PC IA
Un email au lancement de PC IA Builder : 3 builds alternatifs, composants a verifier, pieges a eviter et PDF dossier de configuration. Gratuit, pas de spam.
Quel modèle IA sur quel hardware ? Le tableau complet (mis à jour août 2026)
Decision achat par taille de modele
Choisissez la VRAM selon le modele vise, pas selon le nom de la carte.
7B/14B demandent surtout 12 a 16 Go utiles. Les 32B deviennent confortables avec 24 Go. Les 70B exigent 48 Go cumules ou une grosse memoire unifiee.
La question utile est : « Ce modèle rentre-t-il sur mon matériel, puis quelle vitesse mesure-t-on réellement ? » Le tableau donne un premier filtre de compatibilité ; Local Cockpit produit la mesure.
LA question que tout le monde pose
« Est-ce que je peux charger un 70B sur 24 Go ? » « Un 32B rentre-t-il dans une mémoire unifiée de 48 Go ? » « Quel palier viser avec 16 Go de RAM ? »
Le tableau croise plus de 25 modèles avec 14 configurations pour fournir un premier filtre de compatibilité. Le débit réel dépend ensuite du fichier exact, du contexte, du runtime, des pilotes et du placement CPU/GPU.
Comment lire ce tableau
Les niveaux de quantification
- Q4_K_M — poids quantifiés autour de 4 bits, avec surcharge liée au format.
- Q8 — poids autour de 8 bits, généralement plus volumineux que Q4.
- FP16 — poids 16 bits, nettement plus lourds. Vérifiez toujours la taille du fichier distribué.
Les indicateurs de confort estimé
Ces classes servent à trier avant test. Elles ne remplacent pas un débit mesuré sur le runtime, le modèle et la quantification exacts.
- Rapide — 20+ tokens/sec. Conversation fluide, temps réel.
- OK — 5-20 tokens/sec. Utilisable, un peu d'attente.
- Lent — 1-5 tokens/sec. Patience requise. Bon pour le batch.
- Non — Ne tient pas en mémoire ou inutilisable.
VRAM vs RAM unifiee
Sur les GPU NVIDIA, le modèle doit tenir dans la VRAM (mémoire du GPU). Sur les Mac Apple Silicon, la mémoire est unifiee : CPU et GPU partagent la meme RAM, donc toute la RAM est disponible pour le modèle. C'est pourquoi un Mac Mini M4 Pro avec 48 Go peut charger des modèles qu'une RTX 4090 (24 Go VRAM) ne peut pas.
Le Mega Tableau
25+ modèles x 14 configsFaites defiler horizontalement pour voir toutes les configurations. La premiere colonne (modèle) reste fixe.
Modèles de langage (LLM)
| Modèle (quant.) | RAM requise | RTX 3060 12 Go |
RTX 4060 8 Go |
Mac Mini M4 16 Go |
RTX 4060 Ti 16 Go |
RTX 4070 Ti 12 Go |
Mac Mini M4 Pro 24 Go |
RTX 4090 24 Go |
Mac Mini M4 Pro 48 Go |
2x RTX 3090 48 Go |
Mac Studio Ultra 128 Go |
Mac Studio Ultra 192 Go |
DGX Spark 128 Go |
Laptop 16 Go RAM |
Laptop 32 Go RAM |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Petits modèles (1-3B) — Ultra rapides partout | |||||||||||||||
| Gemma 2 2B Q4 | ~1.5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | OK | Rapide |
| Qwen 2.5 3B Q4 | ~2 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | OK | Rapide |
| Llama 3.2 3B Q4 | ~2 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | OK | Rapide |
| Phi-3.5 Mini 3.8B Q4 | ~2.5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | OK | Rapide |
| Modèles moyens (7-9B) — Le sweet spot | |||||||||||||||
| Mistral 7B v0.3 Q4 | ~4.5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Lent | OK |
| Llama 3.1 8B Q4 | ~5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Lent | OK |
| Qwen 2.5 7B Q4 | ~4.5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Lent | OK |
| Gemma 2 9B Q4 | ~5.5 Go | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Lent | OK |
| DeepSeek Coder V2 Lite 16B Q4 | ~9 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Grands modèles (13-14B) — GPU correct requis | |||||||||||||||
| Qwen 2.5 14B Q4 | ~8.5 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Phi-3 Medium 14B Q4 | ~8 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Llama 3.1 8B Q8 | ~8.5 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Gemma 4 12B Q4 estimé | ~7.6 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Modèles XL (30-34B) — Hardware serieux requis | |||||||||||||||
| Qwen 3.6 27B Q4 estimé | ~17 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| GLM-4.7-Flash 30B-A3B Q4 estimé | ~19 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| Qwen 3 Coder 32B Q4 estimé | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| Qwen 2.5 32B Q4 | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| CodeLlama 34B Q4 | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| Yi 34B Q4 | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| DeepSeek Coder 33B Q4 | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| Modèles XXL (70B+) — Le haut du panier | |||||||||||||||
| Llama 3.1 70B Q4 | ~40 Go | Non | Non | Non | Non | Non | Non | Non | OK | OK | Rapide | Rapide | Rapide | Non | Non |
| Qwen 2.5 72B Q4 | ~42 Go | Non | Non | Non | Non | Non | Non | Non | OK | OK | Rapide | Rapide | Rapide | Non | Non |
| Mistral Large 2 123B Q4 | ~70 Go | Non | Non | Non | Non | Non | Non | Non | Non | Non | OK | Rapide | OK | Non | Non |
Quoi de neuf à l'été 2026
Quatre familles sont sorties depuis la première version de ce tableau. Elles sont intégrées ci-dessus avec un statut estimé — tailles Q4 relevées sur le catalogue OutilsIA et vérifiées sur ollama.com, aucune vitesse mesurée :
- Gemma 4 (Google) : 12B dense (~7,6 Go en Q4), formats edge E2B/E4B pour les petites machines, multimodal, contexte 256K.
- Qwen 3.6 (Alibaba) : démarre à 27B (~17 Go en Q4), avec un 35B-A3B MoE au-dessus — pas de 8B dans cette génération.
- GLM-4.7 (Z.ai) : la variante Flash 30B-A3B (~19 Go en Q4, 3B actifs) est celle qui vise le PC personnel.
- Kimi K2.7 Code : 1T MoE, ~595 Go en Q4 — cité pour situer le plafond, hors de portée d'une machine personnelle.
Pour croiser ces modèles avec votre configuration exacte, le simulateur IA locale s'appuie sur le même catalogue, tenu à jour.
Et les RTX 50 ?
Le tableau garde ses 14 configurations : la génération RTX 50 ne change pas la lecture, elle décale les paliers. La RTX 5090 et ses 32 Go de VRAM se placent un cran au-dessus de la RTX 4090 24 Go : les 32B en Q4 (~20 Go) y tournent avec une vraie marge de contexte, mais un 70B dense reste hors de portée d'une seule carte. Les colonnes RTX 4090 restent donc un bon proxy « 24 Go et plus ». Le détail carte par carte est dans le guide GPU pour l'IA locale.
Modèles de generation d'images
| Modèle | VRAM requise | RTX 3060 12 Go |
RTX 4060 8 Go |
Mac Mini M4 16 Go |
RTX 4060 Ti 16 Go |
RTX 4070 Ti 12 Go |
Mac Mini M4 Pro 24 Go |
RTX 4090 24 Go |
Mac Mini M4 Pro 48 Go |
|---|---|---|---|---|---|---|---|---|---|
| Stable Diffusion 1.5 | ~4 Go | Rapide | Rapide | OK | Rapide | Rapide | OK | Rapide | Rapide |
| SDXL | ~8 Go | OK | OK | OK | Rapide | OK | Rapide | Rapide | Rapide |
| Flux Schnell | ~8 Go | OK | OK | OK | Rapide | OK | Rapide | Rapide | Rapide |
| Flux Dev | ~12 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide |
Petits modèles (1-3B) : pour qui ?
Les modèles de 1 à 3 milliards de paramètres sont les plus accessibles, mais ils ne tournent pas littéralement sur toute machine. Vérifiez la RAM disponible, le format, le runtime et les capacités CPU/GPU ; leur intérêt principal reste une empreinte plus faible.
Cas d'usage ideaux : autocompletion de code en temps réel, chatbot embarque, resume de texte rapide, classification. Si vous avez besoin de reponses instantanees et que la tache ne demande pas un raisonnement complexe, un modèle 3B est parfait.
Notre choix : Gemma 4 en format edge (E2B/E4B), la déclinaison compacte de la génération 2026, à tester en priorité sur ce segment. Les générations 2024-2025 restent valables : Qwen 2.5 3B garde un excellent rapport taille/performance, Phi-3.5 Mini reste solide en raisonnement.
Modèles moyens (7-9B) : le sweet spot
Les modèles 7-8B constituent souvent un premier palier utile. Ils couvrent conversation, code léger, traduction et analyse de texte, avec une qualité qui varie fortement selon le modèle. Une carte 12 Go donne de la marge, mais le débit doit être mesuré.
La quantification Q4_K_M reduit leur empreinte mémoire a environ 4-5 Go, ce qui les rend compatibles avec pratiquement n'importe quel GPU de 8 Go ou plus. Meme un Mac Mini M4 16 Go les fait tourner rapidement grâce à la mémoire unifiee.
Notre choix : Llama 3.1 8B reste le choix par défaut pour l'usage général — la génération été 2026 saute ce format (Qwen 3.6 démarre à 27B, vérifié sur ollama.com). Mistral 7B v0.3 pour le français, DeepSeek Coder V2 Lite 16B pour le code (architecture MoE, donc rapide malgré ses 16B de paramètres).
Grands modèles (13-14B) : quand il en faut plus
Les modèles 13-14B marquent un saut de qualite notable par rapport aux 7B. Ils comprennent mieux les instructions complexes, produisent du texte plus coherent sur de longs passages, et gerent mieux les taches techniques. En quantification Q4, ils demandent environ 8-9 Go de VRAM.
C'est ici que la RTX 3060 12 Go montre sa superiorite face a la RTX 4060 8 Go : ses 12 Go de VRAM permettent de faire tourner un modèle 14B en Q4 confortablement, tandis que la RTX 4060 ne peut tout simplement pas les charger.
Notre choix : Gemma 4 12B (~7,6 Go en Q4, multimodal, contexte 256K) est le nouveau défaut de cette tranche de VRAM. Les générations 2024-2025 restent valables : Qwen 2.5 14B pour la polyvalence et les langues, Phi-3 Medium 14B pour le raisonnement logique et mathématique.
Modèles XL (30-34B) : territoire serieux
Les modèles 30-34B quantifiés peuvent demander autour de 20 Go rien que pour les poids, selon le format. Une carte 24 Go peut donc convenir avec une marge de contexte limitée ; 48 Go de mémoire disponible donnent davantage de latitude.
Le runtime, la quantification, la longueur de contexte et l'offload changent fortement le résultat. Vérifiez la taille réelle du fichier avant téléchargement, puis mesurez le modèle sur la machine.
À comparer : Qwen 3.6 27B (~17 Go en Q4), GLM-4.7-Flash (30B-A3B, ~19 Go en Q4, 3B actifs donc rapide) et Qwen 3 Coder 32B pour le code — avec le même contexte et le même protocole. Le meilleur choix dépend de l'usage et du benchmark local.
Modèles XXL (70B+) : les poids lourds
Les modèles d'environ 70B constituent un palier local exigeant. Leur intérêt qualitatif doit être évalué tâche par tâche, sans les déclarer équivalents à un service cloud donné.
En Q4, les poids d'un 70B occupent souvent autour de 40 Go avant la marge de contexte et de runtime. Une carte 24 Go seule impose donc de l'offload. Les options à examiner :
- Deux GPU 24 Go — 48 Go cumulés, à condition que le runtime gère correctement le split et que la plateforme soit adaptée.
- Mémoire unifiée de 48 Go — Le chargement peut devenir possible, mais avec peu de marge selon le contexte.
- Mémoire unifiée de 128 Go ou plus — Davantage de marge pour le contexte ou une quantification moins agressive.
- Station dédiée — À comparer sur le débit mesuré, le coût total, l'énergie et les logiciels réellement utilisés.
Au-delà de 100B, la taille exacte du fichier, l'architecture du modèle et le contexte rendent toute règle simpliste dangereuse. Vérifiez le format distribué et la mémoire disponible avant de conclure.
Generation d'images : VRAM et vitesse
La generation d'images a ses propres regles. Contrairement aux LLM qui streament du texte, les modèles d'image ont besoin de la VRAM pendant toute la generation, et la vitesse depend fortement de la puissance brute du GPU (TFLOPS), pas seulement de la VRAM.
Stable Diffusion 1.5
Écosystème mature et empreinte souvent plus faible que les modèles d'image récents. La mémoire et le temps dépendent du pipeline, de la résolution, du nombre d'étapes et des optimisations.
SDXL
Résolution native plus élevée et empreinte généralement supérieure à SD 1.5. Mesurez avec le pipeline et la résolution réellement utilisés.
Flux Schnell
Variante orientée faible nombre d'étapes. La mémoire et la vitesse dépendent du backend, de la quantification et de l'offload.
Flux Dev
Variante plus lourde à évaluer selon la résolution, le nombre d'étapes, le backend et les optimisations mémoire. Aucun temps universel n'est revendiqué ici.
Quelle config pour votre budget ?
Budget 300 euros
Entree de gammeLa RTX 3060 12 Go reste un palier à comparer quand la VRAM compte davantage que la génération de la carte. Les 7-8B quantifiés sont une cible logique ; certains 14B peuvent tenir selon le fichier et le contexte. Mesurez avant de conclure.
Budget 1000 euros
Sweet spotUne mémoire unifiée de 24 Go peut charger certains 32B quantifiés avec peu de marge pour le contexte. Vérifiez la taille exacte et comparez avec une carte NVIDIA selon vos besoins CUDA, votre budget et le débit réellement mesuré.
Budget 2000 euros
Beast modeDeux cartes 24 Go fournissent 48 Go cumulés, mais imposent une plateforme, une alimentation, un refroidissement et un runtime capables de gérer le split. Une machine à mémoire unifiée de 48 Go constitue une autre approche, avec des compromis logiciels différents.
Budget 5000 euros+
Station dédiéeUne grande mémoire unifiée ouvre davantage de modèles, mais ne rend pas toute charge automatiquement rapide ou compatible. Comparez l'architecture, le runtime, la bande passante, le contexte, l'énergie et le coût total avec un protocole identique.
Questions frequentes
Guides complémentaires
Continuer par les pages les plus utiles avant d'acheter.
Poursuivez par le besoin précis : GPU, petit budget ou compatibilité Mac/eGPU.
À retenir
- Quel modèle IA sur quel hardware ? Le tableau complet 2026 : la bonne config est celle que votre machine tient, pas le tweet du jour.
- Mesurez (scan + tokens/s) avant d’acheter ou de tirer un modèle trop gros.
- Parcours : hub IA locale → Local Cockpit → preuve sur votre PC.
Sources et liens
Pour étayer Quel modèle IA sur quel hardware ? Le tableau complet 2026 et rester sur des faits mesurables :