Tableau de compatibilité, pas tableau de benchmarks

Votre machine tranche mieux qu'une moyenne théorique.

OutilsIA Local Cockpit détecte le matériel réel, le runtime Ollama exact et les modèles déjà installés. Le tableau ci-dessous aide à présélectionner ; il ne doit pas transformer une taille de modèle ou une quantité de VRAM en vitesse mesurée.

DétectéCPU, RAM, GPU, VRAM, stockage, Windows/WSL/Linux et modèles locaux.
EstiméLes combinaisons modèle/matériel non exécutées physiquement.
MesuréUn résultat daté avec modèle, runtime, build, capture brute et SHA-256.

Première preuve publiée : Hermes 3 8B à 118,5 tok/s sur RTX 4080 SUPER 16 Go via Ollama Windows, le 27 juillet 2026. Elle ne généralise pas les vitesses des 14 configurations du tableau.

Les recommandations d'achat viennent après la compatibilité. OutilsIA peut conclure qu'un modèle plus léger est préférable à un nouveau GPU.

Avant d'acheter

Recevoir le dossier de configuration PC IA

Un email au lancement de PC IA Builder : 3 builds alternatifs, composants a verifier, pieges a eviter et PDF dossier de configuration. Gratuit, pas de spam.

Accueil Blog Quel modèle IA sur quel hardware
Article de référence

Quel modèle IA sur quel hardware ? Le tableau complet (mis à jour août 2026)

Decision achat par taille de modele

Choisissez la VRAM selon le modele vise, pas selon le nom de la carte.

7B/14B demandent surtout 12 a 16 Go utiles. Les 32B deviennent confortables avec 24 Go. Les 70B exigent 48 Go cumules ou une grosse memoire unifiee.

7B / 14B budget RTX 3060 12 Go Le palier qui evite le piege des GPU 8 Go.
14B confortable RTX 4070 Ti Super 16 Go Plus de marge pour contexte, image et multitache.
32B / gros contexte RTX 3090 24 Go Le meilleur saut VRAM avant le multi-GPU.

La question utile est : « Ce modèle rentre-t-il sur mon matériel, puis quelle vitesse mesure-t-on réellement ? » Le tableau donne un premier filtre de compatibilité ; Local Cockpit produit la mesure.

Par l'équipe OutilsIA Mis à jour août 2026 · publié avril 2026 18 min de lecture

LA question que tout le monde pose

« Est-ce que je peux charger un 70B sur 24 Go ? » « Un 32B rentre-t-il dans une mémoire unifiée de 48 Go ? » « Quel palier viser avec 16 Go de RAM ? »

Le tableau croise plus de 25 modèles avec 14 configurations pour fournir un premier filtre de compatibilité. Le débit réel dépend ensuite du fichier exact, du contexte, du runtime, des pilotes et du placement CPU/GPU.

Comment lire ce tableau

Les niveaux de quantification

  • Q4_K_M — poids quantifiés autour de 4 bits, avec surcharge liée au format.
  • Q8 — poids autour de 8 bits, généralement plus volumineux que Q4.
  • FP16 — poids 16 bits, nettement plus lourds. Vérifiez toujours la taille du fichier distribué.

Les indicateurs de confort estimé

Ces classes servent à trier avant test. Elles ne remplacent pas un débit mesuré sur le runtime, le modèle et la quantification exacts.

  • Rapide — 20+ tokens/sec. Conversation fluide, temps réel.
  • OK — 5-20 tokens/sec. Utilisable, un peu d'attente.
  • Lent — 1-5 tokens/sec. Patience requise. Bon pour le batch.
  • Non — Ne tient pas en mémoire ou inutilisable.

VRAM vs RAM unifiee

Sur les GPU NVIDIA, le modèle doit tenir dans la VRAM (mémoire du GPU). Sur les Mac Apple Silicon, la mémoire est unifiee : CPU et GPU partagent la meme RAM, donc toute la RAM est disponible pour le modèle. C'est pourquoi un Mac Mini M4 Pro avec 48 Go peut charger des modèles qu'une RTX 4090 (24 Go VRAM) ne peut pas.

Le Mega Tableau

25+ modèles x 14 configs

Faites defiler horizontalement pour voir toutes les configurations. La premiere colonne (modèle) reste fixe.

Modèles de langage (LLM)

Modèle (quant.) RAM requise RTX 3060
12 Go
RTX 4060
8 Go
Mac Mini M4
16 Go
RTX 4060 Ti
16 Go
RTX 4070 Ti
12 Go
Mac Mini M4 Pro
24 Go
RTX 4090
24 Go
Mac Mini M4 Pro
48 Go
2x RTX 3090
48 Go
Mac Studio Ultra
128 Go
Mac Studio Ultra
192 Go
DGX Spark
128 Go
Laptop
16 Go RAM
Laptop
32 Go RAM
Petits modèles (1-3B) — Ultra rapides partout
Gemma 2 2B Q4 ~1.5 Go Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide OK Rapide
Qwen 2.5 3B Q4 ~2 Go Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide OK Rapide
Llama 3.2 3B Q4 ~2 Go Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide OK Rapide
Phi-3.5 Mini 3.8B Q4 ~2.5 Go Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide OK Rapide
Modèles moyens (7-9B) — Le sweet spot
Mistral 7B v0.3 Q4 ~4.5 Go Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Lent OK
Llama 3.1 8B Q4 ~5 Go Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Lent OK
Qwen 2.5 7B Q4 ~4.5 Go Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Lent OK
Gemma 2 9B Q4 ~5.5 Go Rapide OK Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Rapide Lent OK
DeepSeek Coder V2 Lite 16B Q4 ~9 Go OK Non OK Rapide OK Rapide Rapide Rapide Rapide Rapide Rapide Rapide Non Lent
Grands modèles (13-14B) — GPU correct requis
Qwen 2.5 14B Q4 ~8.5 Go OK Non OK Rapide OK Rapide Rapide Rapide Rapide Rapide Rapide Rapide Non Lent
Phi-3 Medium 14B Q4 ~8 Go OK Non OK Rapide OK Rapide Rapide Rapide Rapide Rapide Rapide Rapide Non Lent
Llama 3.1 8B Q8 ~8.5 Go OK Non OK Rapide OK Rapide Rapide Rapide Rapide Rapide Rapide Rapide Non Lent
Gemma 4 12B Q4 estimé ~7.6 Go OK Non OK Rapide OK Rapide Rapide Rapide Rapide Rapide Rapide Rapide Non Lent
Modèles XL (30-34B) — Hardware serieux requis
Qwen 3.6 27B Q4 estimé ~17 Go Non Non Non Non Non OK Rapide Rapide Rapide Rapide Rapide Rapide Non Non
GLM-4.7-Flash 30B-A3B Q4 estimé ~19 Go Non Non Non Non Non OK Rapide Rapide Rapide Rapide Rapide Rapide Non Non
Qwen 3 Coder 32B Q4 estimé ~20 Go Non Non Non Non Non OK Rapide Rapide Rapide Rapide Rapide Rapide Non Non
Qwen 2.5 32B Q4 ~20 Go Non Non Non Non Non OK Rapide Rapide Rapide Rapide Rapide Rapide Non Non
CodeLlama 34B Q4 ~20 Go Non Non Non Non Non OK Rapide Rapide Rapide Rapide Rapide Rapide Non Non
Yi 34B Q4 ~20 Go Non Non Non Non Non OK Rapide Rapide Rapide Rapide Rapide Rapide Non Non
DeepSeek Coder 33B Q4 ~20 Go Non Non Non Non Non OK Rapide Rapide Rapide Rapide Rapide Rapide Non Non
Modèles XXL (70B+) — Le haut du panier
Llama 3.1 70B Q4 ~40 Go Non Non Non Non Non Non Non OK OK Rapide Rapide Rapide Non Non
Qwen 2.5 72B Q4 ~42 Go Non Non Non Non Non Non Non OK OK Rapide Rapide Rapide Non Non
Mistral Large 2 123B Q4 ~70 Go Non Non Non Non Non Non Non Non Non OK Rapide OK Non Non

Quoi de neuf à l'été 2026

Quatre familles sont sorties depuis la première version de ce tableau. Elles sont intégrées ci-dessus avec un statut estimé — tailles Q4 relevées sur le catalogue OutilsIA et vérifiées sur ollama.com, aucune vitesse mesurée :

  • Gemma 4 (Google) : 12B dense (~7,6 Go en Q4), formats edge E2B/E4B pour les petites machines, multimodal, contexte 256K.
  • Qwen 3.6 (Alibaba) : démarre à 27B (~17 Go en Q4), avec un 35B-A3B MoE au-dessus — pas de 8B dans cette génération.
  • GLM-4.7 (Z.ai) : la variante Flash 30B-A3B (~19 Go en Q4, 3B actifs) est celle qui vise le PC personnel.
  • Kimi K2.7 Code : 1T MoE, ~595 Go en Q4 — cité pour situer le plafond, hors de portée d'une machine personnelle.

Pour croiser ces modèles avec votre configuration exacte, le simulateur IA locale s'appuie sur le même catalogue, tenu à jour.

Et les RTX 50 ?

Le tableau garde ses 14 configurations : la génération RTX 50 ne change pas la lecture, elle décale les paliers. La RTX 5090 et ses 32 Go de VRAM se placent un cran au-dessus de la RTX 4090 24 Go : les 32B en Q4 (~20 Go) y tournent avec une vraie marge de contexte, mais un 70B dense reste hors de portée d'une seule carte. Les colonnes RTX 4090 restent donc un bon proxy « 24 Go et plus ». Le détail carte par carte est dans le guide GPU pour l'IA locale.

Modèles de generation d'images

Modèle VRAM requise RTX 3060
12 Go
RTX 4060
8 Go
Mac Mini M4
16 Go
RTX 4060 Ti
16 Go
RTX 4070 Ti
12 Go
Mac Mini M4 Pro
24 Go
RTX 4090
24 Go
Mac Mini M4 Pro
48 Go
Stable Diffusion 1.5 ~4 Go Rapide Rapide OK Rapide Rapide OK Rapide Rapide
SDXL ~8 Go OK OK OK Rapide OK Rapide Rapide Rapide
Flux Schnell ~8 Go OK OK OK Rapide OK Rapide Rapide Rapide
Flux Dev ~12 Go OK Non OK Rapide OK Rapide Rapide Rapide

Petits modèles (1-3B) : pour qui ?

Les modèles de 1 à 3 milliards de paramètres sont les plus accessibles, mais ils ne tournent pas littéralement sur toute machine. Vérifiez la RAM disponible, le format, le runtime et les capacités CPU/GPU ; leur intérêt principal reste une empreinte plus faible.

Cas d'usage ideaux : autocompletion de code en temps réel, chatbot embarque, resume de texte rapide, classification. Si vous avez besoin de reponses instantanees et que la tache ne demande pas un raisonnement complexe, un modèle 3B est parfait.

Notre choix : Gemma 4 en format edge (E2B/E4B), la déclinaison compacte de la génération 2026, à tester en priorité sur ce segment. Les générations 2024-2025 restent valables : Qwen 2.5 3B garde un excellent rapport taille/performance, Phi-3.5 Mini reste solide en raisonnement.

Modèles moyens (7-9B) : le sweet spot

Les modèles 7-8B constituent souvent un premier palier utile. Ils couvrent conversation, code léger, traduction et analyse de texte, avec une qualité qui varie fortement selon le modèle. Une carte 12 Go donne de la marge, mais le débit doit être mesuré.

La quantification Q4_K_M reduit leur empreinte mémoire a environ 4-5 Go, ce qui les rend compatibles avec pratiquement n'importe quel GPU de 8 Go ou plus. Meme un Mac Mini M4 16 Go les fait tourner rapidement grâce à la mémoire unifiee.

Notre choix : Llama 3.1 8B reste le choix par défaut pour l'usage général — la génération été 2026 saute ce format (Qwen 3.6 démarre à 27B, vérifié sur ollama.com). Mistral 7B v0.3 pour le français, DeepSeek Coder V2 Lite 16B pour le code (architecture MoE, donc rapide malgré ses 16B de paramètres).

Grands modèles (13-14B) : quand il en faut plus

Les modèles 13-14B marquent un saut de qualite notable par rapport aux 7B. Ils comprennent mieux les instructions complexes, produisent du texte plus coherent sur de longs passages, et gerent mieux les taches techniques. En quantification Q4, ils demandent environ 8-9 Go de VRAM.

C'est ici que la RTX 3060 12 Go montre sa superiorite face a la RTX 4060 8 Go : ses 12 Go de VRAM permettent de faire tourner un modèle 14B en Q4 confortablement, tandis que la RTX 4060 ne peut tout simplement pas les charger.

Notre choix : Gemma 4 12B (~7,6 Go en Q4, multimodal, contexte 256K) est le nouveau défaut de cette tranche de VRAM. Les générations 2024-2025 restent valables : Qwen 2.5 14B pour la polyvalence et les langues, Phi-3 Medium 14B pour le raisonnement logique et mathématique.

Modèles XL (30-34B) : territoire serieux

Les modèles 30-34B quantifiés peuvent demander autour de 20 Go rien que pour les poids, selon le format. Une carte 24 Go peut donc convenir avec une marge de contexte limitée ; 48 Go de mémoire disponible donnent davantage de latitude.

Le runtime, la quantification, la longueur de contexte et l'offload changent fortement le résultat. Vérifiez la taille réelle du fichier avant téléchargement, puis mesurez le modèle sur la machine.

À comparer : Qwen 3.6 27B (~17 Go en Q4), GLM-4.7-Flash (30B-A3B, ~19 Go en Q4, 3B actifs donc rapide) et Qwen 3 Coder 32B pour le code — avec le même contexte et le même protocole. Le meilleur choix dépend de l'usage et du benchmark local.

Modèles XXL (70B+) : les poids lourds

Les modèles d'environ 70B constituent un palier local exigeant. Leur intérêt qualitatif doit être évalué tâche par tâche, sans les déclarer équivalents à un service cloud donné.

En Q4, les poids d'un 70B occupent souvent autour de 40 Go avant la marge de contexte et de runtime. Une carte 24 Go seule impose donc de l'offload. Les options à examiner :

  • Deux GPU 24 Go — 48 Go cumulés, à condition que le runtime gère correctement le split et que la plateforme soit adaptée.
  • Mémoire unifiée de 48 Go — Le chargement peut devenir possible, mais avec peu de marge selon le contexte.
  • Mémoire unifiée de 128 Go ou plus — Davantage de marge pour le contexte ou une quantification moins agressive.
  • Station dédiée — À comparer sur le débit mesuré, le coût total, l'énergie et les logiciels réellement utilisés.

Au-delà de 100B, la taille exacte du fichier, l'architecture du modèle et le contexte rendent toute règle simpliste dangereuse. Vérifiez le format distribué et la mémoire disponible avant de conclure.

Generation d'images : VRAM et vitesse

La generation d'images a ses propres regles. Contrairement aux LLM qui streament du texte, les modèles d'image ont besoin de la VRAM pendant toute la generation, et la vitesse depend fortement de la puissance brute du GPU (TFLOPS), pas seulement de la VRAM.

Stable Diffusion 1.5

Écosystème mature et empreinte souvent plus faible que les modèles d'image récents. La mémoire et le temps dépendent du pipeline, de la résolution, du nombre d'étapes et des optimisations.

SDXL

Résolution native plus élevée et empreinte généralement supérieure à SD 1.5. Mesurez avec le pipeline et la résolution réellement utilisés.

Flux Schnell

Variante orientée faible nombre d'étapes. La mémoire et la vitesse dépendent du backend, de la quantification et de l'offload.

Flux Dev

Variante plus lourde à évaluer selon la résolution, le nombre d'étapes, le backend et les optimisations mémoire. Aucun temps universel n'est revendiqué ici.

Quelle config pour votre budget ?

Budget 300 euros

Entree de gamme
Hardware
RTX 3060 12 Go (occasion)
Modèle recommande
Llama 3.1 8B Q4
Performance
À mesurer sur le modèle exact

La RTX 3060 12 Go reste un palier à comparer quand la VRAM compte davantage que la génération de la carte. Les 7-8B quantifiés sont une cible logique ; certains 14B peuvent tenir selon le fichier et le contexte. Mesurez avant de conclure.

Budget 1000 euros

Sweet spot
Hardware
Mac Mini M4 Pro 24 Go
Modèle recommande
Qwen 2.5 32B Q4
Performance
À mesurer selon le runtime

Une mémoire unifiée de 24 Go peut charger certains 32B quantifiés avec peu de marge pour le contexte. Vérifiez la taille exacte et comparez avec une carte NVIDIA selon vos besoins CUDA, votre budget et le débit réellement mesuré.

Budget 2000 euros

Beast mode
Hardware
2x RTX 3090 48 Go total
Modèle recommande
Llama 3.1 70B Q4
Performance
À mesurer en mode split

Deux cartes 24 Go fournissent 48 Go cumulés, mais imposent une plateforme, une alimentation, un refroidissement et un runtime capables de gérer le split. Une machine à mémoire unifiée de 48 Go constitue une autre approche, avec des compromis logiciels différents.

Budget 5000 euros+

Station dédiée
Hardware
Mac Studio M4 Ultra 128 Go / DGX Spark
Modèle recommande
Gros modèles quantifiés à valider
Performance
À mesurer sur chaque modèle

Une grande mémoire unifiée ouvre davantage de modèles, mais ne rend pas toute charge automatiquement rapide ou compatible. Comparez l'architecture, le runtime, la bande passante, le contexte, l'énergie et le coût total avec un protocole identique.

Questions frequentes

Un modèle dense 70B en Q4 demande souvent autour de 40 Go pour les poids, plus une marge pour le contexte et le runtime. Une carte 24 Go seule impose donc de l'offload. Comparez une mémoire unifiée plus large ou un multi-GPU correctement configuré, puis mesurez le débit réel.
La quantification réduit la précision des poids pour économiser de la mémoire. Q4 est beaucoup plus compact que Q8, lui-même plus compact que FP16. Le fichier réel contient aussi des métadonnées et varie selon le format : vérifiez sa taille et testez la qualité sur votre tâche.
Cela dépend du modèle et des logiciels. Une RTX haut de gamme bénéficie de CUDA et d'une forte bande passante dédiée ; une machine Apple à grande mémoire unifiée peut charger des modèles qui dépassent 24 Go. Le silence, l'énergie et le débit varient selon la configuration exacte : aucun vainqueur universel n'est déclaré sans benchmark comparable.

À retenir

Sources et liens

Pour étayer Quel modèle IA sur quel hardware ? Le tableau complet 2026 et rester sur des faits mesurables :

Suite dans le silo IA locale
Hub IA locale Preuves Local Cockpit Machine puis orchestre Installer Ollama Local Cockpit

Articles liés

Meilleur OS pour IA locale 2026 : Linux vs Windows vs macOS
2x RTX 3090 (48 Go VRAM) : quels modèles IA faire tourner en local ?
Mac Mini M4 pour IA locale 2026 : quel modèle choisir ?
Quel matériel pour egaler Claude Code en local ? Guide hardware 2026
AutoResearch GPU : benchmarker automatiquement vos configs d'inf&ea...
Meilleure IA gratuite 2026 : top 10 comparatif complet
🚀 Bientôt Lancement prévu été 2026

PC IA Builder Premium

Configurateur complet : 3 builds alternatifs (silencieux / puissance / value), projection IA workloads détaillée, analyse bottleneck, PDF dossier de configuration. Sois prévenu·e du lancement.