Tableau de compatibilité, pas tableau de benchmarks
Votre machine tranche mieux qu'une moyenne théorique.
OutilsIA Local Cockpit détecte le matériel réel, le runtime Ollama exact et les modèles déjà installés. Le tableau ci-dessous aide à présélectionner ; il ne doit pas transformer une taille de modèle ou une quantité de VRAM en vitesse mesurée.
Première preuve publiée : Hermes 3 8B à 118,5 tok/s · OIA-LC-BENCH-20260727-HERMES3-8B-RTX4080S sur RTX 4080 SUPER 16 Go via Ollama Windows, le 27 juillet 2026. Elle ne généralise pas les vitesses des 14 configurations du tableau.
Les recommandations d'achat viennent après la compatibilité. OutilsIA peut conclure qu'un modèle plus léger est préférable à un nouveau GPU.
Avant d'acheter
Recevoir la dossier de configuration PC IA
Un email au lancement de PC IA Builder : 3 builds alternatifs, composants a verifier, pieges a eviter et PDF dossier de configuration. Gratuit, pas de spam.
Quel modèle IA sur quel hardware ? Le tableau complet 2026
Decision achat par taille de modele
Choisissez la VRAM selon le modele vise, pas selon le nom de la carte.
7B/14B demandent surtout 12 a 16 Go utiles. Les 32B deviennent confortables avec 24 Go. Les 70B exigent 48 Go cumules ou une grosse memoire unifiee.
La question utile est : « Ce modèle rentre-t-il sur mon matériel, puis quelle vitesse mesure-t-on réellement ? » Le tableau donne un premier filtre de compatibilité ; Local Cockpit produit la mesure.
LA question que tout le monde pose
« Est-ce que je peux charger un 70B sur 24 Go ? » « Un 32B rentre-t-il dans une mémoire unifiée de 48 Go ? » « Quel palier viser avec 16 Go de RAM ? »
Le tableau croise plus de 25 modèles avec 14 configurations pour fournir un premier filtre de compatibilité. Le débit réel dépend ensuite du fichier exact, du contexte, du runtime, des pilotes et du placement CPU/GPU.
Comment lire ce tableau
Les niveaux de quantification
- Q4_K_M — poids quantifiés autour de 4 bits, avec surcharge liée au format.
- Q8 — poids autour de 8 bits, généralement plus volumineux que Q4.
- FP16 — poids 16 bits, nettement plus lourds. Vérifiez toujours la taille du fichier distribué.
Les indicateurs de confort estimé
Ces classes servent à trier avant test. Elles ne remplacent pas un débit mesuré sur le runtime, le modèle et la quantification exacts.
- Rapide — 20+ tokens/sec. Conversation fluide, temps réel.
- OK — 5-20 tokens/sec. Utilisable, un peu d'attente.
- Lent — 1-5 tokens/sec. Patience requise. Bon pour le batch.
- Non — Ne tient pas en mémoire ou inutilisable.
VRAM vs RAM unifiee
Sur les GPU NVIDIA, le modèle doit tenir dans la VRAM (mémoire du GPU). Sur les Mac Apple Silicon, la mémoire est unifiee : CPU et GPU partagent la meme RAM, donc toute la RAM est disponible pour le modèle. C'est pourquoi un Mac Mini M4 Pro avec 48 Go peut charger des modèles qu'une RTX 4090 (24 Go VRAM) ne peut pas.
Le Mega Tableau
25+ modèles x 14 configsFaites defiler horizontalement pour voir toutes les configurations. La premiere colonne (modèle) reste fixe.
Modèles de langage (LLM)
| Modèle (quant.) | RAM requise | RTX 3060 12 Go |
RTX 4060 8 Go |
Mac Mini M4 16 Go |
RTX 4060 Ti 16 Go |
RTX 4070 Ti 12 Go |
Mac Mini M4 Pro 24 Go |
RTX 4090 24 Go |
Mac Mini M4 Pro 48 Go |
2x RTX 3090 48 Go |
Mac Studio Ultra 128 Go |
Mac Studio Ultra 192 Go |
DGX Spark 128 Go |
Laptop 16 Go RAM |
Laptop 32 Go RAM |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Petits modèles (1-3B) — Ultra rapides partout | |||||||||||||||
| Gemma 2 2B Q4 | ~1.5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | OK | Rapide |
| Qwen 2.5 3B Q4 | ~2 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | OK | Rapide |
| Llama 3.2 3B Q4 | ~2 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | OK | Rapide |
| Phi-3.5 Mini 3.8B Q4 | ~2.5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | OK | Rapide |
| Modèles moyens (7-9B) — Le sweet spot | |||||||||||||||
| Mistral 7B v0.3 Q4 | ~4.5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Lent | OK |
| Llama 3.1 8B Q4 | ~5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Lent | OK |
| Qwen 2.5 7B Q4 | ~4.5 Go | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Lent | OK |
| Gemma 2 9B Q4 | ~5.5 Go | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Lent | OK |
| DeepSeek Coder V2 Lite 16B Q4 | ~9 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Grands modèles (13-14B) — GPU correct requis | |||||||||||||||
| Qwen 2.5 14B Q4 | ~8.5 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Phi-3 Medium 14B Q4 | ~8 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Llama 3.1 8B Q8 | ~8.5 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Lent |
| Modèles XL (30-34B) — Hardware serieux requis | |||||||||||||||
| Qwen 2.5 32B Q4 | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| CodeLlama 34B Q4 | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| Yi 34B Q4 | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| DeepSeek Coder 33B Q4 | ~20 Go | Non | Non | Non | Non | Non | OK | Rapide | Rapide | Rapide | Rapide | Rapide | Rapide | Non | Non |
| Modèles XXL (70B+) — Le haut du panier | |||||||||||||||
| Llama 3.1 70B Q4 | ~40 Go | Non | Non | Non | Non | Non | Non | Non | OK | OK | Rapide | Rapide | Rapide | Non | Non |
| Qwen 2.5 72B Q4 | ~42 Go | Non | Non | Non | Non | Non | Non | Non | OK | OK | Rapide | Rapide | Rapide | Non | Non |
| Mistral Large 2 123B Q4 | ~70 Go | Non | Non | Non | Non | Non | Non | Non | Non | Non | OK | Rapide | OK | Non | Non |
Modèles de generation d'images
| Modèle | VRAM requise | RTX 3060 12 Go |
RTX 4060 8 Go |
Mac Mini M4 16 Go |
RTX 4060 Ti 16 Go |
RTX 4070 Ti 12 Go |
Mac Mini M4 Pro 24 Go |
RTX 4090 24 Go |
Mac Mini M4 Pro 48 Go |
|---|---|---|---|---|---|---|---|---|---|
| Stable Diffusion 1.5 | ~4 Go | Rapide | Rapide | OK | Rapide | Rapide | OK | Rapide | Rapide |
| SDXL | ~8 Go | OK | OK | OK | Rapide | OK | Rapide | Rapide | Rapide |
| Flux Schnell | ~8 Go | OK | OK | OK | Rapide | OK | Rapide | Rapide | Rapide |
| Flux Dev | ~12 Go | OK | Non | OK | Rapide | OK | Rapide | Rapide | Rapide |
Petits modèles (1-3B) : pour qui ?
Les modèles de 1 à 3 milliards de paramètres sont les plus accessibles, mais ils ne tournent pas littéralement sur toute machine. Vérifiez la RAM disponible, le format, le runtime et les capacités CPU/GPU ; leur intérêt principal reste une empreinte plus faible.
Cas d'usage ideaux : autocompletion de code en temps réel, chatbot embarque, resume de texte rapide, classification. Si vous avez besoin de reponses instantanees et que la tache ne demande pas un raisonnement complexe, un modèle 3B est parfait.
Notre choix : Qwen 2.5 3B offre le meilleur rapport taille/performance dans cette catégorie. Phi-3.5 Mini est excellent pour le raisonnement malgre sa petite taille.
Modèles moyens (7-9B) : le sweet spot
Les modèles 7-8B constituent souvent un premier palier utile. Ils couvrent conversation, code léger, traduction et analyse de texte, avec une qualité qui varie fortement selon le modèle. Une carte 12 Go donne de la marge, mais le débit doit être mesuré.
La quantification Q4_K_M reduit leur empreinte mémoire a environ 4-5 Go, ce qui les rend compatibles avec pratiquement n'importe quel GPU de 8 Go ou plus. Meme un Mac Mini M4 16 Go les fait tourner rapidement grâce à la mémoire unifiee.
Notre choix : Llama 3.1 8B pour l'usage général, Mistral 7B v0.3 pour le francais, DeepSeek Coder V2 Lite 16B pour le code (architecture MoE, donc rapide malgre ses 16B de parametres).
Grands modèles (13-14B) : quand il en faut plus
Les modèles 13-14B marquent un saut de qualite notable par rapport aux 7B. Ils comprennent mieux les instructions complexes, produisent du texte plus coherent sur de longs passages, et gerent mieux les taches techniques. En quantification Q4, ils demandent environ 8-9 Go de VRAM.
C'est ici que la RTX 3060 12 Go montre sa superiorite face a la RTX 4060 8 Go : ses 12 Go de VRAM permettent de faire tourner un modèle 14B en Q4 confortablement, tandis que la RTX 4060 ne peut tout simplement pas les charger.
Notre choix : Qwen 2.5 14B pour la polyvalence et les langues, Phi-3 Medium 14B pour le raisonnement logique et mathematique.
Modèles XL (30-34B) : territoire serieux
Les modèles 30-34B quantifiés peuvent demander autour de 20 Go rien que pour les poids, selon le format. Une carte 24 Go peut donc convenir avec une marge de contexte limitée ; 48 Go de mémoire disponible donnent davantage de latitude.
Le runtime, la quantification, la longueur de contexte et l'offload changent fortement le résultat. Vérifiez la taille réelle du fichier avant téléchargement, puis mesurez le modèle sur la machine.
À comparer : un 32B généraliste et un modèle code de taille proche, avec le même contexte et le même protocole. Le meilleur choix dépend de l'usage et du benchmark local.
Modèles XXL (70B+) : les poids lourds
Les modèles d'environ 70B constituent un palier local exigeant. Leur intérêt qualitatif doit être évalué tâche par tâche, sans les déclarer équivalents à un service cloud donné.
En Q4, les poids d'un 70B occupent souvent autour de 40 Go avant la marge de contexte et de runtime. Une carte 24 Go seule impose donc de l'offload. Les options à examiner :
- Deux GPU 24 Go — 48 Go cumulés, à condition que le runtime gère correctement le split et que la plateforme soit adaptée.
- Mémoire unifiée de 48 Go — Le chargement peut devenir possible, mais avec peu de marge selon le contexte.
- Mémoire unifiée de 128 Go ou plus — Davantage de marge pour le contexte ou une quantification moins agressive.
- Station dédiée — À comparer sur le débit mesuré, le coût total, l'énergie et les logiciels réellement utilisés.
Au-delà de 100B, la taille exacte du fichier, l'architecture du modèle et le contexte rendent toute règle simpliste dangereuse. Vérifiez le format distribué et la mémoire disponible avant de conclure.
Generation d'images : VRAM et vitesse
La generation d'images a ses propres regles. Contrairement aux LLM qui streament du texte, les modèles d'image ont besoin de la VRAM pendant toute la generation, et la vitesse depend fortement de la puissance brute du GPU (TFLOPS), pas seulement de la VRAM.
Stable Diffusion 1.5
Écosystème mature et empreinte souvent plus faible que les modèles d'image récents. La mémoire et le temps dépendent du pipeline, de la résolution, du nombre d'étapes et des optimisations.
SDXL
Résolution native plus élevée et empreinte généralement supérieure à SD 1.5. Mesurez avec le pipeline et la résolution réellement utilisés.
Flux Schnell
Variante orientée faible nombre d'étapes. La mémoire et la vitesse dépendent du backend, de la quantification et de l'offload.
Flux Dev
Variante plus lourde à évaluer selon la résolution, le nombre d'étapes, le backend et les optimisations mémoire. Aucun temps universel n'est revendiqué ici.
Quelle config pour votre budget ?
Budget 300 euros
Entree de gammeLa RTX 3060 12 Go reste un palier à comparer quand la VRAM compte davantage que la génération de la carte. Les 7-8B quantifiés sont une cible logique ; certains 14B peuvent tenir selon le fichier et le contexte. Mesurez avant de conclure.
Budget 1000 euros
Sweet spotUne mémoire unifiée de 24 Go peut charger certains 32B quantifiés avec peu de marge pour le contexte. Vérifiez la taille exacte et comparez avec une carte NVIDIA selon vos besoins CUDA, votre budget et le débit réellement mesuré.
Budget 2000 euros
Beast modeDeux cartes 24 Go fournissent 48 Go cumulés, mais imposent une plateforme, une alimentation, un refroidissement et un runtime capables de gérer le split. Une machine à mémoire unifiée de 48 Go constitue une autre approche, avec des compromis logiciels différents.
Budget 5000 euros+
Station dédiéeUne grande mémoire unifiée ouvre davantage de modèles, mais ne rend pas toute charge automatiquement rapide ou compatible. Comparez l'architecture, le runtime, la bande passante, le contexte, l'énergie et le coût total avec un protocole identique.
Questions frequentes
Guides complémentaires
Continuer par les pages les plus utiles avant d'acheter.
Poursuivez par le besoin précis : GPU, petit budget ou compatibilité Mac/eGPU.