Modèles locaux · références vérifiées le 13 septembre 2026

Llama, Qwen ou DeepSeek : quel modèle faire tourner sur votre PC ?

Commencez par un modèle adapté à votre mémoire et à votre tâche. Un gros score publié par un éditeur ne dit pas combien de temps vous attendrez sur votre ordinateur.

Par · publié le 2 mai 2026 · révisé le

Le choix pratique : pour un premier essai, comparez des modèles 3B à 8B avant de viser 70B. Pour le code, vérifiez le tag exact de Qwen Coder. Pour le raisonnement, distinguez un DeepSeek distillé du modèle complet. Ne changez pas de GPU avant d'avoir mesuré le blocage réel.

Correction éditoriale. Les anciennes vitesses annoncées ici pour des configurations non accompagnées d'une preuve OutilsIA ont été retirées. Les tableaux ci-dessous séparent les données du registre, les estimations mémoire et les mesures réellement publiées.

1. Llama 70B, Qwen 72B et DeepSeek 70B : ce qui est comparable

Ces trois références restent disponibles. Elles ne constituent ni une sélection des toutes dernières sorties, ni un classement de qualité réalisé par OutilsIA.

Fiches Ollama consultées le 13 septembre 2026. Go de téléchargement affichés, pas de VRAM garantie.
Référence exactePoids publiésUsage à comparer
Llama 3.3 70B
llama3.3:70b
Environ 43 Go
Q4_K_M
Dialogue multilingue, dont français. Pas de vitesse mesurée ici pour ce 70B.
Qwen 2.5 72B
qwen2.5:72b
Environ 47 Go
Q4_K_M
Texte multilingue et sorties structurées. Lire la licence propre au 72B, distincte des petites variantes.
DeepSeek R1 distillé 70B
deepseek-r1:70b
Environ 43 Go
Q4_K_M
Raisonnement. Variante distillée sur Llama, pas le DeepSeek R1 complet de 671B.

Sur une carte de 24 Go, aucun de ces trois ensembles de poids Q4 ne tient entièrement en VRAM. Un déchargement partiel en RAM peut permettre un essai, mais sa vitesse dépend fortement de la machine. Acheter deux cartes ou un mini-PC sur cette seule table serait prématuré.

2. Taille des poids, mémoire active et contexte : trois choses différentes

Le téléchargement ne représente qu'une partie du besoin mémoire : le runtime, les buffers et le cache du contexte s'ajoutent. La RAM système ne se transforme pas en VRAM ; déplacer du calcul vers le CPU peut ralentir la réponse.

Attention aux MoE. Qwen3-Coder 30B compte environ 30,5 milliards de paramètres totaux et 3,3 milliards actifs. Le bon tag est qwen3-coder:30b, pas qwen3-coder:32b. Le registre expose environ 18,6 Go de poids Q4 ; il faut encore prévoir de la mémoire pour l'exécution. Source Ollama.

La même distinction interdit de traiter Scout comme un petit modèle 17B. Llama 4 Scout possède 109B de paramètres totaux, Maverick 400B ; Mistral Large 3 en possède 675B. Leur mémoire locale n'est pas qualifiée dans notre catalogue : pas de compatibilité PC annoncée sur la base des seuls paramètres actifs.

3. Les ajouts au catalogue de septembre

Ces quatre entrées ont un manifeste Ollama accessible et une taille d'artefacts vérifiée. Elles restent en veille, non pilotables dans le catalogue Cockpit, en attendant une qualification locale. Ce tableau n'attribue ni victoire, ni tokens/s.

Contrôle du registre du 13 septembre 2026. Taille totale des couches en Go décimaux, arrondie.
Modèle / tagTailleCe qui reste à tester
Granite 4.2 3B
granite4.2:3b
2,24 GoPetit modèle texte : installation, français, mémoire et vitesse sur machine réelle.
Granite 4.2 8B
granite4.2:8b
5,35 GoComparer le gain utile au 3B sur la même tâche, pas sur sa seule taille.
Ornith 1.5 9B
ornith-1.5:9b
6,55 GoArtefacts dont projecteur vision. Le chemin image n'est pas validé par un test texte.
LFM2.5 8B-A1B
lfm2.5:8b
5,16 GoMoE compact : vérifier les exigences du runtime et la mémoire, pas seulement le milliard actif.

Le catalogue JSON daté contient 48 entrées texte, image et autres modalités, dont des modèles non installables. Il conserve les empreintes des manifestes vérifiés. Un tag peut évoluer : retrouver le même nom ne garantit pas les mêmes octets.

4. Ce qu'OutilsIA a réellement mesuré

Notre registre public des mesures décrit notamment Hermes 3 8B à 118,5 tok/s le 27 juillet 2026 sur RTX 4080 SUPER 16 Go avec Ollama Windows. Il décrit aussi Qwen 3.8 27B à 9,4 tok/s le 19 août, avec Ollama 0.32.14 sous WSL, contexte 2048 et placement hybride CPU/GPU.

Ce ne sont pas les trois modèles 70B du premier tableau, ni un duel de qualité à protocole identique. Les références, versions, conditions et limites sont dans le registre et le protocole de mesure. Aucune extrapolation à votre PC n'est une mesure.

Présentation de l'application OutilsIA Local Cockpit
Local Cockpit : relever le matériel et mesurer un modèle. Cette illustration n'est pas une preuve des performances du tableau.

5. Comparer sans acheter à l'aveugle

  1. Relever le PC et le runtime. Version Ollama, GPU, VRAM, RAM et espace disque disponible. L'estimateur web utilise ce que vous déclarez ; l'application relève la machine.
  2. Fixer une tâche. Un extrait de code, un résumé ou une extraction JSON avec des critères de réussite explicites et sans données sensibles.
  3. Comparer dans les mêmes conditions. Quantification, contexte, budget de sortie et protocole identifiés. Séparer chargement initial et génération ; répéter et conserver aussi les échecs.
  4. Décider sur le résultat utile. Temps total, erreurs, mémoire et qualité sur votre tâche. Un modèle plus rapide mais incorrect n'est pas un meilleur choix.

Le téléchargement public reste Local Cockpit 0.1.1-beta. La mise à jour du catalogue ne transforme pas ce binaire en 0.1.2. Les corrections et fonctions candidates ne deviennent publiques qu'avec une livraison qualifiée. Vérifier les versions livrées.

Une fois le modèle choisi, Maestro peut coordonner les agents et les tests d'un projet. Ce n'est pas une preuve automatique qu'une équipe surpasse un modèle seul.

Questions fréquentes

24 Go de VRAM suffisent-ils pour tous les modèles 30B ?

Non. La quantification, le contexte et l'architecture comptent. Comparez le poids exact à la mémoire disponible, puis testez. Les noms 30B ou 70B ne sont pas des exigences mémoire.

Hermes 3 8B est-il Hermes Agent ?

Non. hermes3:8b est un modèle. Hermes Agent est un runtime qui utilise des modèles et des outils. Comprendre la différence.

Pourquoi ne pas annoncer un vainqueur ?

Nous n'avons pas de campagne comparable sur ces modèles et ces machines permettant ce verdict. Vous avez les sources pour vérifier la disponibilité et un protocole pour produire votre propre comparaison.

Sources et méthode

Les liens des tableaux pointent vers les fiches officielles consultées le 13 septembre 2026. Les mesures OutilsIA sont séparées dans le registre. Les estimations mémoire ne sont ni des garanties de fonctionnement ni des conseils d'achat.

Comment nous testons · Champs d'une mesure · Preuves Local Cockpit · Installer Ollama · Ollama ou LM Studio · Guide VRAM · Profils matériels

Du même labo · Strategy Arena
🧪 Donnez un vrai travail à votre GPU

Essayez de tuer une stratégie de trading, en local : votre GPU explore des centaines de variantes, un holdout scellé reste invisible pendant la recherche, et le moteur Rust rend le verdict sur votre machine. App Windows/Linux gratuite — simulation éducative, aucune promesse de gain.

Télécharger le Lab gratuit → Lire : notre GPU a trouvé +172 % — et c'était un mensonge