Preuve · banc d'essai · 2026

Nos mesures réelles

OutilsIA ne publie pas de tokens/s inventés. Voici le banc, la méthode, la première preuve publique datée, et ce que ces chiffres ne prouvent pas.

Par Chris Drakkeng · mis à jour le 13 septembre 2026

Source unique tok/s citables. Un article, une fiche GPU ou l’estimateur web peut renvoyer ici. Ils ne doivent pas inventer un second chiffre. JSON : /facts/benchmarks.json.
En 30 secondes
  • 118,5 tok/s — Hermes 3 8B · 4080 SUPER 16 Go · Ollama Windows · 100 % GPU · 27/07/2026.
  • 9,4 tok/s — Qwen 3.8 27B · même carte · Ollama 0.32.14 WSL · 28 % CPU / 72 % GPU · 19/08/2026.
  • Verdict achat ce jour-là : aucun achat urgent (la machine répond déjà).
  • Une mesure ≠ promesse universelle. Mesurez la vôtre avec Local Cockpit.
Résultat public n°1
ChampValeur
Date27 juillet 2026
GPUNVIDIA GeForce RTX 4080 SUPER · 16 Go VRAM
RAM système63–64 Go détectés
OS / runtimeWindows 11 · Ollama Windows
Modèlehermes3:8b (Hermes 3 8B)
Génération118,5 tok/s
Durée observée8 579 ms
Placement GPU~4,6 / 4,6 Go en VRAM (100 % du placement observé)
OutilOutilsIA Local Cockpit (benchmark local)
Réf.OIA-LC-BENCH-20260727-HERMES3-8B-RTX4080S

Source : page Preuves Local Cockpit + capture brute associée. Aucun chiffre n'a été « embelli » pour le marketing.

Résultat public n°2
ChampValeur
Date19 août 2026 · 02:26 CEST
GPUNVIDIA GeForce RTX 4080 SUPER · 16 Go (15 805 / 16 376 MiB observés)
OS / runtimeWSL2 · Ollama 0.32.14 (le 0.18.2 refuse le pull)
Modèleqwen3.8:27b · 27,3 B · Q4_K_M · 17 Go disque / 18 Go chargé
Contexte2048
Placement28 % CPU / 72 % GPU
Génération9,4 tok/s
Durée eval15 638 ms · 147 tokens
MéthodePOST /api/generate · eval_count / eval_duration (formule Local Cockpit)
Réf.OIA-OLLAMA-BENCH-20260819-QWEN38-27B-RTX4080S-WSL

Pas une capture UI Windows. Le modèle est partiellement placé en RAM système. Le modèle, le runtime et les réglages diffèrent du banc Hermes : l'écart de vitesse ne peut pas être attribué au seul placement CPU/GPU. Détail : outils fin août.

Reproduire le test standard sur mon PC · Nouvelle série documentée, pas un replay exact de ces anciens runs.

1. Pourquoi cette page existe

En 2026, beaucoup de sites listent des GPU et des modèles sans jamais lancer un runtime. OutilsIA construit un logiciel de mesure (Local Cockpit) et un banc physique. Cette page centralise ce qui est mesuré, pas estimé.

Chaque résultat précise sa date, sa machine et sa méthode. Les informations manquantes restent explicites : une observation ponctuelle ne prouve ni une performance générale ni la cause d'un écart.

2. Banc principal (déclaré)

ComposantConfig
GPUNVIDIA GeForce RTX 4080 SUPER · 16 Go VRAM
RAM64 Go DDR5
OSWindows 11 (+ WSL2 disponible)
Runtime suiviOllama natif Windows ou WSL (identifiés séparément)
Familles suiviesQwen, Hermes, Llama, Gemma, DeepSeek, Mistral

Détail méthodologique : Comment nous testons · protocole de mesure · campagne cinq machines.

3. Les 5 niveaux de vérité

  1. Déclaré — l'utilisateur saisit CPU/RAM/GPU.
  2. Détecté — lecture machine (matériel, runtime Ollama, modèles installés).
  3. Estimé — compatibilité calculée (catalogue × VRAM/RAM). Jamais de tok/s fictifs.
  4. Mesuré — benchmark réellement lancé : tokens/s + durée.
  5. Vérifié terrain — capture / rapport / recette rejouable (ex. preuve 27/07).

4. Paliers pratiques (estimés, à valider par mesure)

Ces paliers aident à cadrer un budget. Ils ne remplacent pas un scan.

VRAMUsage typique (ordre de grandeur)Exemples de modèles
0–8 GoDécouverte, petits modèles quantifiés, CPU possiblePhi mini, Gemma 2B, Qwen 0.5–1.5B
12 GoPremier vrai ticket d'entrée CUDAQwen/Hermes 7–8B, certains 14B Q4
16 GoConfort 7B–14B ; 27B en hybrideHermes 8B 118,5 tok/s ; Qwen 3.8 27B 9,4 tok/s (offload)
24 Go+27B–32B plus souvent 100 % GPUQwen 3.8 27B devrait y tenir — pas encore mesuré ici

Profils types commentés : exemples de rapports.

Non mesuré ici (à ne pas citer comme tok/s OutilsIA)
RTX 3060 12 Go, GTX 1080 Ti 11 Go, CPU only, portables iGPU : pas encore de banc public. L’estimateur web peut projeter ces configs ; ce n’est pas une mesure. Un seul GPU a des tokens/s publiés : RTX 4080 SUPER 16 Go.

5. Comment reproduire chez vous

  1. Installer OutilsIA Local Cockpit (Windows / Linux).
  2. Laisser détecter GPU, VRAM, RAM, Ollama.
  3. Choisir un modèle installé (ex. hermes3:8b).
  4. Lancer le benchmark court → noter tok/s + durée + VRAM.
  5. Décider : runtime, modèle, RAM, VRAM — ou aucun achat.

Estimateur sans install : Mon PC peut-il ?

FAQ

Quel est le résultat benchmark public le plus précis d'OutilsIA ?

Deux mesures ponctuelles sur la même RTX 4080 SUPER 16 Go : Hermes 3 8B à 118,5 tok/s (27/07, Ollama Windows, 100 % GPU) et Qwen 3.8 27B à 9,4 tok/s (19/08, Ollama 0.32.14 WSL, 28 % CPU / 72 % GPU).

Est-ce que 118,5 tok/s vaut sur mon PC ?

Non. Drivers, quantization, contexte, charge système et VRAM changent tout. Local Cockpit mesure votre machine.

Comment OutilsIA distingue estimé et mesuré ?

Estimé = compatibilité calculée. Mesuré = benchmark réellement exécuté (tok/s + durée). On ne fabrique jamais de tokens/s.

Pages liées

Mesurez sur votre vraie machine Scan CPU/GPU/VRAM, Ollama, modèle, tokens/s. Gratuit. Sans vente forcée. Télécharger Local Cockpit Voir la preuve 27/07

Chris Drakkeng — OutilsIA. Quand un chiffre n'est pas mesuré ici, la page le dit.

Pas d'affiliation Amazon sur cette page.