Preuve · banc d'essai · 2026

Nos mesures réelles

OutilsIA ne publie pas de tokens/s inventés. Voici le banc, la méthode, la première preuve publique datée, et ce que ces chiffres ne prouvent pas.

Par Chris Drakkeng · mis à jour le 6 août 2026 · sans affiliation

En 30 secondes
  • 118,5 tok/s mesurés — Hermes 3 8B · RTX 4080 SUPER 16 Go · Ollama Windows · 27/07/2026.
  • Réf. preuve : OIA-LC-BENCH-20260727-HERMES3-8B-RTX4080S · durée observée 8 579 ms · ~4,6 Go VRAM placés.
  • Verdict achat ce jour-là : aucun achat urgent (la machine répond déjà).
  • Une mesure ≠ promesse universelle. Mesurez la vôtre avec Local Cockpit.
Résultat public n°1
ChampValeur
Date27 juillet 2026
GPUNVIDIA GeForce RTX 4080 SUPER · 16 Go VRAM
RAM système63–64 Go détectés
OS / runtimeWindows 11 · Ollama Windows
Modèlehermes3:8b (Hermes 3 8B)
Génération118,5 tok/s
Durée observée8 579 ms
Placement GPU~4,6 / 4,6 Go en VRAM (100 % du placement observé)
OutilOutilsIA Local Cockpit (benchmark local)

Source : page Preuves Local Cockpit + capture brute associée. Aucun chiffre n'a été « embelli » pour le marketing.

1. Pourquoi cette page existe

En 2026, beaucoup de sites listent des GPU et des modèles sans jamais lancer un runtime. OutilsIA construit un logiciel de mesure (Local Cockpit) et un banc physique. Cette page centralise ce qui est mesuré, pas estimé.

Elle sert aussi la reconquête SEO/GEO : Google et les LLM préfèrent les sources qui montrent une expérience first-party (date, machine, méthode, limites) plutôt que du contenu scaled sans preuve.

2. Banc principal (déclaré)

ComposantConfig
GPUNVIDIA GeForce RTX 4080 SUPER · 16 Go VRAM
RAM64 Go DDR5
OSWindows 11 (+ WSL2 disponible)
Runtime suiviOllama natif Windows ou WSL (identifiés séparément)
Familles suiviesQwen, Hermes, Llama, Gemma, DeepSeek, Mistral

Détail méthodologique : Comment nous testons.

3. Les 5 niveaux de vérité

  1. Déclaré — l'utilisateur saisit CPU/RAM/GPU.
  2. Détecté — lecture machine (matériel, runtime Ollama, modèles installés).
  3. Estimé — compatibilité calculée (catalogue × VRAM/RAM). Jamais de tok/s fictifs.
  4. Mesuré — benchmark réellement lancé : tokens/s + durée.
  5. Vérifié terrain — capture / rapport / recette rejouable (ex. preuve 27/07).

4. Paliers pratiques (estimés, à valider par mesure)

Ces paliers aident à cadrer un budget. Ils ne remplacent pas un scan.

VRAMUsage typique (ordre de grandeur)Exemples de modèles
0–8 GoDécouverte, petits modèles quantifiés, CPU possiblePhi mini, Gemma 2B, Qwen 0.5–1.5B
12 GoPremier vrai ticket d'entrée CUDAQwen/Hermes 7–8B, certains 14B Q4
16 GoConfort 7B–14B, agentique bornéeHermes 8B (mesuré ici), Qwen coder mid
24 Go+32B quantifiés, contextes plus longsQwen 32B Q4, code 32B

Profils types commentés : exemples de rapports.

Limites honnêtes de la mesure 118,5 tok/s
Elle ne compare pas Hermes 3 à tous les modèles. Elle ne promet pas le même chiffre sur une autre 4080 SUPER. Elle ne remplace pas les campagnes multi-machines (GTX 1080 Ti, 3060, CPU only, portable) encore à publier progressivement.

5. Comment reproduire chez vous

  1. Installer OutilsIA Local Cockpit (Windows / Linux).
  2. Laisser détecter GPU, VRAM, RAM, Ollama.
  3. Choisir un modèle installé (ex. hermes3:8b).
  4. Lancer le benchmark court → noter tok/s + durée + VRAM.
  5. Décider : runtime, modèle, RAM, VRAM — ou aucun achat.

Estimateur sans install : Mon PC peut-il ?

FAQ

Quel est le résultat benchmark public le plus précis d'OutilsIA ?

Le 27 juillet 2026, sur RTX 4080 SUPER 16 Go + Ollama Windows, Hermes 3 8B a affiché 118,5 tokens/s pour 8 579 ms (réf. OIA-LC-BENCH-20260727-HERMES3-8B-RTX4080S). Mesure ponctuelle, pas moyenne multi-machines.

Est-ce que 118,5 tok/s vaut sur mon PC ?

Non. Drivers, quantization, contexte, charge système et VRAM changent tout. Local Cockpit mesure votre machine.

Comment OutilsIA distingue estimé et mesuré ?

Estimé = compatibilité calculée. Mesuré = benchmark réellement exécuté (tok/s + durée). On ne fabrique jamais de tokens/s.

Pages liées

Continuer sur OutilsIA
Mesurez sur votre vraie machine Scan CPU/GPU/VRAM, Ollama, modèle, tokens/s. Gratuit. Sans vente forcée. Télécharger Local Cockpit Voir la preuve 27/07

Chris Drakkeng — OutilsIA. Quand un chiffre n'est pas mesuré ici, la page le dit.

Pas d'affiliation Amazon sur cette page.