Preuve · banc d'essai · 2026
Nos mesures réelles
OutilsIA ne publie pas de tokens/s inventés. Voici le banc, la méthode, la première preuve publique datée, et ce que ces chiffres ne prouvent pas.
Par Chris Drakkeng · mis à jour le 13 septembre 2026
- 118,5 tok/s — Hermes 3 8B · 4080 SUPER 16 Go · Ollama Windows · 100 % GPU · 27/07/2026.
- 9,4 tok/s — Qwen 3.8 27B · même carte · Ollama 0.32.14 WSL · 28 % CPU / 72 % GPU · 19/08/2026.
- Verdict achat ce jour-là : aucun achat urgent (la machine répond déjà).
- Une mesure ≠ promesse universelle. Mesurez la vôtre avec Local Cockpit.
| Champ | Valeur |
|---|---|
| Date | 27 juillet 2026 |
| GPU | NVIDIA GeForce RTX 4080 SUPER · 16 Go VRAM |
| RAM système | 63–64 Go détectés |
| OS / runtime | Windows 11 · Ollama Windows |
| Modèle | hermes3:8b (Hermes 3 8B) |
| Génération | 118,5 tok/s |
| Durée observée | 8 579 ms |
| Placement GPU | ~4,6 / 4,6 Go en VRAM (100 % du placement observé) |
| Outil | OutilsIA Local Cockpit (benchmark local) |
| Réf. | OIA-LC-BENCH-20260727-HERMES3-8B-RTX4080S |
Source : page Preuves Local Cockpit + capture brute associée. Aucun chiffre n'a été « embelli » pour le marketing.
| Champ | Valeur |
|---|---|
| Date | 19 août 2026 · 02:26 CEST |
| GPU | NVIDIA GeForce RTX 4080 SUPER · 16 Go (15 805 / 16 376 MiB observés) |
| OS / runtime | WSL2 · Ollama 0.32.14 (le 0.18.2 refuse le pull) |
| Modèle | qwen3.8:27b · 27,3 B · Q4_K_M · 17 Go disque / 18 Go chargé |
| Contexte | 2048 |
| Placement | 28 % CPU / 72 % GPU |
| Génération | 9,4 tok/s |
| Durée eval | 15 638 ms · 147 tokens |
| Méthode | POST /api/generate · eval_count / eval_duration (formule Local Cockpit) |
| Réf. | OIA-OLLAMA-BENCH-20260819-QWEN38-27B-RTX4080S-WSL |
Pas une capture UI Windows. Le modèle est partiellement placé en RAM système. Le modèle, le runtime et les réglages diffèrent du banc Hermes : l'écart de vitesse ne peut pas être attribué au seul placement CPU/GPU. Détail : outils fin août.
Reproduire le test standard sur mon PC · Nouvelle série documentée, pas un replay exact de ces anciens runs.
1. Pourquoi cette page existe
En 2026, beaucoup de sites listent des GPU et des modèles sans jamais lancer un runtime. OutilsIA construit un logiciel de mesure (Local Cockpit) et un banc physique. Cette page centralise ce qui est mesuré, pas estimé.
Chaque résultat précise sa date, sa machine et sa méthode. Les informations manquantes restent explicites : une observation ponctuelle ne prouve ni une performance générale ni la cause d'un écart.
2. Banc principal (déclaré)
| Composant | Config |
|---|---|
| GPU | NVIDIA GeForce RTX 4080 SUPER · 16 Go VRAM |
| RAM | 64 Go DDR5 |
| OS | Windows 11 (+ WSL2 disponible) |
| Runtime suivi | Ollama natif Windows ou WSL (identifiés séparément) |
| Familles suivies | Qwen, Hermes, Llama, Gemma, DeepSeek, Mistral |
Détail méthodologique : Comment nous testons · protocole de mesure · campagne cinq machines.
3. Les 5 niveaux de vérité
- Déclaré — l'utilisateur saisit CPU/RAM/GPU.
- Détecté — lecture machine (matériel, runtime Ollama, modèles installés).
- Estimé — compatibilité calculée (catalogue × VRAM/RAM). Jamais de tok/s fictifs.
- Mesuré — benchmark réellement lancé : tokens/s + durée.
- Vérifié terrain — capture / rapport / recette rejouable (ex. preuve 27/07).
4. Paliers pratiques (estimés, à valider par mesure)
Ces paliers aident à cadrer un budget. Ils ne remplacent pas un scan.
| VRAM | Usage typique (ordre de grandeur) | Exemples de modèles |
|---|---|---|
| 0–8 Go | Découverte, petits modèles quantifiés, CPU possible | Phi mini, Gemma 2B, Qwen 0.5–1.5B |
| 12 Go | Premier vrai ticket d'entrée CUDA | Qwen/Hermes 7–8B, certains 14B Q4 |
| 16 Go | Confort 7B–14B ; 27B en hybride | Hermes 8B 118,5 tok/s ; Qwen 3.8 27B 9,4 tok/s (offload) |
| 24 Go+ | 27B–32B plus souvent 100 % GPU | Qwen 3.8 27B devrait y tenir — pas encore mesuré ici |
Profils types commentés : exemples de rapports.
RTX 3060 12 Go, GTX 1080 Ti 11 Go, CPU only, portables iGPU : pas encore de banc public. L’estimateur web peut projeter ces configs ; ce n’est pas une mesure. Un seul GPU a des tokens/s publiés : RTX 4080 SUPER 16 Go.
5. Comment reproduire chez vous
- Installer OutilsIA Local Cockpit (Windows / Linux).
- Laisser détecter GPU, VRAM, RAM, Ollama.
- Choisir un modèle installé (ex.
hermes3:8b). - Lancer le benchmark court → noter tok/s + durée + VRAM.
- Décider : runtime, modèle, RAM, VRAM — ou aucun achat.
Estimateur sans install : Mon PC peut-il ?
FAQ
Quel est le résultat benchmark public le plus précis d'OutilsIA ?
Deux mesures ponctuelles sur la même RTX 4080 SUPER 16 Go : Hermes 3 8B à 118,5 tok/s (27/07, Ollama Windows, 100 % GPU) et Qwen 3.8 27B à 9,4 tok/s (19/08, Ollama 0.32.14 WSL, 28 % CPU / 72 % GPU).
Est-ce que 118,5 tok/s vaut sur mon PC ?
Non. Drivers, quantization, contexte, charge système et VRAM changent tout. Local Cockpit mesure votre machine.
Comment OutilsIA distingue estimé et mesuré ?
Estimé = compatibilité calculée. Mesuré = benchmark réellement exécuté (tok/s + durée). On ne fabrique jamais de tokens/s.
Pages liées
- Preuves Local Cockpit — capture et détail de la recette 27/07
- Comment nous testons — niveaux de preuve
- Protocole de mesure — mêmes champs, JSON brut
- Campagne cinq machines — 4 slots encore vides
- Tunnel téléchargement → banc — agrégats, pas d’identité
- Local vs cloud — break-even
- Maestro v0.7 dogfood — preuve agents
- Arrangement suffisant — doctrine modèle min.
Chris Drakkeng — OutilsIA. Quand un chiffre n'est pas mesuré ici, la page le dit.
Pas d'affiliation Amazon sur cette page.