Preuve · banc d'essai · 2026
Nos mesures réelles
OutilsIA ne publie pas de tokens/s inventés. Voici le banc, la méthode, la première preuve publique datée, et ce que ces chiffres ne prouvent pas.
Par Chris Drakkeng · mis à jour le 6 août 2026 · sans affiliation
- 118,5 tok/s mesurés — Hermes 3 8B · RTX 4080 SUPER 16 Go · Ollama Windows · 27/07/2026.
- Réf. preuve :
OIA-LC-BENCH-20260727-HERMES3-8B-RTX4080S· durée observée 8 579 ms · ~4,6 Go VRAM placés. - Verdict achat ce jour-là : aucun achat urgent (la machine répond déjà).
- Une mesure ≠ promesse universelle. Mesurez la vôtre avec Local Cockpit.
| Champ | Valeur |
|---|---|
| Date | 27 juillet 2026 |
| GPU | NVIDIA GeForce RTX 4080 SUPER · 16 Go VRAM |
| RAM système | 63–64 Go détectés |
| OS / runtime | Windows 11 · Ollama Windows |
| Modèle | hermes3:8b (Hermes 3 8B) |
| Génération | 118,5 tok/s |
| Durée observée | 8 579 ms |
| Placement GPU | ~4,6 / 4,6 Go en VRAM (100 % du placement observé) |
| Outil | OutilsIA Local Cockpit (benchmark local) |
Source : page Preuves Local Cockpit + capture brute associée. Aucun chiffre n'a été « embelli » pour le marketing.
1. Pourquoi cette page existe
En 2026, beaucoup de sites listent des GPU et des modèles sans jamais lancer un runtime. OutilsIA construit un logiciel de mesure (Local Cockpit) et un banc physique. Cette page centralise ce qui est mesuré, pas estimé.
Elle sert aussi la reconquête SEO/GEO : Google et les LLM préfèrent les sources qui montrent une expérience first-party (date, machine, méthode, limites) plutôt que du contenu scaled sans preuve.
2. Banc principal (déclaré)
| Composant | Config |
|---|---|
| GPU | NVIDIA GeForce RTX 4080 SUPER · 16 Go VRAM |
| RAM | 64 Go DDR5 |
| OS | Windows 11 (+ WSL2 disponible) |
| Runtime suivi | Ollama natif Windows ou WSL (identifiés séparément) |
| Familles suivies | Qwen, Hermes, Llama, Gemma, DeepSeek, Mistral |
Détail méthodologique : Comment nous testons.
3. Les 5 niveaux de vérité
- Déclaré — l'utilisateur saisit CPU/RAM/GPU.
- Détecté — lecture machine (matériel, runtime Ollama, modèles installés).
- Estimé — compatibilité calculée (catalogue × VRAM/RAM). Jamais de tok/s fictifs.
- Mesuré — benchmark réellement lancé : tokens/s + durée.
- Vérifié terrain — capture / rapport / recette rejouable (ex. preuve 27/07).
4. Paliers pratiques (estimés, à valider par mesure)
Ces paliers aident à cadrer un budget. Ils ne remplacent pas un scan.
| VRAM | Usage typique (ordre de grandeur) | Exemples de modèles |
|---|---|---|
| 0–8 Go | Découverte, petits modèles quantifiés, CPU possible | Phi mini, Gemma 2B, Qwen 0.5–1.5B |
| 12 Go | Premier vrai ticket d'entrée CUDA | Qwen/Hermes 7–8B, certains 14B Q4 |
| 16 Go | Confort 7B–14B, agentique bornée | Hermes 8B (mesuré ici), Qwen coder mid |
| 24 Go+ | 32B quantifiés, contextes plus longs | Qwen 32B Q4, code 32B |
Profils types commentés : exemples de rapports.
Elle ne compare pas Hermes 3 à tous les modèles. Elle ne promet pas le même chiffre sur une autre 4080 SUPER. Elle ne remplace pas les campagnes multi-machines (GTX 1080 Ti, 3060, CPU only, portable) encore à publier progressivement.
5. Comment reproduire chez vous
- Installer OutilsIA Local Cockpit (Windows / Linux).
- Laisser détecter GPU, VRAM, RAM, Ollama.
- Choisir un modèle installé (ex.
hermes3:8b). - Lancer le benchmark court → noter tok/s + durée + VRAM.
- Décider : runtime, modèle, RAM, VRAM — ou aucun achat.
Estimateur sans install : Mon PC peut-il ?
FAQ
Quel est le résultat benchmark public le plus précis d'OutilsIA ?
Le 27 juillet 2026, sur RTX 4080 SUPER 16 Go + Ollama Windows, Hermes 3 8B a affiché 118,5 tokens/s pour 8 579 ms (réf. OIA-LC-BENCH-20260727-HERMES3-8B-RTX4080S). Mesure ponctuelle, pas moyenne multi-machines.
Est-ce que 118,5 tok/s vaut sur mon PC ?
Non. Drivers, quantization, contexte, charge système et VRAM changent tout. Local Cockpit mesure votre machine.
Comment OutilsIA distingue estimé et mesuré ?
Estimé = compatibilité calculée. Mesuré = benchmark réellement exécuté (tok/s + durée). On ne fabrique jamais de tokens/s.
Pages liées
- Preuves Local Cockpit — capture et détail de la recette 27/07
- Comment nous testons — protocole
- Local vs cloud — break-even
- Maestro v0.7 dogfood — preuve agents
- Arrangement suffisant — doctrine modèle min.
- Nos mesures réelles — 118,5 tok/s documentés (Hermes 3 8B · 4080 SUPER)
- Qwen coder vs Claude Code — local vs forfait (août 2026)
- Maestro v0.7 dogfood — preuve multi-IA
- Local Cockpit — mesurer votre PC
Chris Drakkeng — OutilsIA. Quand un chiffre n'est pas mesuré ici, la page le dit.
Pas d'affiliation Amazon sur cette page.