Benchmark local · recette manuelle v1 · 13 septembre 2026

Reproduire un test d'IA locale

Lancez la même tâche courte sur un autre PC. Gardez le modèle, les réglages et les preuves cohérents avant de comparer les résultats.

Aucun scan web, téléchargement ou lancement automatique. La recette est une fiche de préparation, pas un script importable dans Cockpit.

Ce que montre le cas existant

OutilsIA publie deux observations historiques sur le même PC équipé d'une RTX 4080 SUPER 16 Go. Elles illustrent les données à conserver, mais ne constituent pas une comparaison contrôlée.

ObservationHermes 3 8BQwen 3.8 27B
Date27 juillet 202619 août 2026
Modèlehermes3:8bqwen3.8:27b, Q4_K_M
RuntimeOllama WindowsOllama 0.32.14 WSL2
Génération118,5 tokens/s9,4 tokens/s
Placement GPU100 % observé72 % GPU / 28 % CPU

Sources : mesures publiques JSON, détail du run Qwen JSON et registre des preuves.

Les modèles, runtimes et réglages diffèrent : on ne peut pas attribuer l'écart de vitesse au seul placement GPU. Il manque des paramètres pour rejouer exactement les anciens essais. La recette suivante démarre une nouvelle série ; elle ne promet pas 118,5 tokens/s sur votre PC.

Votre nouveau test : Hermes 3 8B

Utilisez hermes3:8b seulement s'il est déjà installé et adapté à votre machine. Sinon, arrêtez ici et choisissez un modèle plus petit avec Cockpit : ce sera une autre série. Participer n'impose aucun téléchargement de gros modèle.

Recette : OIA-RECIPE-HERMES3-8B-20260913
Application de référence : 0.1.2-beta, build 20260913142000. Téléchargement public actuel : 0.1.2-beta / 20260913142000.

  1. Noter l'identité avant de démarrerRelevez build Cockpit, OS, version d'Ollama et environnement Windows/WSL/Linux. Relevez digest exact et quantification dans les informations du modèle installé. Si une valeur manque, notez « inconnu » : deux résultats ne sont alors pas strictement comparables. Un simple tag peut changer.
  2. Préparer le test standard existantAnalysez le PC, ouvrez « Tests », puis « Préparer le test standard ». Vérifiez que « Modèle » vaut exactement hermes3:8b : le bouton peut sélectionner un autre modèle installé. Ne cliquez pas sur « Tester » si le modèle voulu est absent.
  3. Conserver les réglages standardUtilisez le benchmark normal, pas le retest CPU, Arena ou Autopilot. Si un profil Autopilot est actif, cliquez d'abord sur « Restaurer ». Le chemin Rust standard emploie contexte 2048, maximum 96 tokens générés, seed 42, température 0 et raisonnement désactivé pour Hermes. Il ajoute la consigne de réponse courte ci-dessous.
  4. Une chauffe, puis trois runs conservésRelisez et confirmez chaque benchmark. Lancez-les successivement, sans longue pause, en fermant les autres travaux lourds. Gardez prompt, runtime et réglages identiques. Le délai standard Hermes est de 45 secondes par run. Un dépassement est un échec à conserver, pas une autorisation de relancer indéfiniment.
  5. Conserver les trois issuesRelevez compteur et durée de génération, chargement et traitement du prompt séparément, ainsi que le placement CPU/GPU s'il est observé. Gardez aussi les échecs. Une médiane exige trois runs réussis comparables ; les valeurs individuelles restent visibles. Ce test court ne mesure pas la qualité générale du modèle.

Texte à coller dans « Prompt court »

Pourquoi la VRAM est importante pour un LLM local ?

Conservez le texte français même dans une interface anglaise. Cockpit ajoute « Réponse finale uniquement, une phrase courte en français. ». Traduire la tâche changerait l'expérience.

Le JSON décrit le protocole et les identités à compléter, sans résultat ni commande exécutable. Cockpit 0.1.2 ne l'importe pas automatiquement.

Quand la comparaison est-elle pertinente ?

Alignez digest du modèle, quantification, prompt, contexte, limite de génération, build, version d'Ollama et environnement runtime. Pour comparer du matériel, changez volontairement de PC et indiquez cette différence. Pour un avant/après correction, gardez le PC et ne changez que le réglage étudié.

Débit de génération : eval_count × 1000 / eval_duration_ms. Le temps total de réponse inclut d'autres opérations. Ne le substituez pas à la durée de génération Ollama. Un compteur absent reste inconnu ; une capture ou un hash ne certifie pas indépendamment l'origine du résultat.

Participer avec un PC extérieur

Nous cherchons des PC Windows/Linux x64 sans GPU dédié, avec ancienne carte NVIDIA, carte intermédiaire ou mémoire partagée CPU/GPU. Le kit actuel ne couvre pas macOS ni ARM64.

Gardez d'abord une copie privée. Utilisez l'aperçu « Contribution volontaire » de Cockpit s'il est disponible, ou préparez un rapport expurgé. Retirez noms, chemins locaux, IP, jetons, prompts et sorties brutes. Ne transmettez que matériel, identités logicielles, réglages, compteurs mesurés et limites.

Proposer un test à OutilsIA · adresse : [email protected]. Aucun envoi automatique. Publier le cas demande un accord distinct et une relecture ; une case sans run reste non mesurée.