Comment nous testons

Un chiffre n'est utile que si sa provenance est claire. Voici ce qu'OutilsIA détecte, estime, mesure et vérifie réellement.

Notre hardware de test

Machine principale

  • GPU : NVIDIA GeForce RTX 4080 SUPER, 16 Go de VRAM
  • RAM : 64 Go de DDR5
  • CPU : AMD Ryzen 7 7800X3D
  • OS : Windows 11 avec WSL2
  • Limite : une mesure sur cette machine ne vaut pas preuve universelle

Stack logicielle

  • Runtime : Ollama natif Windows ou WSL, identifié séparément
  • Application : OutilsIA Local Cockpit pour le scan et le benchmark
  • Familles suivies : Qwen, Hermes, Llama, Gemma, DeepSeek et Mistral
  • Mesure : vitesse et latence retournées par le runtime local
  • Traçabilité : modèle, runtime, machine, build et date quand disponibles

L'échelle de preuve OutilsIA

Cinq niveaux qui ne doivent jamais être confondus

Le score ou le modèle conseillé peuvent être utiles avant un benchmark, mais ils restent alors des estimations. Seul un test exécuté localement produit une performance mesurée.

  1. 1. DéclaréCPU, RAM, GPU ou VRAM saisis par l'utilisateur. OutilsIA n'affirme pas avoir scanné la machine.
  2. 2. DétectéInformation lue par Local Cockpit sur la machine : matériel, système, runtime Ollama et modèles installés. Une détection peut rester indisponible si le système ne l'expose pas.
  3. 3. EstiméCompatibilité calculée à partir du catalogue, de la taille quantifiée et de la mémoire disponible. Ce niveau ne doit jamais afficher une vitesse fictive.
  4. 4. MesuréBenchmark réellement lancé avec un modèle et un runtime identifiés. Le résultat indique les tokens/s et la durée observés sur cette machine.
  5. 5. Vérifié terrainRapport partageable cohérent avec la fiche machine, daté et contrôlé. Plusieurs profils physiques sont nécessaires avant toute généralisation.

Preuves utilisées dans les guides matériel

Ce que nous vérifions avant de recommander un achat

Nos pages GPU, RAM, Mac et build PC ramènent chaque recommandation à une contrainte vérifiable. Tous les matériels cités ne sont pas physiquement présents sur notre banc : dans ce cas, la compatibilité est explicitement une estimation et non un benchmark.

Signal vérifié Comment nous l'observons Impact sur le verdict achat
VRAM et RAMValeurs détectées sur la machine ou données constructeur clairement identifiées.Détermine si les poids et le contexte disposent d'une marge réaliste.
Runtime exactOllama Windows, WSL ou Linux et référence complète du modèle.Évite d'attribuer au runtime Windows un modèle ou un test exécuté sous WSL.
Vitesse localeTokens/s et durée seulement après exécution du benchmark.Sépare « compatible sur le papier » de « mesuré sur cette machine ».
Thermique et bruitCapteur ou observation en charge lorsque cette preuve existe ; sinon la donnée reste inconnue.Interdit de déduire un throttling ou une alimentation insuffisante sans mesure.
Prix observéPrix et variante visibles au moment de la vérification, susceptibles de changer.L'app peut conclure qu'aucun achat n'est utile si aucun palier n'est débloqué.

Méthodologie de test

1. Tests de performance (IA locale)

Quand un benchmark est lancé dans Local Cockpit, le modèle, le runtime et le profil de test sont enregistrés avec le résultat. Nous mesurons :

  • Tokens/seconde : vitesse de génération retournée par Ollama
  • Durée : temps total observé pour le test
  • Réussite ou échec : un timeout ou une erreur reste un échec, pas une note nulle
  • Profils de réponse : français, code, assistant ou mémoire selon le test choisi

2. Compatibilité avant mesure

Avant l'installation, le moteur rapproche la mémoire disponible, la taille quantifiée et l'usage choisi. Il classe alors le modèle comme adapté, possible avec limites ou déconseillé. Ce verdict est une estimation jusqu'au premier benchmark local.

3. Tests terrain multi-machines

Nous ne prétendons pas posséder ni tester physiquement chaque GPU cité. Une fiche terrain valide doit provenir d'une machine réelle, pointer vers un rapport accessible et conserver la cohérence du GPU, du modèle, du runtime, du build et de la mesure. La campagne multi-machines est publiée progressivement.

Notre independance

🛡

Aucun test n'est sponsorise par un editeur. Nous achetons ou utilisons les versions gratuites des outils que nous testons. Aucun editeur ne nous paie pour publier un avis favorable.

💰

Nos revenus : le logiciel et l'expertise, pas les liens d'achat. OutilsIA édite Local Cockpit et des outils gratuits. Aucune page ne monétise via des liens d'affiliation. Les recommandations techniques restent indépendantes.

Nous disons quand c'est nul. Un outil mediocre recoit une critique mediocre. Notre credibilite repose sur l'honnetete, pas sur la complaisance.

Fréquence de mise à jour

Le domaine évolue vite, mais une date récente n'est pas une preuve de qualité. La date de modification n'est changée que lorsqu'une information visible et substantielle est réellement revue.

Lire nos tests et comparatifs →
🔬

Recherche & lab

Strategy Arena Research

OutilsIA collabore avec Strategy Arena Research sur des benchmarks et papers ouverts (Dragon Labyrinth, calibration LLMs, agents POMDP). Datasets en CC-BY 4.0.

Continuer : Nos mesures · Qwen vs Claude Code · Local Cockpit