Guide d'évaluation · modèle local, pas Hermes Agent

Hermes au quotidien : tester le local sur vos usages cloud

Tester quelques tâches avant de payer un abonnement ou d'acheter un GPU : voici un parcours pour comparer un modèle local à ce que vous utilisez déjà, sans inventer un taux de réussite.

Par · publié le 4 avril 2026 · corrigé le

Correction éditoriale. L'ancienne version racontait trente jours de remplacement de ChatGPT et avançait des économies, un taux de couverture et une mesure sur RTX 4070 Ti Super. Faute de journal et de protocole rattachés à ces affirmations dans notre dossier de preuve, nous les retirons. Cette page est désormais un guide pour mener votre propre essai, pas le compte rendu d'une campagne validée.

D'abord, de quel Hermes parle-t-on ?

Hermes 3 Llama 3.1 8B est un modèle de langage publié par Nous Research. La référence hermes3:8b dans Ollama désigne une distribution de ce modèle. Le format et la quantification doivent être identifiés pour comparer ses performances.

Hermes Agent est un logiciel distinct. Un agent peut organiser des sessions et appeler des outils ; le fichier de poids ne fournit pas à lui seul une mémoire persistante, un navigateur ou une gestion de projets. Modèle Hermes et Hermes Agent : la différence.

Ce guide porte sur des tâches textuelles avec un modèle local. Il ne prétend pas reproduire toutes les fonctions d'une offre cloud ni évaluer les modèles cloud actuels.

La mesure disponible : une vitesse, pas un verdict de qualité

Notre registre public documente une mesure de 118,5 tok/s pour Hermes 3 8B le 27 juillet 2026 sur une RTX 4080 SUPER 16 Go, avec Ollama Windows. Les conditions et limites figurent dans cette preuve.

Cette mesure ne concerne pas une RTX 4070 Ti Super. Elle n'établit ni une vitesse pour tous les PC, ni une supériorité face à un assistant cloud, ni un pourcentage de tâches réussies. Le protocole distingue les champs mesurés et ce qui reste inconnu.

Capture de la mesure Hermes 3 8B sur RTX 4080 SUPER publiée dans le registre OutilsIA
Preuve datée du 27 juillet 2026, limitée à cette configuration. Lire le contexte complet.

Choisissez trois tâches dont vous savez reconnaître le résultat

Les exercices suivants sont des exemples à exécuter, sans résultat déjà attribué à Hermes. Utilisez des données fictives ou non sensibles et conservez les mêmes exigences pour chaque outil.

Grille proposée. Aucun score de modèle n'est prérempli.
TâcheEntréeCritère de réussite
Reformuler un courrierUn message fictif et trois contraintesLes faits et les contraintes sont conservés ; aucune information ajoutée sans demande.
Extraire des donnéesUn texte court avec une réponse attendueChamps exacts, format valide, informations absentes laissées inconnues.
Corriger une fonctionUne fonction isolée et des testsLes tests passent et les contraintes de la correction sont respectées. Lire le code avant toute exécution.

Le délai utile est celui qui va jusqu'au résultat accepté, corrections humaines comprises. Une réponse rapide mais fausse peut vous coûter plus de temps qu'une réponse plus lente.

Un protocole personnel, pas un concours universel

  1. Fixez le contexte. Date, machine, runtime, modèle exact, réglages et version de l'outil comparé. Ne changez pas les critères une fois le résultat connu.
  2. Gardez un usage réaliste. Une même tâche et un budget de temps comparable, tout en laissant chaque outil utiliser son interface habituelle. Consignez les outils supplémentaires employés.
  3. Répétez. Quelques essais révèlent déjà des échecs intermittents. Ils ne suffisent pas à publier un classement universel ou une confiance statistique précise.
  4. Notez séparément. Réussite, erreurs, temps total, interventions humaines et contraintes de confidentialité. Ne transformez pas l'élégance d'une réponse en score objectif.
  5. Conservez les échecs. Un modèle qui échoue sur votre tâche importante n'est pas compensé par une bonne vitesse sur une tâche secondaire.

Les économies ne sont pas automatiques

Le local peut éviter certains appels facturés, mais il utilise votre machine, de l'électricité, du stockage et du temps. Un forfait déjà payé possède ses propres limites ; on ne connaît pas son coût marginal exact à partir du seul nombre de caractères d'une réponse.

La comparaison utile part de vos factures et de vos tâches réellement couvertes. Si le local ne remplace qu'un usage occasionnel, cela ne prouve pas qu'un abonnement entier peut être supprimé. Si votre PC suffit déjà, il n'y a pas non plus de raison d'ajouter un GPU au calcul.

Nous ne publions ici ni tarif cloud supposé actuel, ni amortissement garanti, ni promesse d'économie mensuelle.

Local ne veut pas dire confidentialité automatique

Il faut vérifier le runtime, l'interface et leurs connexions. Une extension, un outil de recherche ou un agent peut utiliser le réseau même si le modèle s'exécute localement. Pour un premier essai, n'employez pas de dossiers clients, de secrets ou de documents personnels sensibles.

Ne confondez pas non plus contrôle des données et exactitude : une réponse locale peut contenir des erreurs. Les décisions sensibles nécessitent une vérification adaptée, quel que soit le lieu d'exécution.

Comment décider après l'essai ?

Local Cockpit sert à diagnostiquer la machine et à mesurer un modèle. Maestro coordonne le travail des agents. MemoryForge prépare du contexte portable. Aucun de ces outils ne transforme, à lui seul, un modèle 8B en équivalent de toutes les fonctions d'un service cloud.

Préparer Ollama · Comparer les références de modèles · Comment nous testons.

Le livre du labo — disponible sur Amazon « Les ennemis savaient déjà où vous étiez » : triche, information cachée, mesure — du dragon Mattel 1981 à l’IA 2026. Ouvrage OutilsIA (pas une liste de composants). Page du livre → Jouer au labo gratuit