Guide d'évaluation · modèle local, pas Hermes Agent
Hermes au quotidien : tester le local sur vos usages cloud
Tester quelques tâches avant de payer un abonnement ou d'acheter un GPU : voici un parcours pour comparer un modèle local à ce que vous utilisez déjà, sans inventer un taux de réussite.
Correction éditoriale. L'ancienne version racontait trente jours de remplacement de ChatGPT et avançait des économies, un taux de couverture et une mesure sur RTX 4070 Ti Super. Faute de journal et de protocole rattachés à ces affirmations dans notre dossier de preuve, nous les retirons. Cette page est désormais un guide pour mener votre propre essai, pas le compte rendu d'une campagne validée.
D'abord, de quel Hermes parle-t-on ?
Hermes 3 Llama 3.1 8B est un modèle de langage publié par Nous Research. La référence hermes3:8b dans Ollama désigne une distribution de ce modèle. Le format et la quantification doivent être identifiés pour comparer ses performances.
Hermes Agent est un logiciel distinct. Un agent peut organiser des sessions et appeler des outils ; le fichier de poids ne fournit pas à lui seul une mémoire persistante, un navigateur ou une gestion de projets. Modèle Hermes et Hermes Agent : la différence.
Ce guide porte sur des tâches textuelles avec un modèle local. Il ne prétend pas reproduire toutes les fonctions d'une offre cloud ni évaluer les modèles cloud actuels.
La mesure disponible : une vitesse, pas un verdict de qualité
Notre registre public documente une mesure de 118,5 tok/s pour Hermes 3 8B le 27 juillet 2026 sur une RTX 4080 SUPER 16 Go, avec Ollama Windows. Les conditions et limites figurent dans cette preuve.
Cette mesure ne concerne pas une RTX 4070 Ti Super. Elle n'établit ni une vitesse pour tous les PC, ni une supériorité face à un assistant cloud, ni un pourcentage de tâches réussies. Le protocole distingue les champs mesurés et ce qui reste inconnu.

Choisissez trois tâches dont vous savez reconnaître le résultat
Les exercices suivants sont des exemples à exécuter, sans résultat déjà attribué à Hermes. Utilisez des données fictives ou non sensibles et conservez les mêmes exigences pour chaque outil.
| Tâche | Entrée | Critère de réussite |
|---|---|---|
| Reformuler un courrier | Un message fictif et trois contraintes | Les faits et les contraintes sont conservés ; aucune information ajoutée sans demande. |
| Extraire des données | Un texte court avec une réponse attendue | Champs exacts, format valide, informations absentes laissées inconnues. |
| Corriger une fonction | Une fonction isolée et des tests | Les tests passent et les contraintes de la correction sont respectées. Lire le code avant toute exécution. |
Le délai utile est celui qui va jusqu'au résultat accepté, corrections humaines comprises. Une réponse rapide mais fausse peut vous coûter plus de temps qu'une réponse plus lente.
Un protocole personnel, pas un concours universel
- Fixez le contexte. Date, machine, runtime, modèle exact, réglages et version de l'outil comparé. Ne changez pas les critères une fois le résultat connu.
- Gardez un usage réaliste. Une même tâche et un budget de temps comparable, tout en laissant chaque outil utiliser son interface habituelle. Consignez les outils supplémentaires employés.
- Répétez. Quelques essais révèlent déjà des échecs intermittents. Ils ne suffisent pas à publier un classement universel ou une confiance statistique précise.
- Notez séparément. Réussite, erreurs, temps total, interventions humaines et contraintes de confidentialité. Ne transformez pas l'élégance d'une réponse en score objectif.
- Conservez les échecs. Un modèle qui échoue sur votre tâche importante n'est pas compensé par une bonne vitesse sur une tâche secondaire.
Les économies ne sont pas automatiques
Le local peut éviter certains appels facturés, mais il utilise votre machine, de l'électricité, du stockage et du temps. Un forfait déjà payé possède ses propres limites ; on ne connaît pas son coût marginal exact à partir du seul nombre de caractères d'une réponse.
La comparaison utile part de vos factures et de vos tâches réellement couvertes. Si le local ne remplace qu'un usage occasionnel, cela ne prouve pas qu'un abonnement entier peut être supprimé. Si votre PC suffit déjà, il n'y a pas non plus de raison d'ajouter un GPU au calcul.
Nous ne publions ici ni tarif cloud supposé actuel, ni amortissement garanti, ni promesse d'économie mensuelle.
Local ne veut pas dire confidentialité automatique
Il faut vérifier le runtime, l'interface et leurs connexions. Une extension, un outil de recherche ou un agent peut utiliser le réseau même si le modèle s'exécute localement. Pour un premier essai, n'employez pas de dossiers clients, de secrets ou de documents personnels sensibles.
Ne confondez pas non plus contrôle des données et exactitude : une réponse locale peut contenir des erreurs. Les décisions sensibles nécessitent une vérification adaptée, quel que soit le lieu d'exécution.
Comment décider après l'essai ?
- Le local réussit vos tâches régulières : gardez les résultats et reproduisez-les avant de modifier votre équipement ou votre forfait.
- Il réussit seulement certaines tâches : répartissez les usages au lieu d'inventer un remplacement total.
- Il est trop lent ou échoue : cherchez si le problème vient du modèle, du contexte, du runtime ou des critères. Une meilleure carte graphique ne corrige pas automatiquement une erreur de raisonnement.
Local Cockpit sert à diagnostiquer la machine et à mesurer un modèle. Maestro coordonne le travail des agents. MemoryForge prépare du contexte portable. Aucun de ces outils ne transforme, à lui seul, un modèle 8B en équivalent de toutes les fonctions d'un service cloud.
Préparer Ollama · Comparer les références de modèles · Comment nous testons.