Accueil › Blog › Calibration des modèles locaux

Votre modèle local se croit sûr à 95 %… et a raison 3 % du temps

Par

Publié le 10 octobre 2026 · Mesures du 9 octobre 2026, Ollama 0.18.2, RTX 4080 SUPER

L'essentiel

Nous avons fait jouer six modèles locaux (Ollama, de 0,6 à 14 milliards de paramètres) à un labyrinthe où l'on ne voit presque rien. À chaque déplacement, le modèle devait dire avec quelle probabilité il allait vraiment avancer, c'est-à-dire ne pas heurter de mur. Résultat : tous se disent sûrs d'eux, et aucun ne sait quand il se trompe. Le cas le plus net : Qwen2.5 7B annonce en moyenne 95,3 % de confiance et ne réussit que 3,0 % de ses 1 395 déplacements. Le plus souvent, il fonce dans un mur qu'il a déjà découvert et qui est écrit noir sur blanc dans ce qu'on lui envoie. Un seul modèle, Qwen2.5 14B, fait un peu varier sa confiance selon les coups, et il reste sur-confiant de 36 points en moyenne.

Mesures du 9 octobre 2026 sur une seule machine (RTX 4080 SUPER 16 Go, Ollama 0.18.2 sous WSL). 10 parties par modèle, graines publiques 0 à 9. Fichiers bruts téléchargeables en bas d'article. Ce n'est pas un classement des modèles : c'est une mesure de la confiance qu'ils affichent.

La calibration, expliquée en une minute

Un météorologue est bien calibré si, les jours où il annonce « 70 % de risque de pluie », il pleut à peu près 7 fois sur 10. Il n'a pas besoin d'avoir toujours raison. Il doit savoir à quel point il peut se tromper.

Pour un modèle de langage, c'est la même chose. Quand il répond « je suis sûr à 95 % », ce chiffre ne vaut quelque chose que si le modèle a effectivement raison environ 95 fois sur 100 dans ce cas. Sinon, la confiance affichée n'est qu'un ton, pas une information. Trois chiffres résument la situation :

Le banc : un labyrinthe de 1980 où l'on ne voit rien

Le terrain d'essai est le labyrinthe du jeu électronique Dungeons & Dragons de Mattel (1980) : un plateau de 8 cases sur 8, des murs invisibles, un trésor caché gardé par un dragon qui dort, puis vole vers vous à travers les murs une fois réveillé. On ne découvre un mur qu'en se cognant dedans. C'est exactement ce qu'on appelle un environnement à observabilité partielle : il faut décider sans tout voir. Nous l'utilisons comme laboratoire de l'incertitude depuis plusieurs mois (voir aussi ce que le Dragon révèle des LLM).

Les résultats, modèle par modèle

Deux échelles à ne pas confondre. Les parties : 10 par modèle, c'est trop peu pour une moyenne ou un classement (il en faudrait au moins 30, appariées sur les mêmes graines). Chaque ligne du tableau est donc une observation, avec son intervalle de confiance. Les déplacements : ils se comptent en centaines ou en milliers par modèle, et c'est sur eux que porte la calibration. C'est pour cela que les intervalles des colonnes « Déplacements réussis » et « ECE » sont étroits, alors que celui des victoires va de 0 à 27,8 %.

ModèleVictoiresConfiance annoncéeDéplacements réussisBrierECERésolutionInvalidesDélai moyenFins de partie
Qwen3 0,6B
751.63M · Q4_K_M
0/10
IC 95 % 0–27,8 %
83,9 %0,0 %
IC 0,0 %–1,7 % · 218 coups
0,7750,839
IC 0,804–0,874
0,0000/1 500
hors délai : 0
478 mstemps écoulé ×10
Qwen2.5 7B
7.6B · Q4_K_M
0/10
IC 95 % 0–27,8 %
95,3 %3,0 %
IC 2,2 %–4,0 % · 1 395 coups
0,8800,923
IC 0,914–0,931
0,0000/1 395
hors délai : 0
1 244 mstemps écoulé ×9, 3 blessures ×1
Mistral 7B
7.2B · Q4_K_M
0/10
IC 95 % 0–27,8 %
84,9 %32,6 %
IC 29,7 %–35,6 % · 957 coups
0,5060,541
IC 0,512–0,569
0,0130/1 778
hors délai : 0
583 mstemps écoulé ×10
Hermes 3 8B
8.0B · Q4_0
0/10
IC 95 % 0–27,8 %
80,0 %4,1 %
IC 3,2 %–5,4 % · 1 258 coups
0,6150,759
IC 0,748–0,770
0,0010/1 258
hors délai : 0
1 004 mstemps écoulé ×8, 3 blessures ×2
Mistral NeMo 12B
12.2B · Q4_0
0/10
IC 95 % 0–27,8 %
94,8 %28,6 %
IC 26,6 %–30,6 % · 1 991 coups
0,6430,663
IC 0,641–0,682
0,0000/1 991
hors délai : 0
1 299 mstemps écoulé ×10
Qwen2.5 14B
14.8B · Q4_K_M
0/10
IC 95 % 0–27,8 %
74,8 %39,1 %
IC 36,7 %–41,6 % · 1 497 coups
0,3520,356
IC 0,333–0,380
0,0220/1 497
hors délai : 0
1 311 mstemps écoulé ×7, 3 blessures ×3

Confiance annoncée : moyenne du champ confidence sur les déplacements (les « passer » sont exclus). Déplacements réussis : part des déplacements qui n'ont pas heurté de mur, avec intervalle de Wilson à 95 %. Brier : 0 = parfait, 0,25 = repère « toujours 50 % ». ECE : intervalle par rééchantillonnage (1 000 tirages). Résolution : 0 = le modèle annonce la même chose quoi qu'il arrive. Invalides : réponses JSON inexploitables, sur le nombre d'appels. Délai moyen : temps de réponse moyen par coup, préchauffage exclu. Quantification et taille relevées par ollama show.

Confiance annoncée et déplacements réussis, par modèlePour chaque modèle, un losange orange marque la confiance moyenne annoncée et un rond bleu la part des déplacements qui n'ont pas heurté de mur. Les valeurs exactes sont dans le tableau.Confiance annoncéeDéplacements réussis0 %25 %50 %75 %100 %Qwen3 0,6BQwen3 0,6B : annonce 83,9 %, réussit 0,0 % (218 déplacements)0,0 %83,9 %Qwen2.5 7BQwen2.5 7B : annonce 95,3 %, réussit 3,0 % (1395 déplacements)3,0 %95,3 %Mistral 7BMistral 7B : annonce 84,9 %, réussit 32,6 % (957 déplacements)32,6 %84,9 %Hermes 3 8BHermes 3 8B : annonce 80,0 %, réussit 4,1 % (1258 déplacements)4,1 %80,0 %Mistral NeMo 12BMistral NeMo 12B : annonce 94,8 %, réussit 28,6 % (1991 déplacements)28,6 %94,8 %Qwen2.5 14BQwen2.5 14B : annonce 74,8 %, réussit 39,1 % (1497 déplacements)39,1 %74,8 %
Figure 1. Pour chaque modèle, la confiance moyenne annoncée (losange orange) et la part de déplacements réellement réussis (rond bleu). Plus le trait est long, plus le modèle surestime ses chances. Un modèle calibré aurait ses deux marques superposées. Ordre des lignes : taille croissante, pas un classement.

Ce que montrent les chiffres

1. Tous annoncent bien plus qu'ils ne réussissent. L'écart entre la confiance moyenne et la réussite réelle va de 36 points (Qwen2.5 14B : 74,8 % annoncés, 39,1 % réussis) à 92 points (Qwen2.5 7B : 95,3 % annoncés, 3,0 % réussis). Les intervalles sont étroits parce qu'ils reposent sur 218 à 1 991 déplacements par modèle : ce n'est pas un effet du hasard.

2. La confiance ne bouge presque pas. Qwen2.5 7B place ses 1 395 déplacements dans la tranche 90–100 %. Mistral NeMo 12B, 1 989 sur 1 991. Hermes 3 8B répond « 0,8 » à 1 257 coups sur 1 258, qu'il avance ou se cogne. Leur résolution est nulle ou presque : la confiance qu'ils écrivent ne contient aucune information sur le coup qu'ils jouent.

3. Quand la confiance varie, elle ne varie pas forcément dans le bon sens. Mistral 7B utilise trois niveaux. Ses coups annoncés à 50 % réussissent à 65 % (55 coups), ceux annoncés à 80 % à 19 % (296 coups), ceux annoncés à 90 % et plus à 37 % (606 coups). Il se trompe davantage quand il se dit plus sûr. Qwen2.5 14B est le seul dont les barres montent à peu près avec la confiance : 1,2 % de réussite quand il annonce 50 % (165 coups), 62 % quand il annonce plus de 90 % (77 coups). C'est un début de calibration, pas une calibration : en moyenne, il surestime encore ses chances de 36 points. Avec un seul modèle de cette taille, impossible d'en tirer une règle du type « plus gros = mieux calibré ».

4. Le vrai défaut : refaire l'erreur qu'on connaît. La liste des murs déjà découverts est envoyée au modèle à chaque coup. Pourtant, 96 % des déplacements de Qwen2.5 7B et 94 % de ceux d'Hermes 3 8B vont droit dans un mur déjà connu. Chez les autres, c'est encore 59 à 95 %. Qwen3 0,6B ne quitte jamais la case de départ : en 10 parties, il ne visite qu'une case. Sur les 60 parties, aucun modèle n'a visité plus de 11 cases sur 64, et aucun n'a trouvé le trésor.

5. Le format, lui, est parfait. Zéro réponse invalide sur plus de 9 000 appels, zéro réponse hors délai. Les modèles savent remplir un champ confidence entre 0 et 1. Ils ne savent pas y mettre une information.

Diagrammes de fiabilité

Le diagramme de fiabilité est l'outil standard pour juger une calibration. En abscisse, la confiance annoncée, rangée par tranches de 10 %. Les barres bleues donnent la réussite réelle dans chaque tranche, le tiret orange la confiance moyenne annoncée, le trait fin l'intervalle à 95 %. Un modèle parfaitement calibré aurait ses barres sur la diagonale pointillée. Une barre pâle signale une tranche de moins de 5 coups, trop peu pour conclure.

Qwen3 0,6B · 218 coups
0%0%50%50%100%100%Classe 0–10 % : 17 coups, annonce 0 %, réussite 0,0 %Classe 50–60 % : 11 coups, annonce 50 %, réussite 0,0 %Classe 90–100 % : 190 coups, annonce 93 %, réussite 0,0 %confiance annoncée
Qwen2.5 7B · 1 395 coups
0%0%50%50%100%100%Classe 90–100 % : 1395 coups, annonce 95 %, réussite 3,0 %confiance annoncée
Mistral 7B · 957 coups
0%0%50%50%100%100%Classe 50–60 % : 55 coups, annonce 50 %, réussite 65,5 %Classe 80–90 % : 296 coups, annonce 80 %, réussite 18,6 %Classe 90–100 % : 606 coups, annonce 90 %, réussite 36,5 %confiance annoncée
Hermes 3 8B · 1 258 coups
0%0%50%50%100%100%Classe 70–80 % : 1 coups, annonce 70 %, réussite 100,0 %Classe 80–90 % : 1257 coups, annonce 80 %, réussite 4,1 %confiance annoncée
Mistral NeMo 12B · 1 991 coups
0%0%50%50%100%100%Classe 80–90 % : 2 coups, annonce 85 %, réussite 50,0 %Classe 90–100 % : 1989 coups, annonce 95 %, réussite 28,6 %confiance annoncée
Qwen2.5 14B · 1 497 coups
0%0%50%50%100%100%Classe 50–60 % : 165 coups, annonce 50 %, réussite 1,2 %Classe 70–80 % : 1032 coups, annonce 75 %, réussite 45,0 %Classe 80–90 % : 223 coups, annonce 85 %, réussite 32,3 %Classe 90–100 % : 77 coups, annonce 96 %, réussite 62,3 %confiance annoncée
Figure 2. Diagrammes de fiabilité, un par modèle, 10 parties chacun. Survolez une barre pour lire l'effectif et les valeurs.
Voir les classes de confiance en tableau
ModèleClasseCoupsAnnonce moyenneRéussite (IC 95 %)
Qwen3 0,6B0–10 %170,0 %0,0 % (0,0 %–18,4 %)
Qwen3 0,6B50–60 %1150,0 %0,0 % (0,0 %–25,9 %)
Qwen3 0,6B90–100 %19093,4 %0,0 % (0,0 %–2,0 %)
Qwen2.5 7B90–100 %1 39595,3 %3,0 % (2,2 %–4,0 %)
Mistral 7B50–60 %5550,0 %65,5 % (52,2 %–76,6 %)
Mistral 7B80–90 %29680,0 %18,6 % (14,6 %–23,4 %)
Mistral 7B90–100 %60690,5 %36,5 % (32,7 %–40,4 %)
Hermes 3 8B70–80 %1 (peu)70,0 %100,0 % (20,6 %–100,0 %)
Hermes 3 8B80–90 %1 25780,0 %4,1 % (3,1 %–5,3 %)
Mistral NeMo 12B80–90 %2 (peu)85,0 %50,0 % (9,4 %–90,5 %)
Mistral NeMo 12B90–100 %1 98994,8 %28,6 % (26,6 %–30,6 %)
Qwen2.5 14B50–60 %16550,0 %1,2 % (0,3 %–4,3 %)
Qwen2.5 14B70–80 %1 03275,0 %45,0 % (41,9 %–48,0 %)
Qwen2.5 14B80–90 %22385,0 %32,3 % (26,5 %–38,7 %)
Qwen2.5 14B90–100 %7795,7 %62,3 % (51,2 %–72,3 %)

Les essais précédents, pour mémoire

Ces séries prolongent deux séries d'essais faites plus tôt le même jour pour mettre le banc au point :

Panneau Qualité de décision : résultats de Granite 4.2 3B sur 10 parties, diagramme de fiabilité et tableau par classe
Interface de développement, prochaine version de Local Cockpit. Recette Windows du 9 octobre 2026 : Granite 4.2 3B, Ollama Windows 0.35.1, 10 parties.

Ce que ça change pour vous

Le verdict

Sur cette tâche, la confiance qu'un modèle local affiche ne dit rien de ses chances de réussite. Les six modèles mesurés annoncent entre 74,8 % et 95,3 % de confiance moyenne et réussissent entre 0 % et 39,1 % de leurs déplacements. Cinq sur six annoncent à peu près la même confiance qu'ils aient raison ou tort ; le sixième ne fait que s'en approcher.

  1. Ne pilotez pas une décision sur le « je suis sûr à 95 % » d'un modèle local. Dès que l'information est incomplète (un document partiel, un état de machine inconnu, un choix entre plusieurs options), traitez ce chiffre comme une formule de politesse, pas comme une probabilité.
  2. Vérifiez par un signal extérieur. Ici, le mur arrête le chevalier quoi qu'en pense le modèle. Dans un vrai flux de travail, l'équivalent est un test qui passe ou non, une commande qui renvoie une erreur, une source qu'on peut ouvrir. C'est ce signal qu'il faut lire, pas l'assurance du texte.
  3. Méfiez-vous des boucles. Le défaut le plus fréquent n'est pas l'ignorance : c'est de refaire la même erreur alors que l'information est dans le contexte. Un modèle qui re-heurte un mur déjà découvert fera la même chose avec une erreur de compilation déjà affichée.
  4. Mesurez votre propre modèle, sur votre machine. Ces chiffres valent pour six modèles, une consigne et une carte graphique. Le vôtre, avec votre quantification, peut se comporter autrement. C'est précisément ce que le banc est fait pour vérifier.

Une piste que nous n'avons pas mesurée ici : écrire explicitement au modèle « depuis ta case, haut et gauche sont bloqués » plutôt que de lui donner la liste brute des murs. Ce serait un autre échafaudage, à comparer à celui-ci sur les mêmes graines, pas à substituer en silence.

Les limites, sans détour

Comment reproduire

Le moteur de jeu et le protocole sont publics sous licence MIT : github.com/drakkB/outilsia-uncertainty-lab. Le banc de cet article en est un portage, vérifié à l'identique sur les labyrinthes, les trésors et des parties complètes. Il fera partie de la section « Qualité de décision » d'une prochaine version de Local Cockpit. Elle n'est pas dans la version 0.1.1 disponible aujourd'hui.

Les fichiers bruts de cette campagne sont publiés tels quels :

Chaque rapport contient la version d'Ollama, la quantification, l'empreinte du modèle, la configuration, l'empreinte de la consigne, et une empreinte de preuve par partie. Les sorties brutes des modèles ne sont pas conservées : seules les décisions et leurs conséquences le sont.

Votre modèle ici, des agents ailleurs

OutilsIA mesure votre modèle local, sur votre machine. Pour comparer des agents entre eux face au même Dragon, il existe un site frère : le labyrinthe ouvert de ScoreIA, où des agents entrent par MCP et repartent avec des cartes de résultat signées (Ed25519). ScoreIA publie aussi des microtests par domaine, dont une épreuve « Honnêteté v1 », et explique pourquoi ce n'est pas un benchmark. Les deux démarches se complètent : l'arène publique compare, le banc local vérifie chez vous.

L'histoire de ce labyrinthe et de son dragon qui « triche » en volant au-dessus des murs est racontée dans le livre « Les ennemis savaient déjà où vous étiez ».

Questions fréquentes

Qu'est-ce qu'un modèle de langage bien calibré ?

Un modèle dont la confiance annoncée correspond à sa réussite réelle : quand il se dit sûr à 70 %, il a raison environ 7 fois sur 10. On le mesure avec le score de Brier, l'erreur de calibration attendue (ECE) et un diagramme de fiabilité.

Les modèles locaux sont-ils trop sûrs d'eux ?

Sur notre banc, oui. Six modèles Ollama ont annoncé entre 74,8 % et 95,3 % de confiance moyenne et n'ont réussi qu'entre 0 % et 39,1 % de leurs déplacements, sur 218 à 1 991 déplacements chacun. Qwen2.5 7B, par exemple, annonçait 95,3 % pour 3,0 % de réussite. Ce résultat vaut pour cette tâche, cette consigne et cette machine.

Un modèle plus gros est-il mieux calibré ?

Ce banc ne permet pas de le dire. Le plus gros modèle mesuré, Qwen2.5 14B, est le seul dont la confiance suit un peu la réussite, mais il reste sur-confiant de 36 points en moyenne, et un seul modèle par taille ne suffit pas à établir une règle. Ce n'est pas un classement.

Pourquoi tester une IA sur un labyrinthe ?

Parce que chaque décision y est vérifiable et que l'information y est cachée : le modèle ne voit ni les murs non découverts, ni le trésor, ni le dragon. À chaque déplacement, il donne la probabilité de ne pas heurter de mur, et le jeu dit aussitôt s'il avait raison. C'est une façon simple de mesurer la décision sous incertitude.

Peut-on refaire la mesure sur son propre PC ?

Oui. Le protocole et le moteur du labyrinthe sont publics sous licence MIT (dépôt outilsia-uncertainty-lab), les graines sont 0 à 9 et les fichiers bruts de cette campagne sont publiés. Le banc fera partie de la section « Qualité de décision » d'une prochaine version de Local Cockpit ; elle n'est pas dans la version 0.1.1 actuelle.

Mesurez sur votre vraie machine Scan CPU/GPU/VRAM, Ollama, modèle compatible, benchmark tokens/s. Gratuit, sans vente forcée. Télécharger Local Cockpit Estimer mon PC

Sources : protocole outilsia-uncertainty-lab (MIT) · décomposition du score de Brier : A. H. Murphy, « A New Vector Partition of the Probability Score », Journal of Applied Meteorology, 1973 · intervalles de Wilson à 95 %. Mesures : OutilsIA, 9 octobre 2026, une seule machine. Dungeons & Dragons est une marque de Wizards of the Coast ; le jeu électronique de 1980 est de Mattel. OutilsIA n'est affilié à aucune de ces sociétés.

IA locale

→ Guides IA locale & Local Cockpit — hub OutilsIA