OutilsIA.fr

Projet open source OutilsIA

OutilsIA Uncertainty Lab

Décider quand on ne voit pas tout. Dragon Labyrinth devient un banc d'essai reproductible pour séparer carte mentale, croyances, risque et mémoire.

Public · dépôt GitHub 17 tests · Python 3.11/3.12 Protocole `dragon-uncertainty.v1` candidat

Quatre difficultés, pas un score magique

Le modèle ne reçoit ni la position du dragon, ni celle du trésor, ni les murs non découverts. Le laboratoire cherche quelle structure change réellement sa décision.

S

Mémoire spatiale

Retenir les murs découverts, limiter les revisites et repérer les oscillations.

B

Croyances

Maintenir l'ensemble des positions du trésor encore compatibles avec les indices.

R

Risque

Conserver des hypothèses sur le dragon et éviter un danger sans se paralyser.

Mémoire inter-parties

Rejouer exactement un scénario et vérifier si murs, morts et trésor réellement trouvé sont consolidés.

« Contre l'incertitude, l'intelligence n'est rien. »

Une thèse de travail à mettre à l'épreuve, pas une conclusion déjà obtenue. Le protocole peut la contredire.

De l'intuition à une question réfutable

La discussion fondatrice décrivait des agents qui ne construisent pas de carte, ne réagissent pas au danger et ne retiennent pas leurs chemins. Le laboratoire remplace ces impressions par des variables observables.

« Il ne comprend pas l'espace. »
S — spatial mesure murs découverts, cellules revisitées, oscillations et chocs à budget identique.
« Il ne sait pas ce qui est caché. »
B — belief maintient les états encore compatibles avec les indices, sans révéler le trésor ou le dragon.
« Il ne ressent pas la peur. »
R — risk teste une politique face au danger possible. Elle peut éviter un contact ou paralyser l'agent ; elle ne mesure aucune émotion.
« Il n'apprend pas les chemins. »
M — replay memory conserve uniquement les murs, morts et pickups réellement observés. Replay et généralisation restent deux expériences différentes.

Point de départ, pas résultat : le créateur estime gagner environ une partie sur cinq et avoir vu les LLM réussir très rarement. Cette observation motive une collecte contrôlée ; elle ne devient ni « 20 % humain », ni « 0 % IA » avant une campagne consentie et reproductible.

Les expériences prévues

Le même modèle peut être très différent selon l'observation, la carte et la mémoire qu'on lui donne. Nous évaluons le système complet, pas seulement son nom commercial.

Ablation S / B / R

Les huit combinaisons jouent les mêmes labyrinthes. Une couche qui réduit les contacts mais multiplie les timeouts reste un résultat négatif visible.

Modèle brut vs scaffoldé

Même modèle, même budget : observation seule, carte structurée, croyances explicites puis risque explicite.

Replay vs généralisation

Apprendre un labyrinthe répété ne prouve pas qu'on sait naviguer dans un labyrinthe nouveau. Les deux résultats sont séparés.

Local, cloud et humain

La passerelle JSONL fournit la même observation bornée. Versions, prompts, quantification, latence, coût et corrections humaines sont conservés.

Une doctrine, des bancs distincts

OutilsIA traite l'incertitude avec la même discipline de preuve, mais chaque outil garde une question et une frontière propres.

Dragon Lab Jouer

Un chevalier ou un fantôme décide avec une partie du monde cachée. Le résultat porte sur la navigation, les croyances, le risque et la mémoire.

Local Cockpit Mesurer la machine

Le scan et le benchmark réduisent l'incertitude sur ce qu'un PC peut réellement exécuter, sans transformer une mesure locale en vérité universelle.

MemoryForge Conserver

Une mémoire explicite garde des faits et décisions durables. Elle ne devient pas une preuve de compréhension ou de conscience.

ForgeBench Construire

Un arrangement comme « Kimi conçoit, Grok code, Claude relit » produit un Snake ou un autre artefact. Coût, vitesse, qualité, fiabilité et autonomie sont évalués : ce n'est pas une partie de Dragon.

La preuve avant le classement

Le dépôt a été construit pour rendre une affirmation réfutable et rejouable.

Moteur
8×8 déterministe, collision avant pickup, mur = fin de tour
Observation
État caché exclu de l'objet transmis à l'agent
Comparaison
Mêmes seeds, mêmes limites, mêmes règles
Incertitude
Intervalle de Wilson à 95 % pour les taux binaires
Traçabilité
SHA-256 par épisode et par rapport
Distribution
Wheel Python sans dépendance métier externe, licence MIT

État public au 29 juillet 2026

Le socle est public. Les verdicts LLM et humains, eux, doivent être recollectés sous le nouveau protocole.

Disponible

Moteur, neuf baselines, bridge JSONL, tests, protocole, audit et politique de publication.

Vérifié

17 tests locaux et CI GitHub réussie sur Python 3.11 et 3.12.

À mesurer

Première campagne LLM locale/cloud et baseline humaine consentie. Aucun ancien taux n'est recyclé.

git clone https://github.com/drakkB/outilsia-uncertainty-lab.git
cd outilsia-uncertainty-lab
PYTHONPATH=src python -m unittest discover -s tests -v
PYTHONPATH=src python -m outilsia_uncertainty run --episodes 100