Ton score est pret.
Le vrai piege: tu ne dois pas seulement chercher le tresor, tu dois eliminer les positions possibles du dragon.
Tes résultats locaux d’un côté, état des baselines reproductibles de l’autre.
Un jeu d'observabilité partielle devenu laboratoire OutilsIA pour étudier espace, risque et mémoire sans inventer de certitude.
Le D&D Computer Labyrinth Game de Mattel reposait sur un échiquier 8×8 et une menace cachée. Cette adaptation web s'en inspire, mais n'est ni une émulation cycle par cycle du matériel historique ni une reproduction certifiée de toutes les règles d'époque. Son intérêt expérimental vient de l'état incomplet : le chevalier doit agir sans connaître la position réelle du dragon ni celle du trésor.
L'audit du 29 juillet a invalidé l'usage public des anciens pourcentages : le module M2 était activable dans l'interface mais n'influençait pas la politique, tandis que le simulateur historique ne terminait pas le tour sur un mur comme le jeu public. OutilsIA repart donc d'un moteur déterministe et d'un protocole versionné.
Les trois couches réellement testables en v1 :
La couche R représente une aversion opérationnelle au risque. Elle ne mesure ni émotion, ni conscience, ni « peur » humaine. Le laboratoire compare des systèmes complets : modèle, observation, carte et mémoire autorisées.
Un modèle peut produire un raisonnement convaincant tout en gérant mal ce qu'il ne voit pas. Le Dragon sépare plusieurs difficultés souvent confondues : construire une carte, maintenir des hypothèses, pondérer un danger et consolider une expérience. La question n'est pas « quelle IA est la plus intelligente ? », mais quel échafaudage change réellement la décision sous incertitude.
Le dépôt public conserve les résultats négatifs, exécute tous les agents sur les mêmes seeds, affiche les intervalles et produit un SHA-256 par partie et par rapport. Aucun ancien taux n'est migré comme preuve v1.
Flèches bouger · Espace passer · Entrée placer camp · R rejouer.Des joueurs disent retenir les impasses, ralentir après le réveil et éviter instinctivement certaines zones. Ce sont de bonnes hypothèses sur la carte mentale, l'aversion au risque et la mémoire, pas encore des taux de population. Une future campagne terrain distinguera témoignage, mesure personnelle et baseline humaine consentie.
État au 29 juillet 2026 : protocole v1 candidat, résultats LLM et humains à recollecter. Code du laboratoire sous licence MIT.
Cette page reste l'expérience jouable. Le moteur de recherche est désormais isolé dans un dépôt distinct afin qu'une correction UX ne modifie plus silencieusement les résultats.
Les anciens CSV sont conservés comme archives exploratoires, pas comme résultats v1. La première campagne LLM/humaine sera publiée même si elle ne confirme pas l'hypothèse initiale.