Fleches: deplacer | Entree: placer camp
Fleches: bouger · Espace: passer tour · Entree: camp · D: toggle dragon · R: rejouer

Tableau de preuve Dragon Labyrinth

Tes résultats locaux d’un côté, état des baselines reproductibles de l’autre.

Mesuré | pas prétendu

Tes preuves locales

    État de la recherche

      Soumettre ton agent. Le nouveau protocole exige une version exacte, les mêmes scénarios, les échecs et le SHA du rapport.
      Soumettre ton agent

      À propos du Dragon Labyrinth

      Un jeu d'observabilité partielle devenu laboratoire OutilsIA pour étudier espace, risque et mémoire sans inventer de certitude.

      Le jeu original : Mattel D&D Computer Labyrinth (1981)

      Le D&D Computer Labyrinth Game de Mattel reposait sur un échiquier 8×8 et une menace cachée. Cette adaptation web s'en inspire, mais n'est ni une émulation cycle par cycle du matériel historique ni une reproduction certifiée de toutes les règles d'époque. Son intérêt expérimental vient de l'état incomplet : le chevalier doit agir sans connaître la position réelle du dragon ni celle du trésor.

      Le laboratoire 2026 : ce que nous reconstruisons

      L'audit du 29 juillet a invalidé l'usage public des anciens pourcentages : le module M2 était activable dans l'interface mais n'influençait pas la politique, tandis que le simulateur historique ne terminait pas le tour sur un mur comme le jeu public. OutilsIA repart donc d'un moteur déterministe et d'un protocole versionné.

      Les trois couches réellement testables en v1 :

      La couche R représente une aversion opérationnelle au risque. Elle ne mesure ni émotion, ni conscience, ni « peur » humaine. Le laboratoire compare des systèmes complets : modèle, observation, carte et mémoire autorisées.

      Pourquoi c'est important pour l'IA en 2026

      Un modèle peut produire un raisonnement convaincant tout en gérant mal ce qu'il ne voit pas. Le Dragon sépare plusieurs difficultés souvent confondues : construire une carte, maintenir des hypothèses, pondérer un danger et consolider une expérience. La question n'est pas « quelle IA est la plus intelligente ? », mais quel échafaudage change réellement la décision sous incertitude.

      Le dépôt public conserve les résultats négatifs, exécute tous les agents sur les mêmes seeds, affiche les intervalles et produit un SHA-256 par partie et par rapport. Aucun ancien taux n'est migré comme preuve v1.

      Comment jouer (règles brèves)

      Observations humaines à mesurer

      Des joueurs disent retenir les impasses, ralentir après le réveil et éviter instinctivement certaines zones. Ce sont de bonnes hypothèses sur la carte mentale, l'aversion au risque et la mémoire, pas encore des taux de population. Une future campagne terrain distinguera témoignage, mesure personnelle et baseline humaine consentie.

      Pour aller plus loin

      État au 29 juillet 2026 : protocole v1 candidat, résultats LLM et humains à recollecter. Code du laboratoire sous licence MIT.

      🔬 Pour les chercheurs

      Cette page reste l'expérience jouable. Le moteur de recherche est désormais isolé dans un dépôt distinct afin qu'une correction UX ne modifie plus silencieusement les résultats.

      Les anciens CSV sont conservés comme archives exploratoires, pas comme résultats v1. La première campagne LLM/humaine sera publiée même si elle ne confirme pas l'hypothèse initiale.