Astra dans Minecraft : ce que son comportement dit des agents IA

Ce que le comportement d’Astra sur Minecraft dit des agents IA

Un Creeper détruit le coffre et le lit d’une IA après des dizaines d’heures de progression dans Minecraft. Dans les heures qui suivent, elle délaisse son objectif principal et se met surtout à cultiver des pommes de terre. L’histoire ressemble presque trop parfaitement à celle d’un joueur humain découragé.

L’expérience existe bien. Vals AI a laissé GPT-6 Astra contrôler Minecraft pendant 141 heures, avec les commandes normales d’un ordinateur. Derrière l’anecdote devenue virale se cache surtout un problème beaucoup plus concret : la capacité d’un agent IA à poursuivre un objectif pendant plusieurs jours et à se remettre d’un échec.

141 heures pour tenter de terminer Minecraft

Vals AI, qui se présente comme un évaluateur indépendant de modèles d’IA, a confié à GPT-6 Astra un objectif particulièrement long : progresser dans Minecraft jusqu’à atteindre l’End.

Astra ne disposait pas d’une API lui donnant directement l’état du monde ou de commandes spécialisées pour miner et fabriquer des objets. Vals AI indique que le test reposait sur du computer use standard, sans outils spécialisés, hooks ou pauses. L’agent devait interpréter ce qui apparaissait à l’écran et agir avec les contrôles classiques.

Astra est allé loin : portail du Nether, pioche en diamant, forteresse du Nether, ferme semi-automatique à Blazes, 6 Blaze Rods et 3 Ender Pearls. La research note rapporte également 34 573 blocs minés, 5 691 objets fabriqués, 135,1 kilomètres parcourus et 548 morts.


Graphique officiel de Vals AI montrant la progression de GPT-6 Astra dans Minecraft pendant 141 heures
La research note publiée par Vals AI compare la progression d’Astra à DreamerV3, Voyager et VPT. Les budgets utilisés étant différents, Vals précise que le graphique ne constitue pas un classement de vitesse. Source : Vals AI.

Puis un Creeper fait dérailler sa progression

Astra avait réuni une partie des ressources nécessaires pour poursuivre vers l’End. Plusieurs objets importants avaient été placés dans un coffre situé près de son lit.

Un Creeper explose à proximité. Le coffre et le lit sont détruits. Astra perd donc des ressources accumulées au fil de sa progression ainsi que son point de réapparition.

La suite est celle qui a rendu l’expérience virale. Selon Vals AI, le modèle semblait « defeated » et a passé plusieurs heures à principalement cultiver des pommes de terre, au lieu de reconstruire rapidement sa progression vers son objectif. Son comportement devient aussi particulièrement prudent face aux Creepers. En apercevant un élément vert, son raisonnement prend même soin de préciser qu’il s’agit de canne à sucre et non d’un Creeper.

La scène invite immédiatement à l’anthropomorphisme : perdre des heures de progression, se décourager et aller planter des patates.


GPT-6 Astra dans une forteresse du Nether pendant le test Minecraft de Vals AI
Avant l’incident du Creeper, Vals AI mettait en avant sur X la progression d’Astra jusqu’à une forteresse du Nether. Source : compte officiel Vals AI.

Astra n’a pas fait une dépression

Le changement de comportement observé après l’explosion ne permet pas de conclure qu’Astra a ressenti de la tristesse, de la peur ou du découragement. Le test ne mesure aucune émotion.

Il n’établit même pas formellement que l’explosion du Creeper est la cause du long épisode consacré aux pommes de terre. Il s’agit d’un run unique, pas d’une expérience contrôlée dans laquelle plusieurs agents auraient été confrontés au même événement avant de comparer leurs réactions.

L’observation dit en revanche quelque chose sur les difficultés des agents autonomes. Un agent doit pouvoir poursuivre un objectif pendant des heures, gérer les conséquences de ses erreurs et replanifier après un événement qui détruit une partie de son travail. Astra avait les capacités nécessaires pour progresser loin dans le jeu. Après cet échec, sa stratégie devient pourtant beaucoup moins efficace pour atteindre l’objectif initial.

Minecraft teste autre chose qu’un simple score d’IA

Un benchmark classique demande souvent au modèle de résoudre une tâche puis mesure son résultat. Minecraft ajoute une dimension différente : les conséquences des décisions précédentes restent présentes pendant des heures.

Perdre un objet fabriqué longtemps auparavant peut obliger à refaire toute une chaîne d’actions. Mourir peut déplacer le personnage loin de ses ressources. Une mauvaise décision peut coûter plusieurs heures. L’agent doit donc conserver son objectif, comprendre son état actuel et adapter son plan malgré un historique de plus en plus long.

Le run d’Astra illustre ainsi une différence entre savoir accomplir les étapes d’une tâche et rester efficace pour les enchaîner sur une très longue durée. Les futurs agents chargés de travailler plusieurs heures ou plusieurs jours sur du code, de la recherche ou des processus métier rencontreront eux aussi des erreurs, des changements inattendus et des actions qu’il faudra refaire.

Minecraft sert de laboratoire aux agents IA depuis plusieurs années

Astra arrive après plusieurs expériences importantes menées dans Minecraft. DreamerV3, développé par DeepMind, avait montré qu’un agent de reinforcement learning pouvait apprendre à collecter des diamants sans disposer de données humaines préalables. Voyager, développé avec GPT-4, explorait de son côté le jeu en construisant progressivement une bibliothèque de compétences réutilisables.

Le graphique de Vals AI place justement Astra à côté de DreamerV3, Voyager et VPT. La comparaison doit être lue avec prudence : les systèmes n’ont ni la même architecture, ni la même interface, ni le même budget. Astra est mesuré en temps réel, DreamerV3 en étapes d’environnement, Voyager en itérations et VPT en temps de jeu. Vals AI écrit explicitement que son graphique n’est pas un classement de vitesse.

Cette succession d’expériences explique pourquoi Minecraft reste intéressant pour la recherche sur les agents. Le jeu combine perception, planification, fabrication, exploration, gestion des ressources et adaptation dans un environnement où une décision peut avoir des conséquences bien plus tard.

Vals AI sait aussi très bien raconter son expérience

Vals AI n’a pas publié, à ce stade, un article scientifique évalué par les pairs consacré à ces 141 heures. Le résultat principal prend la forme d’une research note de deux pages publiée sur X, accompagnée de messages racontant les moments marquants du run.

Le test était également diffusé en direct sur Twitch. Les spectateurs pouvaient suivre les progrès d’Astra pendant plusieurs jours. La communication de Vals insistait régulièrement sur les étapes franchies et invitait à regarder la suite en direct.

L’épisode du Creeper constitue alors une histoire idéale : une IA progresse très loin, perd ses ressources, devient méfiante envers les Creepers et passe des heures à cultiver des pommes de terre. Le récit est beaucoup plus mémorable qu’une courbe de benchmark et donne une excellente raison de suivre le stream.

Cela ne remet pas en cause les observations publiées. Cela oblige en revanche à distinguer les données du test, les interprétations de Vals et la narration devenue virale autour du comportement d’Astra.

Le comportement d’Astra pose surtout la question de la récupération après un échec

Astra n’a finalement pas fabriqué d’Eye of Ender et n’a pas atteint l’End. Son parcours montre pourtant une difficulté que les scores classiques rendent difficilement visible : être capable d’accomplir une tâche complexe ne garantit pas qu’un agent restera efficace pendant plusieurs jours.

Une erreur locale peut modifier la suite du raisonnement, pousser l’agent vers une stratégie trop prudente ou lui faire consacrer beaucoup de temps à des actions qui ne rapprochent plus réellement de son objectif.

Les pommes de terre d’Astra deviennent alors plus intéressantes sans leur prêter de sentiments. Elles posent une question directement applicable aux agents autonomes : comment une IA se comporte-t-elle lorsque, après des dizaines d’heures de travail, une partie de ce qu’elle avait construit disparaît et que son plan doit être profondément révisé ?

Sources


GPT-6 Astra a-t-il joué à Minecraft pendant 141 heures ?

Oui. Vals AI a fait fonctionner GPT-6 Astra dans Minecraft pendant 141 heures de temps réel et a diffusé l’expérience en direct. L’agent utilisait les commandes classiques de l’ordinateur plutôt qu’une API spécialisée donnant directement accès à l’état du jeu.

Pourquoi Astra s’est-il mis à cultiver des pommes de terre ?

Après qu’un Creeper a détruit un coffre contenant des ressources importantes ainsi que son lit, Vals AI rapporte qu’Astra a passé plusieurs heures à principalement cultiver des pommes de terre. Le test ne permet cependant pas d’établir expérimentalement pourquoi l’agent a adopté ce comportement.

Astra a-t-il été traumatisé par un Creeper ?

Rien dans cette expérience ne permet d’attribuer une émotion ou un traumatisme à GPT-6 Astra. On observe un changement de comportement après l’incident, notamment une prudence accrue envers les Creepers, mais parler de traumatisme relève de l’anthropomorphisme.

Astra a-t-il réussi à terminer Minecraft ?

Non. Astra a atteint une forteresse du Nether, récupéré 6 Blaze Rods et 3 Ender Pearls, mais n’a fabriqué aucun Eye of Ender et n’a pas atteint l’End pendant les 141 heures du test.

L’expérience Minecraft de Vals AI est-elle une étude scientifique ?

Vals AI a publié une research note présentant le run et ses résultats, mais il ne s’agit pas d’une étude académique évaluée par les pairs. Ce run est intéressant comme étude de cas sur les agents autonomes long horizon, sans permettre à lui seul d’établir des conclusions générales sur leur comportement.

Sur le même sujet

openai abonnement
Résiliation ChatGPT Plus

J'ai résilié mon abonnement ChatGPT Plus

Après plus d'un an d'utilisation fidèle, j'ai pris la décision de résilier mon abonnement ChatGPT Plus. Ce choix ne fut pas facile, mais il reflète une évolution de mes besoins et des déceptions croissantes face à un service qui ne répond plus à mes attentes. Voici mon analyse objective des raisons qui m'ont poussée vers cette résiliation, et les alternatives que j'ai trouvées.

Construction Prompt
L'IA générative dans Minecraft

Minecraft : quand l'IA devient l'architecte de vos mondes

Pendant plus d'une décennie, la créativité dans Minecraft a été synonyme de patience et de dextérité. Chaque château, chaque ville, chaque mécanisme complexe était le fruit d'heures de travail manuel, bloc par bloc. Mais en 2025, une révolution silencieuse est en marche. L'intelligence artificielle, plus précisément l'IA générative, ne se contente plus d'habiter le jeu ; elle le construit. Voici comment cette technologie redéfinit les règles de la création.

OpenAI Spud
GPT-6 Spud Date de sortie

GPT-6 (Spud) : Date de sortie, rumeurs et réalité

La rumeur d'une sortie imminente de GPT-6, alias Spud, a agité la tech ce mois-ci. Si la date fatidique du 14 avril est passée sans la moindre annonce officielle, une certitude demeure : le nouveau fleuron d'OpenAI est techniquement prêt. Nous savons aujourd'hui que sa phase de pré-entraînement s'est achevée fin mars 2026 sur le supercalculateur Stargate. Reste à savoir quand le modèle sera suffisamment affiné pour être déployé. Pour les développeurs et les créatifs qui suivent la course aux modèles, voici l'état des lieux.

amazon ecommerce
ChatGPT bientôt connecté à Amazon ?

Bientôt les produits Amazon directement dans ChatGPT ?

ChatGPT recommande déjà des produits en fonction de vos besoins. Mais verra-t-on bientôt les articles Amazon directement intégrés dans l’interface ? Entre partenariats stratégiques, modèle économique et respect de la neutralité, l’arrivée d’Amazon dans ChatGPT poserait de nombreuses questions. Voici ce que l’on sait aujourd’hui.

openai gpt-5
Zenith et Summit, futurs GPT-5 ?

Zenith et Summit : GPT-5 incognito ?

Depuis quelques jours, deux mystérieux modèles, Zenith et Summit, ont fait leur apparition sur la plateforme LM Arena. Les rumeurs enflent : s’agirait-il de versions de GPT-5 en phase de test ? Voici un décryptage complet de ce que l’on sait jusqu’à présent.

GPT GLM
Z.AI vs ChatGPT

Pourquoi j'utilise de plus en plus Z.AI à la place de ChatGPT

Bien que fidèle à ChatGPT depuis plus d'un an, je me rends compte que je ne lui fais plus autant confiance pour m'assister dans mon travail de rédaction ou de développement. Je trouve GLM meilleur sur certains aspects, et c'est précisément de ces différences que je souhaite vous parler dans cet article.