Un tuteur IA devrait-il enseigner les prompts ou la réflexion ?

Cristina Agrigoroae © 2026 EPFL
Entretien avec Jérôme Brender, dont les recherches, à l'intersection de l'intelligence artificielle et des sciences de l'apprentissage, portent sur la manière dont les étudiants utilisent les outils d'IA en apprenant à programmer, et sur ce que cet usage implique pour leur apprentissage à long terme.
Plus de 8 étudiants sur 10 utilisent désormais des grands modèles de langage (LLM) pour leurs travaux. Dans les salles de classe, la question n'est plus de savoir si les étudiants utilisent l'IA générative, mais comment. Un étudiant qui n'utilise pas ces outils risque d’avoir de moins bons résultats que ses pairs, qui s'en servent pour avancer plus vite dans leurs devoirs, déboguer du code en quelques secondes ou obtenir instantanément des explications sur une notion manquée en cours.
Mais toutes les aides de l'IA ne se valent pas : un chatbot qui donne les réponses et un chatbot qui pose les bonnes questions peuvent former des étudiants très différents, même s'ils reposent exactement sur le même modèle. Comprendre quel type de soutien de l'IA développe réellement des compétences durables, plutôt que de simples résultats à court terme, est l'une des questions ouvertes les plus urgentes de l'éducation aujourd'hui.
Cette question est au cœur de la thèse de doctorat de Jérôme Brender. Son article, « Reflective Dialogue or Prompt Refinement? Effects of Tutor Scaffolding on Students' Independent LLM Use for Programming », rédigé avec Laila El-Hamamsy, Kim Uittenhove, Aitor Perez, Patrick Jermann, Francesco Mondada et Engin Bumbacher, a reçu le prix du meilleur article (Best Paper Award) à la conférence AIED 2026, à Séoul, en juillet 2026.
L'étude, menée dans un cours de robotique mobile de niveau master à l'EPFL, a comparé deux modèles de tutorat par IA sur une intervention de six semaines auprès de 66 étudiants : un tuteur à guidage socratique (Socratic-Guidance, SG), qui répond par des questions en invitant à la réflexion, et un tuteur d'affinement de prompts (Prompt-Refinement, PR), qui accompagne les étudiants pour rédiger des prompts plus clairs et plus explicites. Dans un second temps, l'étude a suivi 52 de ces étudiants pendant un projet de cours de trois semaines, au cours duquel tous ont utilisé une version non contrainte du même chatbot, sans aucun étayage, afin de voir si quelque chose des séances guidées avait réellement perduré.
Nous avons rencontré Jérôme pour revenir sur les résultats de l'étude, ce qui l'a surpris et à quoi pourrait ressembler un tuteur IA idéal.
L'article compare deux approches de tutorat. Pourquoi comparer deux approches plutôt qu'une approche face à l'absence de tuteur IA ?
Cette étude fait suite à des travaux précédents dans lesquels nous cherchions comment aider les étudiants à mieux réfléchir à leurs pratiques de prompting, en les aidant à formuler, décomposer et affiner leurs prompts afin de mieux comprendre les concepts théoriques d'un cours de robotique. Nous avons construit un tuteur d'affinement de prompts et l'avons comparé à l'approche actuelle en matière de tutorat par IA, le guidage socratique : un tuteur qui guide les étudiants par le questionnement plutôt que par un retour direct, afin d'encourager la réflexion. L'objectif n'était donc pas simplement de savoir si un tuteur IA est meilleur que l'absence de tuteur. Nous voulions comparer deux mécanismes de soutien à un usage réflexif des LLM : l'un agissant sur l'entrée de l'étudiant (son prompt), l'autre sur la sortie du LLM (sa réponse). Point important, nous avons aussi examiné ce qui se passait lorsque ces dispositifs d'étayage (le tuteur IA) étaient retirés, au profit d'un LLM généraliste sans contraintes.
Qu'avez-vous trouvé de plus surprenant en comparant les deux ?
Il y a eu deux résultats principaux. D'abord, nous avons organisé trois séances au cours desquelles les étudiants utilisaient le tuteur IA qui leur avait été attribué. À la dernière séance, les étudiants du groupe à guidage socratique montraient un gain d'apprentissage plus élevé que ceux du groupe à affinement de prompts.
Le résultat le plus surprenant est venu ensuite, lorsque nous avons retiré entièrement le tuteur IA, c'est-à-dire l'étayage. Les étudiants qui avaient utilisé le guidage socratique formulaient toujours de meilleurs prompts que ceux qui avaient utilisé l'affinement de prompts, alors même que le guidage socratique ne leur avait jamais appris explicitement à améliorer leurs prompts. Il semble que l'approche par le questionnement ait poussé les étudiants vers davantage de pensée critique et de réflexion, et que cela se soit maintenu même sans l'outil.
En terme de compréhension de la matière du cours, nous avons observé la même tendance. À la dernière séance, le groupe à guidage socratique montrait de meilleurs gains d'apprentissage sur les concepts théoriques, même si l'effet statistique présentait certaines limites.
Une limite importante est que nous n'avions pas de groupe témoin sans aucun tuteur IA : nous ne pouvons donc pas dire si l'une ou l'autre condition est élevée ou faible en valeur absolue, seulement l'une par rapport à l'autre.
Vos conclusions indiquent que les étudiants ont préféré le tuteur d'affinement de prompts au guidage socratique. Qu'est-ce que cela vous apprend ?
C'est souvent un décalage en sciences de l'apprentissage entre la valeur perçue et le bénéfice réel pour l'apprentissage. Les étudiants préfèrent souvent ce qui est le moins exigeant sur le plan cognitif, même si ce n'est pas ce qui leur profite le plus. Nous avons remarqué que les étudiants du groupe à affinement de prompts se contentaient la plupart du temps de copier-coller les prompts suggérés, au lieu de faire l'effort de les réécrire. Cela demandait peut-être moins d'effort cognitif, ce qui explique leur perception positive, mais ils n'avaient pas conscience des résultats d'apprentissage réels. Les étudiants du groupe à guidage socratique ont évalué l'expérience plus bas, alors qu'ils semblaient apprendre davantage.
Étant donné que le guidage socratique est perçu comme moins efficace, existe-t-il un risque qu'il soit abandonné ou sous-utilisé en pratique ?
Il faut rester prudent. Les étudiants ont tout de même évalué positivement les deux tuteurs dans l'ensemble ; le guidage socratique n'a pas été perçu négativement, simplement moins favorablement que l'affinement de prompts. La différence de perception de l'utilité était statistiquement significative, mais elle restait positive même pour le guidage socratique, et ne traduit donc pas un rejet pur et simple. C'est plutôt un rappel : si nous voulons que les étudiants utilisent réellement un tel outil en dehors d'une étude, nous ne pouvons pas ignorer ce qu'on ressent en l'utilisant, même quand nous savons qu'il fonctionne.
Le tuteur socratique a d'abord nui à la performance sur les tâches. Qu’est-ce que cela indique?
En ce qui concerne la performance sur les tâches, mesurée par les exercices à résoudre dans des notebooks Jupyter, les étudiants du groupe à guidage socratique ont obtenu de moins bons résultats que ceux du groupe à affinement de prompts lors de la première séance. Mais aux deuxième et troisième séances, cet écart s'était comblé. Mon hypothèse est que le guidage socratique demande plus d'effort cognitif au départ, il y a donc une courbe d'apprentissage. Une fois habitués à l'outil, les étudiants s’en servent mieux : un démarrage lent, mais un gain important à la clé.
Est-ce que la pression croissante à rendre les travaux rapidement, maintenant que l'IA peut générer des réponses instantanément, expliquerait en partie pourquoi les étudiants ont préféré l'outil le plus « efficace » ?
Oui, c'est possible en général. Mais dans ce cours en particulier, nous essayons de résister à cette pression. Les étudiants peuvent utiliser tous les outils d'IA qu'ils veulent, mais ce qui compte, c'est qu'ils comprennent l'algorithme sous-jacent et les raisons pour lesquelles ils ont choisi une approche particulière, pas seulement qu'ils l'implémentent rapidement. Nous n'ajoutons volontairement aucune pression de temps lorsque les étudiants utilisent des LLM. L'accent reste mis sur la compréhension conceptuelle, précisément pour que l'usage de l'IA ne se réduise pas à une question de vitesse.
Si vous deviez concevoir un tuteur IA idéal combinant les enseignements des deux approches, à quoi ressemblerait-il ?
La première chose que l'on fait quand on interagit avec un LLM, c'est écrire un prompt. Plus on enrichit ce prompt, plus il est clair et explicite, et plus on se questionne et on réfléchit à ce que l'on fait, meilleurs sont les résultats d'apprentissage probables.
Un tuteur IA idéal serait donc vraiment un mélange des deux. Il aurait le versant socratique, qui vous questionne, tout en vous donnant un retour sur la façon de mieux formuler vos prompts : pourquoi un prompt n'est pas assez précis, pourquoi il doit être plus explicite, comment intégrer une question dans le prompt lui-même pour lui apporter une réelle valeur. L'essentiel est que ces deux formes de soutien fonctionnent ensemble : le tuteur aiderait les étudiants à améliorer leur manière d'interagir avec le LLM, tout en les faisant continuer à travailler sur le contenu disciplinaire.
Selon vous, qu'est-ce qui a permis à cet article de se distinguer au point de remporter le prix ?
Je pense que c'est l'attention portée à ce qui se passe après le retrait de l'étayage. Beaucoup de recherches examinent les performances d'un tuteur IA pendant que les étudiants l'utilisent activement, mais peu d'études s'intéressent à l'apprentissage du « apprendre avec l'outil » et à la manière dont les étudiants transfèrent cette expérience à l'usage autonome d'un LLM sans étayage. Notre résultat, à savoir que le type d'étayage influence le comportement même une fois retiré, touche à une question plus méta : non pas seulement « le tuteur IA aide-t-il ? », mais « apprend-il aux étudiants à utiliser efficacement les LLM pour apprendre ? »
Quelle est la valeur ajoutée de cette étude pour les sciences de l'apprentissage en général ?
Ce fut une vaste collaboration. De multiples entités y ont participé : chercheurs, enseignants, concepteurs de technologies, centres d'éducation numérique et équipes du cours de robotique. Les résultats montrent que les tuteurs IA peuvent façonner de manière significative la façon dont les étudiants apprennent à l'EPFL, et ils plaident pour la poursuite du développement de tuteurs IA en collaboration avec les parties prenantes de toute l'école, afin d'améliorer globalement notre soutien à l'apprentissage à l'ère de l'IA. Puisque le tuteur que les étudiants ont le moins apprécié est celui qui leur a le plus appris, le véritable défi de conception qui nous attend est d'en construire un qui réunisse les deux, sans perdre les étudiants en route.