Blog · Agents IA

Agents IA : oubliez le prompt magique, exigez une preuve de fin

Je ne vous vends pas de prompt magique. Je vous explique comment passer d'un échange avec l'IA à une boucle qui ne s'arrête que sur une preuve.

Je lis depuis quelques semaines, dans ma veille sur X, la même affirmation : les équipes qui utilisent l'IA sérieusement passeraient « des prompts aux boucles ». Je l'ai prise pour ce qu'elle est, une formule de réseau social, et je suis allé lire ce qu'Anthropic, l'éditeur de Claude, publie sur le sujet. C'est plus sobre. Et bien plus utile.

Je ne vous vends pas de prompt magique. Je vous explique comment passer d'un échange avec l'IA, où vous relancez après chaque réponse, à une boucle : l'agent travaille, un second modèle vérifie, et le travail ne s'arrête que lorsque vous tenez une preuve du résultat.

Un agent, c'est un modèle, des outils et une boucle

Un LLM (grand modèle de langage) est le moteur de ChatGPT ou de Claude : il lit du texte et en produit. Un agent, c'est ce même modèle équipé d'outils : un tableur, un navigateur, un dossier de fichiers.

Anthropic le résume ainsi : les agents sont « en général de simples LLM qui utilisent des outils en fonction des retours de leur environnement, dans une boucle ». L'éditeur distingue deux familles :

  • les workflows, où le modèle et les outils suivent un chemin écrit d'avance par un développeur ;
  • les agents, où le modèle choisit lui-même ses étapes et ses outils.

Anthropic recommande la solution la plus simple, quitte à ne pas construire d'agent du tout. Pour la plupart des PME que j'accompagne, un workflow bien cadré suffit.

Pourquoi l'IA a-t-elle besoin d'un correcteur extérieur ?

Demandez à un modèle de juger son propre travail : il le trouve bon. Prithvi Rajasekaran, membre de l'équipe Labs d'Anthropic, l'écrit sans détour : invités à évaluer ce qu'ils ont produit, les agents ont tendance à « en faire l'éloge avec assurance, même quand la qualité est franchement médiocre aux yeux d'un humain ».

Sa réponse : séparer l'agent qui fait de l'agent qui juge. Anthropic appelle ce schéma « évaluateur-optimiseur ». Un appel au modèle produit, un autre évalue et renvoie ses remarques, puis le cycle reprend. L'évaluateur est donc l'agent chargé de noter et de critiquer.

Autour du modèle, l'ingénieur installe un harness, ou harnais : consignes, outils, fichiers de suivi, règles d'arrêt. Celui de Prithvi Rajasekaran répartit le travail entre trois agents. Un planificateur transforme une demande de quelques phrases en cahier des charges, un générateur code, un évaluateur teste l'application comme un utilisateur.

Sur un éditeur de jeu, l'agent seul a livré en 20 minutes, pour 9 dollars, une application dont le jeu ne fonctionnait pas. Le harnais complet a tourné 6 heures pour 200 dollars, et le jeu était jouable.

Au départ, l'évaluateur de Prithvi Rajasekaran repérait de vrais problèmes puis se persuadait qu'ils n'étaient pas graves. Il a fallu plusieurs séries de réglages pour obtenir un juge sévère.

Trois habitudes pour un agent qui travaille des heures

Justin Young, chez Anthropic, décrit deux échecs typiques. L'agent tente de tout faire d'un coup et s'interrompt au milieu. Ou bien, plus tard, une nouvelle session voit que le projet avance et le déclare terminé.

Ses parades ressemblent à des habitudes d'atelier :

  1. Une liste de fonctionnalités, toutes marquées « en échec » au départ. L'agent n'a le droit que de changer leur statut, jamais de supprimer un test.
  2. Une fonctionnalité à la fois, avec un enregistrement du travail et un fichier de progression à chaque fin de session.
  3. Des tests de bout en bout, menés comme le ferait un utilisateur humain.

/goal : le juge n'est pas celui qui travaille

Claude Code, l'outil de programmation d'Anthropic, propose une commande /goal. Vous y écrivez une condition de fin. Après chaque tour, un modèle distinct vérifie si elle est remplie. Sinon, Claude repart pour un tour au lieu de vous rendre la main.

Anthropic l'écrit dans sa documentation : la fin est décidée « par un modèle neuf plutôt que par celui qui fait le travail ». Ce juge ne lance aucune commande et n'ouvre aucun fichier. Il juge sur ce que Claude a montré dans la conversation. Votre condition doit donc être démontrable.

Une condition d'arrêt solide, d'après la documentation de Claude Code

  • Un état final mesurable : un résultat de test, un nombre de fichiers, une file vide.
  • Une vérification annoncée : la façon dont l'agent doit prouver ce résultat.
  • Les contraintes à respecter en chemin : ce qui ne doit pas changer.

Vous pouvez ajouter une limite, du type « ou arrête-toi après 20 tours ». Transposé à une PME, cela pourrait donner : « chaque ligne du fichier de relances a un statut, le total correspond à l'export comptable, aucune ligne existante n'est supprimée ».

Ce que Boris Cherny dit, et ce qu'il ne dit pas

Addy Osmani cite Boris Cherny, responsable de Claude Code chez Anthropic : « Je ne prompte plus Claude. J'ai des boucles qui tournent, qui promptent Claude et déterminent quoi faire. Mon travail, c'est d'écrire des boucles. »

Boris Cherny décrit ici sa façon de travailler. Il ne dit pas qu'Anthropic a cessé d'écrire des prompts. Addy Osmani nuance lui-même : « Le propos de Cherny n'est pas que le travail est devenu plus facile. C'est que le point de levier s'est déplacé. »

Avec Code Review, une équipe d'agents relit chaque demande de modification de code et classe les bugs par gravité. En interne, la part de modifications recevant des commentaires de fond est passée de 16 % à 54 %. L'outil n'approuve rien : Anthropic précise que cette décision reste humaine.

Ma conclusion pour votre entreprise

Le prompt reste utile. Dès qu'une tâche dure, se répète ou engage votre responsabilité, je vous conseille de raisonner en boucle : une condition de fin écrite, un juge à côté de l'agent, une preuve exigée avant validation. Commencez petit, sur une tâche dont vous savez déjà vérifier le résultat à la main. Si vous ne savez pas écrire la preuve, l'agent ne saura pas la produire.

Sources — Citations traduites de l'anglais par mes soins. Anthropic, Building effective agents ; Anthropic, Effective harnesses for long-running agents (Justin Young) ; Anthropic, Harness design for long-running application development (Prithvi Rajasekaran) ; documentation Claude Code, Keep Claude working toward a goal ; Anthropic, Bringing Code Review to Claude Code ; Addy Osmani, Loop Engineering (citation de Boris Cherny).

Questions fréquentes

Faut-il être développeur pour mettre en place une boucle d'agent ?

Pour /goal dans Claude Code, il faut être à l'aise avec un terminal. Le principe, lui, vous concerne directement : définir ce que « fini » veut dire, comment le vérifier, ce qui ne doit pas bouger. Un prestataire peut construire le harnais, mais vous seul savez écrire la condition de fin.

Une boucle coûte-t-elle plus cher qu'un simple échange ?

Oui, souvent nettement. Dans l'expérience décrite par Anthropic, l'agent seul a coûté 9 dollars, le harnais complet 200. Code Review revient en moyenne à 15 à 25 dollars par relecture. Je trouve ce surcoût justifié quand le résultat doit fonctionner. Pour une tâche ponctuelle et facile à relire, gardez l'échange classique.

Un second modèle suffit-il à garantir le résultat ?

Non. Selon Anthropic, l'évaluateur reste un LLM, enclin à l'indulgence envers ce qu'un autre LLM a produit, et il a fallu plusieurs réglages pour le rendre sévère. Le juge de /goal ne voit que la conversation. Votre meilleure garantie reste une preuve mesurable, que vous pouvez contrôler vous-même.

Par quelle tâche commencer dans une PME ?

Choisissez une tâche répétitive au résultat vérifiable sans débat : un rapprochement de fichiers, un tri de demandes clients, une mise à jour de catalogue. Anthropic cite le support client parmi les usages prometteurs, car la réussite s'y mesure à la résolution de la demande. Évitez au départ ce qui relève du goût.