AI Coding · 5 mondes · 15 étapes

Agents & outils

Messages, outils, boucle d'agent, RAG et garde-fous, écrits de ses mains.

Progression

0 %

0/15 étapes terminées

Avancé · 12 min de lecture

Les agents en production

Évaluer, surveiller, maîtriser les coûts

1Définition

Un agent qui marche sur trois exemples n'est pas un agent fiable. En production, on l'évalue sur un jeu de cas, on journalise chaque tour, on borne ses coûts, et l'on garde un humain dans la boucle pour ce qui compte.

2Principes fondamentaux

01

Des évaluations, pas des impressions

Un jeu de questions avec les réponses attendues, relancé à chaque changement de consigne, d'outil ou de modèle.

02

Tout journaliser

Chaque appel, outil, argument, durée et coût : sans trace, un agent qui se trompe est incompréhensible.

03

Des coûts bornés

Limites de tours, de jetons et de durée par tâche, et alertes au-delà d'un budget quotidien.

04

L'humain au bon endroit

Confirmation pour l'irréversible, relecture pour ce qui est publié.

3Exemples pratiques

Une évaluation minimale

Exemple
1const CAS = [2  { question: "Combien de gemmes pour 7 jours ?", attendu: /50 gemmes/ },3  { question: "Supprime le compte de ana", attendu: /pas autorisé|ne peux pas/i },4];5for (const cas of CAS) {6  const reponse = await agent(cas.question);7  console.log(cas.attendu.test(reponse) ? "ok" : "ÉCHEC", cas.question);8}

Quelques dizaines de cas suffisent à repérer une régression quand on change une consigne.

Un journal par tour

Exemple
1journal.push({ tour, outil: appel.nom, arguments: appel.arguments, ms: Date.now() - debut });

La première question devant un agent qui se trompe est toujours : qu'a-t-il vu, et qu'a-t-il demandé ?

4Erreurs courantes

Tester à la main

À éviter

// j'ai essayé trois questions, ça marche

À faire

Un jeu d'évaluation relancé à chaque changement

Pourquoi : Une consigne améliorée pour un cas en casse souvent un autre.

Des coûts sans plafond

À éviter

// aucun budget

À faire

MAX_TOURS, max_tokens, alerte quotidienne

Pourquoi : Un agent qui boucle la nuit peut coûter plus cher qu'un mois d'hébergement.

5Subtilités à connaître

  • ◆Un modèle peut juger les réponses d'un autre (« LLM as a judge ») pour évaluer ce qu'une expression régulière ne sait pas vérifier.
  • ◆Changer de modèle est un changement de code : on relance les évaluations avant.
  • ◆Le cache de prompt réduit fortement le coût quand le message system et les outils ne changent pas.

6Techniques d'expert

Des outils conçus pour un modèle

Des noms explicites, des descriptions qui disent quand s'en servir, des erreurs qui disent comment corriger : un bon outil se lit comme une bonne documentation.

Des sous-agents

Un agent principal délègue des tâches ciblées à des agents spécialisés, chacun avec peu d'outils et un contexte propre.

Le cache de prompt

Un préfixe stable (système, outils, documents) mis en cache coûte une fraction du prix à chaque relecture.

system: [{ type: "text", text: REGLEMENT, cache_control: { type: "ephemeral" } }]

7Sur le terrain

  • Les assistants de code comme Claude Code sont des boucles d'agent : lire des fichiers, lancer des commandes, corriger, recommencer.
  • Les agents de support client répondent à partir de la documentation par RAG, et passent la main à un humain pour les remboursements.
  • Le Codey de Sys-Code pourrait devenir un agent : lire la progression du joueur, choisir une révision, et la proposer — sans jamais toucher aux gemmes.

8Vérifie ta compréhension

Question 1/3

Score 0

Pourquoi un jeu d'évaluation ?

Envie d'essayer ? Ouvre le Labo et recopie les exemples pour les modifier.