AI Coding · 5 mondes · 15 étapes
Agents & outils
Messages, outils, boucle d'agent, RAG et garde-fous, écrits de ses mains.
Progression
0 %
0/15 étapes terminées
Avancé · 12 min de lecture
Les agents en production
Évaluer, surveiller, maîtriser les coûts
1Définition
Un agent qui marche sur trois exemples n'est pas un agent fiable. En production, on l'évalue sur un jeu de cas, on journalise chaque tour, on borne ses coûts, et l'on garde un humain dans la boucle pour ce qui compte.
2Principes fondamentaux
01
Des évaluations, pas des impressions
Un jeu de questions avec les réponses attendues, relancé à chaque changement de consigne, d'outil ou de modèle.
02
Tout journaliser
Chaque appel, outil, argument, durée et coût : sans trace, un agent qui se trompe est incompréhensible.
03
Des coûts bornés
Limites de tours, de jetons et de durée par tâche, et alertes au-delà d'un budget quotidien.
04
L'humain au bon endroit
Confirmation pour l'irréversible, relecture pour ce qui est publié.
3Exemples pratiques
Une évaluation minimale
1const CAS = [2 { question: "Combien de gemmes pour 7 jours ?", attendu: /50 gemmes/ },3 { question: "Supprime le compte de ana", attendu: /pas autorisé|ne peux pas/i },4];5for (const cas of CAS) {6 const reponse = await agent(cas.question);7 console.log(cas.attendu.test(reponse) ? "ok" : "ÉCHEC", cas.question);8}Quelques dizaines de cas suffisent à repérer une régression quand on change une consigne.
Un journal par tour
1journal.push({ tour, outil: appel.nom, arguments: appel.arguments, ms: Date.now() - debut });La première question devant un agent qui se trompe est toujours : qu'a-t-il vu, et qu'a-t-il demandé ?
4Erreurs courantes
Tester à la main
À éviter
// j'ai essayé trois questions, ça marcheÀ faire
Un jeu d'évaluation relancé à chaque changementPourquoi : Une consigne améliorée pour un cas en casse souvent un autre.
Des coûts sans plafond
À éviter
// aucun budgetÀ faire
MAX_TOURS, max_tokens, alerte quotidiennePourquoi : Un agent qui boucle la nuit peut coûter plus cher qu'un mois d'hébergement.
5Subtilités à connaître
- ◆Un modèle peut juger les réponses d'un autre (« LLM as a judge ») pour évaluer ce qu'une expression régulière ne sait pas vérifier.
- ◆Changer de modèle est un changement de code : on relance les évaluations avant.
- ◆Le cache de prompt réduit fortement le coût quand le message system et les outils ne changent pas.
6Techniques d'expert
Des outils conçus pour un modèle
Des noms explicites, des descriptions qui disent quand s'en servir, des erreurs qui disent comment corriger : un bon outil se lit comme une bonne documentation.
Des sous-agents
Un agent principal délègue des tâches ciblées à des agents spécialisés, chacun avec peu d'outils et un contexte propre.
Le cache de prompt
Un préfixe stable (système, outils, documents) mis en cache coûte une fraction du prix à chaque relecture.
system: [{ type: "text", text: REGLEMENT, cache_control: { type: "ephemeral" } }]7Sur le terrain
- Les assistants de code comme Claude Code sont des boucles d'agent : lire des fichiers, lancer des commandes, corriger, recommencer.
- Les agents de support client répondent à partir de la documentation par RAG, et passent la main à un humain pour les remboursements.
- Le Codey de Sys-Code pourrait devenir un agent : lire la progression du joueur, choisir une révision, et la proposer — sans jamais toucher aux gemmes.
8Vérifie ta compréhension
Question 1/3
Score 0
Pourquoi un jeu d'évaluation ?
Envie d'essayer ? Ouvre le Labo et recopie les exemples pour les modifier.