« Difficile à évaluer » est un défaut de conception produit
Quand personne ne sait dire si une sortie de modèle est bonne, le problème vient du cadrage de la fonctionnalité, pas de l'outillage. Cinq façons de la recadrer pour qu'elle soit vérifiable, ce qu'on y perd, et quand il faut assumer le flou.
Par Elias Varen8 min de lectureMembres
« On ne peut pas vraiment évaluer ça, c'est trop subjectif. » J'entends cette phrase à propos de fonctionnalités déjà en production, et elle passe pour une contrainte technique. Je la lis plutôt comme l'aveu qu'on a livré quelque chose dont personne ne sait dire ce qu'est une bonne sortie. Si l'équipe ne le sait pas, l'utilisateur non plus, et il devra vérifier chaque réponse lui-même ou faire confiance à l'aveugle.
La difficulté d'évaluation est une propriété du cahier des charges. Elle se règle donc à l'étape de conception, avant d'écrire le premier prompt, et rarement après.
D'où vient la difficulté
Soit deux énoncés de la même idée.
Le premier parle d'« un assistant qui aide le gestionnaire à traiter ses dossiers ». L'entrée est n'importe quelle question, la sortie n'importe quel texte. Pour évaluer une réponse, il faut un expert qui la lise, qui connaisse le dossier et qui juge, à raison de cinq minutes par trace, et deux experts ne seront pas d'accord.
Le second demande, « pour un dossier donné, de lister les pièces manquantes parmi celles que la procédure exige, avec pour chaque pièce présente le document qui en tient lieu ». L'entrée est un dossier, la sortie une liste finie d'éléments pris dans un référentiel connu. Chaque élément est vrai ou faux, vérifiable en trente secondes par quelqu'un qui ouvre le dossier, et en grande partie par du code.
Les deux fonctionnalités utilisent le même modèle et à peu près les mêmes données. La seconde est évaluable parce qu'on a réduit l'espace des entrées, l'espace des sorties et la distance entre une sortie et sa vérification. Ce sont les leviers dont tout le reste découle.
Fermer, prouver, découper, agir, proposer
Fermer l'espace de sortie. Chaque fois qu'une valeur peut être prise dans une liste, elle doit l'être : une catégorie parmi douze, un statut parmi quatre, un identifiant qui existe en base. Un texte libre demande un juge, une valeur dans une énumération demande une égalité. Le modèle peut rester libre dans un champ de justification, évalué à part ou pas du tout.
À lire ensuite
Toute la rubrique IAIA
Notes de 1 à 5 : pourquoi le binaire gagne
Une échelle de 1 à 5 déplace le désaccord dans la moyenne, où plus personne ne le voit. Pourquoi un verdict conforme/non conforme par critère se mesure mieux, ce qu'il coûte et où une échelle reste le bon outil.
7 minMembres
IA
Migrer de modèle sans régression
Pourquoi un prompt n'est pas portable d'un modèle à l'autre, quel protocole d'évaluation suivre avant de basculer, et comment déployer le changement pour pouvoir revenir en arrière.
7 minMembres
IA
Évaluer la recherche avant la génération
Dans un système à recherche documentaire, le rappel de la recherche plafonne la qualité des réponses. Comment mesurer cet étage seul, attribuer chaque échec au bon composant, et éviter de régler un prompt sur un bug de recherche.
7 minMembres