Notes de 1 à 5 : pourquoi le binaire gagne
Une échelle de 1 à 5 déplace le désaccord dans la moyenne, où plus personne ne le voit. Pourquoi un verdict conforme/non conforme par critère se mesure mieux, ce qu'il coûte et où une échelle reste le bon outil.
Par Elias Varen7 min de lectureMembres
La note moyenne de l'assistant est passée de 3,6 à 3,8 après le changement de prompt. Est-ce une amélioration ? Personne ne peut répondre, et la moyenne n'est pas seule en cause. On ne sait pas ce qui sépare un 3 d'un 4, ni si les deux annotateurs mettent la même chose derrière un 4, ni si un 3 est acceptable en production.
J'ai abandonné les échelles pour évaluer des sorties de modèle. Chaque critère reçoit un verdict, conforme ou non conforme. Une échelle prend un désaccord sur ce qu'est une bonne réponse et le transforme en bruit numérique que l'on peut moyenner, donc ignorer ; c'est pour cette raison que je n'en veux plus, bien plus que par goût de la simplicité.
Ce qu'une moyenne de 3,8 peut contenir
Soit cent réponses et deux façons d'arriver à 3,8.
Distribution A : 80 réponses notées 4, 20 notées 3
moyenne = (80 × 4 + 20 × 3) / 100 = 3,8
Distribution B : 70 réponses notées 5, 30 notées 1
moyenne = (70 × 5 + 30 × 1) / 100 = 3,8Le système A est uniformément correct sans plus. Le système B est excellent sept fois sur dix et inutilisable trois fois sur dix. Ce sont deux produits différents, avec deux plans d'action différents, et le tableau de bord affiche le même nombre.
On peut objecter qu'il suffit de regarder la distribution. C'est vrai, et dès qu'on le fait, on se retrouve à compter « combien sont en dessous du seuil acceptable ». On a réinventé le binaire, avec un seuil que personne n'a défini. Autant le définir d'abord.
Le second défaut est plus technique. Une moyenne suppose que l'écart entre 1 et 2 vaut l'écart entre 4 et 5. Sur une échelle de qualité, rien ne le garantit, car passer de « faux » à « partiellement faux » n'a pas la même valeur que passer de « bon » à « très bon ». L'arithmétique porte alors sur des étiquettes ordonnées, que rien n'autorise à additionner.
À lire ensuite
Toute la rubrique IAIA
Migrer de modèle sans régression
Pourquoi un prompt n'est pas portable d'un modèle à l'autre, quel protocole d'évaluation suivre avant de basculer, et comment déployer le changement pour pouvoir revenir en arrière.
7 minMembres
IA
Évaluer la recherche avant la génération
Dans un système à recherche documentaire, le rappel de la recherche plafonne la qualité des réponses. Comment mesurer cet étage seul, attribuer chaque échec au bon composant, et éviter de régler un prompt sur un bug de recherche.
7 minMembres
IA
Données synthétiques : utiles, puis toxiques
Les requêtes générées par un modèle permettent d'évaluer avant d'avoir des utilisateurs, puis faussent la mesure dès qu'il y en a. Où elles s'écartent du réel, comment mesurer l'écart et quand les retirer.
7 minMembres