Quantification : ce que vous perdez vraiment
Ce que la quantification retire à un modèle, pourquoi la perplexité ne le montre pas, et le protocole par paires qui mesure la perte sur votre tâche avant de choisir entre 4 bits, 8 bits ou un modèle plus petit.
Par Elias Varen8 min de lectureMembres
Le modèle en 4 bits affiche une perplexité à 2 % de celle du modèle d'origine. Vous le déployez sur votre tâche d'extraction. Une semaine plus tard, 6 % des sorties JSON ne passent plus la validation : une accolade manquante au bout de 900 tokens, un montant où 1 250,00 est devenu 1 205,00, une clé "date_échéance" écrite "date_echeance".
Rien de cela ne contredit les 2 %. La perplexité est une moyenne sur tous les tokens d'un texte courant, et dans un texte courant la plupart des tokens sont faciles. Votre tâche, elle, se joue sur quelques tokens difficiles (un chiffre, un délimiteur, un caractère accentué dans un identifiant) où la bonne réponse ne devançait la mauvaise que de peu. La quantification déplace un peu toutes les probabilités, mais elle ne fait basculer que les décisions serrées, et ce sont justement celles que vous vérifiez.
Un arrondi qui fait bifurquer la génération
Quantifier consiste à stocker chaque poids sur moins de bits, 8, 5, 4, parfois 3, au lieu de 16. Chaque poids est arrondi à la valeur représentable la plus proche. L'erreur d'arrondi sur un poids est minuscule ; un modèle en compte des milliards, enchaînés sur des dizaines de couches, et l'erreur de sortie d'une couche devient l'entrée de la suivante.
Les schémas courants ne traitent pas tous les poids de la même manière. Ils gardent plus de bits pour les couches ou les blocs dont l'arrondi coûte le plus, d'où les variantes mixtes qu'on voit dans les noms de fichiers. Cela réduit la perte moyenne sans changer sa nature.
À la sortie, le modèle produit une distribution de probabilité sur le token suivant, que la quantification perturbe légèrement. Selon la marge, l'effet diffère du tout au tout.
décision large décision serrée
« Paris » 0,97 → 0,96 « 5 » 0,48 → 0,44
« Lyon » 0,01 → 0,015 « 0 » 0,45 → 0,47
→ même token choisi → le token choisi changeÀ lire ensuite
Toute la rubrique IAIA
Étiqueter des images avec un modèle local
Concevoir un étiquetage d'images par un modèle de vision auto-hébergé : vocabulaire fermé, mesure par étiquette, calcul du débit et du coût, et les cas où une API ou un simple classifieur font mieux.
8 minMembres
IA
Le RAG n'est pas mort, votre recherche est mauvaise
Pourquoi ni les grandes fenêtres de contexte ni les agents ne suppriment la recherche, comment mesurer le rappel séparément de la génération, et les fondamentaux à corriger avant de changer d'architecture.
7 minMembres
IA
Sorties structurées : la contrainte dégrade-t-elle la réponse ?
Ce que le décodage contraint garantit et ce qu'il ne garantit pas, les quatre façons dont un schéma mal conçu abîme la réponse, et comment mesurer l'écart entre validité et qualité sur vos propres cas.
7 minMembres