Multi-agents : l'isolation de contexte se paie en coordination
Ce que des sous-agents achètent vraiment, ce qu'ils coûtent en tokens et en coordination, et la règle qui réconcilie « tout dans un seul fil » et « un agent par tâche » : paralléliser la lecture, jamais la décision.
Par Elias Varen7 min de lectureMembres
Deux positions s'affrontent sur les systèmes multi-agents, et chacune est défendue par des gens qui en ont construit. Selon la première, un agent unique sature son contexte, donc on découpe ; chaque sous-agent travaille dans un contexte propre et rend un résumé. Selon la seconde, un agent qui ne voit pas ce que les autres ont décidé prend des décisions incompatibles, donc on garde tout dans un seul fil.
Les deux ont raison, parce qu'elles ne parlent pas des mêmes tâches. Un sous-agent est une frontière de contexte, et comme toute frontière en architecture, elle isole et oblige à coordonner. La question n'est pas « un ou plusieurs agents », c'est de savoir ce qui traverse la frontière, et si la tâche survit à ce que la frontière retient.
Ce que l'isolation achète
Un agent qui explore accumule. Pour répondre à « où est calculée la TVA dans ce repo ? », il lit vingt fichiers, dont dix-sept ne servaient à rien. Ces dix-sept fichiers restent dans son contexte jusqu'à la fin de la session, payés à chaque tour, et ils diluent l'attention portée au reste.
Un sous-agent fait la même exploration dans un contexte jetable et rend trois lignes : le fichier, la fonction, la règle. L'orchestrateur garde un contexte propre, donc une meilleure tenue des consignes sur la durée, et plusieurs explorations peuvent tourner en parallèle.
L'isolation achète un contexte principal court, et du parallélisme. C'est beaucoup, et c'est tout. Elle n'apporte aucune intelligence supplémentaire, et les rôles à titre (« l'architecte », « le relecteur ») n'ajoutent rien par eux-mêmes.
L'arithmétique des tokens
L'idée reçue veut que le multi-agents coûte plus cher. Encore faut-il voir d'où vient la facture.
Le coût en entrée d'une boucle d'agent est la somme des contextes renvoyés à chaque tour. Avec un contexte de départ c, un ajout d par tour et N tours, cette somme vaut à peu près N × c + d × N² / 2. Le terme en N² domine dès que la session s'allonge.
À lire ensuite
Toute la rubrique IAIA
Trop d'outils : découverte progressive ou exécution de code
Ce que coûte un catalogue d'outils chargé en entier à chaque tour, et comment choisir entre trois sorties : élaguer, faire découvrir les outils à la demande, ou laisser l'agent écrire du code qui les appelle.
7 minLecture libre
IA
La compaction perd de l'information : laquelle ?
Les six catégories d'information qu'un résumé de conversation laisse tomber, pourquoi ce sont précisément celles dont l'agent a besoin ensuite, et ce qu'il faut écrire hors du contexte pour qu'elles survivent.
7 minLecture libre
IA
API ou GPU : le point mort honnête
Le calcul complet du coût par million de tokens d'un modèle auto-hébergé, pourquoi le taux d'utilisation décide de tout, et les raisons autres que le prix qui justifient, ou non, de louer un GPU.
7 minMembres