GraphRAG : la facture d'indexation et quand elle se rembourse
Le calcul du coût d'un index en graphe construit par un modèle, les deux seules familles de questions qui le remboursent (globales et multi-sauts), et les alternatives moins chères à essayer d'abord.
Par Elias Varen8 min de lectureMembres
Un index vectoriel coûte une passe d'embedding, où chaque fragment est lu une fois par un petit modèle bon marché. Un index GraphRAG coûte une passe de génération : chaque fragment est lu par un modèle de langage qui écrit ce qu'il y trouve, puis d'autres passes résument ce qui a été écrit. L'écart se compte en deux ordres de grandeur, bien au-delà de quelques dizaines de pour cent, et il se repaie à chaque mise à jour du corpus.
Cet écart se justifie pour deux familles de questions, et pour elles seulement. Pour tout le reste, c'est-à-dire neuf questions sur dix dans la plupart des produits, on a payé cent fois plus cher un index qui répond moins bien qu'une recherche hybride correcte.
Ce que l'indexation fait réellement
Le pipeline type a quatre étapes.
fragments ──► extraction ──► résolution ──► communautés ──► résumés
(LLM, par (fusion des (algorithme (LLM, par
fragment) entités) de graphe) communauté,
par niveau)Extraction. Pour chaque fragment, un modèle liste les entités (personnes, organisations, produits, lieux, concepts) et les relations entre elles, avec une courte description. Souvent en plusieurs passes, parce que la première en oublie.
Résolution. « SARL Dupont », « Dupont et fils » et « l'entreprise Dupont » doivent devenir un seul nœud, par similarité de noms, par embeddings, ou de nouveau par un modèle.
Communautés. Un algorithme de partitionnement regroupe les nœuds densément liés, sur plusieurs niveaux, de petites grappes étant regroupées en grappes plus larges.
Résumés. Pour chaque communauté, à chaque niveau, un modèle rédige une synthèse de ce qu'elle contient. Ces synthèses servent à répondre aux questions globales.
À la requête, deux modes coexistent. En mode local, on part des entités de la question, on suit leurs relations et on remonte les fragments d'origine. En mode global, on fait lire les résumés de communautés à un modèle, par lots, et on agrège les réponses partielles.
À lire ensuite
Toute la rubrique IAIA
API ou GPU : le point mort honnête
Le calcul complet du coût par million de tokens d'un modèle auto-hébergé, pourquoi le taux d'utilisation décide de tout, et les raisons autres que le prix qui justifient, ou non, de louer un GPU.
7 minMembres
IA
Rerankers : 200 ms pour combien de points de rappel ?
Ce qu'un reranker peut et ne peut pas améliorer, comment chiffrer son gain en rappel contre son coût en latence, et le calcul qui dit s'il a sa place dans votre pipeline.
8 minMembres
IA
Le RAG n'est pas mort, votre recherche est mauvaise
Pourquoi ni les grandes fenêtres de contexte ni les agents ne suppriment la recherche, comment mesurer le rappel séparément de la génération, et les fondamentaux à corriger avant de changer d'architecture.
7 minMembres