Aller au contenu
GraphRAG : la facture d'indexation et quand elle se rembourseLecture : 0 %

GraphRAG : la facture d'indexation et quand elle se rembourse

Le calcul du coût d'un index en graphe construit par un modèle, les deux seules familles de questions qui le remboursent (globales et multi-sauts), et les alternatives moins chères à essayer d'abord.

Par Elias Varen8 min de lectureMembres

Un index vectoriel coûte une passe d'embedding, où chaque fragment est lu une fois par un petit modèle bon marché. Un index GraphRAG coûte une passe de génération : chaque fragment est lu par un modèle de langage qui écrit ce qu'il y trouve, puis d'autres passes résument ce qui a été écrit. L'écart se compte en deux ordres de grandeur, bien au-delà de quelques dizaines de pour cent, et il se repaie à chaque mise à jour du corpus.

Cet écart se justifie pour deux familles de questions, et pour elles seulement. Pour tout le reste, c'est-à-dire neuf questions sur dix dans la plupart des produits, on a payé cent fois plus cher un index qui répond moins bien qu'une recherche hybride correcte.

Ce que l'indexation fait réellement

Le pipeline type a quatre étapes.

fragments ──► extraction ──► résolution ──► communautés ──► résumés
              (LLM, par      (fusion des    (algorithme     (LLM, par
               fragment)      entités)       de graphe)      communauté,
                                                             par niveau)

Extraction. Pour chaque fragment, un modèle liste les entités (personnes, organisations, produits, lieux, concepts) et les relations entre elles, avec une courte description. Souvent en plusieurs passes, parce que la première en oublie.

Résolution. « SARL Dupont », « Dupont et fils » et « l'entreprise Dupont » doivent devenir un seul nœud, par similarité de noms, par embeddings, ou de nouveau par un modèle.

Communautés. Un algorithme de partitionnement regroupe les nœuds densément liés, sur plusieurs niveaux, de petites grappes étant regroupées en grappes plus larges.

Résumés. Pour chaque communauté, à chaque niveau, un modèle rédige une synthèse de ce qu'elle contient. Ces synthèses servent à répondre aux questions globales.

À la requête, deux modes coexistent. En mode local, on part des entités de la question, on suit leurs relations et on remonte les fragments d'origine. En mode global, on fait lire les résumés de communautés à un modèle, par lots, et on agrège les réponses partielles.

GraphRAG : la facture d'indexation et quand elle se rembourse · Deepstack