Outils IA · 9 min · 2026-10-05 · Par Équipe MaitriseLIA
PageIndex : le RAG sans base vectorielle, qui lit un document par son sommaire — ce que disent vraiment les chiffres
Sur un long document professionnel, la recherche vectorielle trouve ce qui ressemble à la question, pas ce qui y répond. PageIndex propose l’inverse : lire le document par son sommaire, comme un humain. Les chiffres publiés sont sérieux et reproductibles — à condition de savoir lesquels décrivent la version que vous installez.
TL;DR — PageIndex en une minute
- Ce que c’est : un moteur de recherche documentaire (MIT, 38 662 étoiles) qui remplace la base vectorielle par un raisonnement : il lit un document par son sommaire, comme un humain, et cite la page.
- Pourquoi c’est intéressant : sur un long document professionnel, la ressemblance n’est pas la pertinence. PageIndex part de cette idée, et il a raison.
- Les chiffres : indexer coûte 0,001 $ par page, une seule fois ; le banc d’essai publié va de 85,5 % à 100 % de bonnes réponses.
- Le piège : le 98,7 % affiché en vitrine est celui du produit commercial, pas de la version qu’on installe.
- Notre verdict : à tester — pour les longs documents structurés, l’approche la plus convaincante que nous ayons vue.
Si vous avez déjà construit un assistant qui répond à partir de vos documents, vous connaissez la scène. On découpe le PDF en morceaux, on les range dans une base vectorielle, on pose une question… et l’assistant répond à côté, avec beaucoup d’assurance.
PageIndex met un nom sur le problème, et ce nom tient en une phrase de son README : la ressemblance n’est pas la pertinence.
Le problème que PageIndex attaque
Une recherche vectorielle retrouve les passages qui ressemblent à la question. Sur un court article, ça suffit. Sur un document professionnel de 80 pages, c’est souvent faux.
Prenez les conditions générales d’un contrat d’assurance et la question « suis-je couvert si ma maison est inoccupée trois mois ? ». La recherche vectorielle remontera volontiers la description de la garantie, qui parle de maison et de couverture. La vraie réponse se trouve peut-être dans une clause d’exclusion, quarante pages plus loin, qui ne ressemble pas du tout à la question.
Un juriste, lui, ne lit pas le contrat dans l’ordre : il ouvre le sommaire, repère la section des exclusions, et va droit à la bonne page. C’est exactement ce que PageIndex fait faire au modèle.
Comment ça marche
- Construire l’arbre. PageIndex extrait la structure du document — parties, chapitres, sections — à partir de sa mise en page, sans IA. Le résultat ressemble à un sommaire détaillé.
- Le résumer. Un petit modèle rédige un résumé de chaque nœud. L’éditeur précise qu’un modèle d’entrée de gamme suffit : l’arbre fait l’essentiel du travail.
- Raisonner. Au moment de la question, le modèle parcourt l’arbre comme on parcourt un sommaire, n’ouvre que les sections utiles, et répond en citant la page.
Le document est indexé une fois. Chaque question suivante réutilise l’arbre.
Les chiffres, et d’où ils viennent
Le README est d’une précision rare, et tous ses chiffres ne racontent pas la même chose. Il faut les trier.
Le coût d’indexation : environ 0,001 $ par page avec un modèle d’entrée de gamme. Un manuel de 1 000 pages revient donc à un peu plus d’un dollar, en quelques minutes, payés une seule fois. Les temps mesurés vont de 13 secondes à 4 minutes 30 pour des documents de 9 à 1 098 pages.
Le coût par question, face à l’envoi du PDF entier : donner tout le document au modèle à chaque question coûte 2,1 fois plus cher à 52 pages et 16,6 fois plus cher à 420 pages. À 805 pages, le document ne tient même plus dans la mémoire du modèle. PageIndex, lui, ne lit que les sections que son raisonnement atteint.
La précision de la version open source, mesurée sur un banc d’essai publié en entier — documents, questions, réponses de référence et script pour tout refaire :
| Modèle | Effort de raisonnement | Bonnes réponses | Coût moyen par question |
|---|---|---|---|
| --- | --- | --- | --- |
| Entrée de gamme | aucun | 53/62 · 85,5 % | 0,0031 $ |
| Entrée de gamme | élevé | 60/62 · 96,8 % | 0,0036 $ |
| Intermédiaire | élevé | 62/62 · 100 % | 0,0325 $ |
| Haut de gamme | aucun | 60/62 · 96,8 % | 0,0759 $ |
| Haut de gamme | moyen | 62/62 · 100 % | 0,0810 $ |
L’enseignement que personne ne met en avant
Regardez les deux lignes en gras. Le modèle le moins cher, à qui l’on demande de bien réfléchir, obtient exactement la même précision que le plus cher à qui l’on n’en demande aucune — 96,8 % dans les deux cas. Pour un coût 21 fois inférieur.
C’est l’information la plus utile de tout le projet, et elle dépasse PageIndex : sur une tâche de recherche bien structurée, l’effort de raisonnement compte davantage que la taille du modèle. Avant de payer le modèle le plus puissant, essayez de demander plus d’effort au moins cher.
Ce que la vitrine ne précise pas
Le 98,7 % n’est pas celui que vous installez. Le README annonce une précision de 98,7 % sur FinanceBench, un banc d’essai reconnu de questions sur des documents financiers. Ce résultat est celui de Mafin 2.5, le produit commercial de l’éditeur, bâti sur PageIndex. La version open source se mesure sur le banc d’essai ci-dessus — honnête, mais différent.
Le banc d’essai est petit et maison. Soixante-deux questions, choisies par l’éditeur, toutes de la catégorie la plus simple : retrouver un fait écrit en toutes lettres. Sa publication intégrale est exemplaire. Son dépôt ne compte pourtant que 4 étoiles : il n’a, pour l’instant, pas été repris de façon visible par d’autres.
La version locale a des limites nettes, et l’éditeur les affiche honnêtement :
| Version locale (gratuite) | Version cloud (payante) | |
|---|---|---|
| --- | --- | --- |
| Documents lus | PDF texte uniquement | PDF texte, scannés et riches en images |
| Citations | à la page | au bloc près |
| Lecture des scans (OCR) | — | ✓ |
| Serveur MCP pour vos agents | — | ✓ |
| Recherche sur un corpus entier | — | ✓ |
Si vos documents sont des scans — contrats signés, courriers, pièces justificatives —, la version gratuite ne les lira pas.
« Local » ne veut pas dire « rien ne sort ». En mode local, l’index et son stockage restent sur votre machine. Mais les appels au modèle, eux, partent chez votre fournisseur : par défaut, l’exemple du README utilise une clé OpenAI. Le texte de vos documents quitte donc votre poste à l’indexation comme à chaque question. Le fournisseur se configure : choisissez-le en fonction de la sensibilité de vos documents.
Le temps de réponse n’est pas mesuré. Le README chiffre le coût par question, pas le délai. Or raisonner sur un arbre demande plusieurs allers-retours avec le modèle. Pour une réponse instantanée, il faudra le mesurer vous-même.
Quand l’utiliser — et quand l’éviter
Il brille sur : les longs documents structurés, où la réponse dépend de l’endroit où elle se trouve — rapports financiers, contrats, conditions générales, textes réglementaires, manuels techniques. Partout où un humain commencerait par le sommaire.
Il est superflu sur : de nombreux documents courts, comme une base de questions fréquentes. Une recherche vectorielle classique y est plus simple et plus rapide.
Il n’est pas adapté, en local, à : des documents scannés, ou un besoin de réponse en temps réel sans mesure préalable.
Côté santé du projet, rien à redire : 552 jours d’existence, une activité régulière, une vraie équipe derrière, un kit de développement sorti en août 2026 avec ce mode local.
Notre verdict : à tester
Notre échelle : Installer / À tester / À suivre / Marque-page / Ignorer.
PageIndex est à tester, et c’est l’un des verdicts les plus enthousiastes de cette série. L’idée est juste, la mécanique est élégante, et les chiffres sont publiés avec une transparence qu’on aimerait voir partout.
Testez-le sur vos documents, avec vos questions, en commençant par le modèle le moins cher et un effort de raisonnement élevé. Ne vous fiez pas au 98,7 % de la vitrine : fiez-vous à ce que vous mesurerez vous-même. C’est d’ailleurs ce que l’éditeur vous donne les moyens de faire.
Sources
À propos de l'auteur
Équipe MaitriseLIA
Experts en formation Claude Code, Anthropic API et outils d'IA professionnels. Nos contenus sont rédigés par des spécialistes qui utilisent Claude Code et les MCPs au quotidien pour automatiser leurs business.