Concept · Diagnostiquer et récupérer son budget de crawl
Budget de crawl : cesser de le dépenser en pure perte
Le budget de crawl désigne la quantité de pages qu’un moteur accepte d’explorer sur un site dans un intervalle donné. Cette page explique à partir de quelle taille il devient réellement un sujet, comment repérer qu’il est gaspillé, et comment le réorienter vers ce qui compte. Elle s’adresse aux sites de plusieurs milliers d’URL, en particulier aux catalogues à facettes. En dessous de quelques milliers de pages, ce n’est probablement pas ton problème.
Révisé le
Comprendre rapidement
Lyra · L’Archiviste- Définition
- Le budget de crawl est le volume de pages qu’un moteur explore sur un site dans un intervalle donné, déterminé par la capacité du serveur et l’intérêt estimé du site.
- Pourquoi c’est important
- Une page jamais explorée ne peut être ni indexée ni citée. Sur les grands sites, l’exploration se disperse dans des URL sans valeur au détriment des pages stratégiques.
- Notions liées
- Indexation, maillage interne, architecture, facettes, journaux serveur.
Budget de crawl
Volume de pages qu’un moteur explore sur un site dans un intervalle donné.
Il résulte de deux facteurs : ce que ton serveur supporte sans se dégrader, et l’intérêt que le moteur accorde à ton site. Le second se gagne dans le temps ; le premier se corrige techniquement. Sur un site de taille modeste, tout est exploré régulièrement et le sujet n’existe pas.
Aussi appelécrawl budget · budget d’exploration
Les gouffres les plus fréquents
Par ordre décroissant de volume constaté sur les catalogues.
- Les facettes combinables : trois filtres à dix valeurs produisent mille URL pour un seul contenu utile.
- Les paramètres de tri et de pagination, qui dupliquent chaque liste autant de fois qu’il y a d’ordres possibles.
- Les identifiants de session ou de campagne conservés dans l’URL.
- Les chaînes de redirections héritées de migrations successives.
- Les pages de recherche interne, souvent explorables par accident.
- Les variantes de casse et les doublons avec ou sans barre oblique finale.
Comment le récupérer
Mesurer avant d’agir
Les journaux serveur disent ce qui est réellement exploré. Aucun autre outil ne le sait.
Classer les URL explorées
Utiles, inutiles, dupliquées. Le volume du deuxième groupe surprend presque toujours.
Traiter à la source
Ne pas générer le lien vaut mieux que le bloquer après coup.
Vérifier l’effet
Le rapport d’exploration doit montrer un déplacement vers les pages utiles en quatre à huit semaines.
Erreurs fréquentes
Bloquer dans robots.txt des pages déjà indexées
Le moteur ne peut plus les explorer, donc plus voir qu’elles doivent être désindexées. Elles restent.
Confondre exploration et indexation
Une page peut être explorée sans être indexée, et l’inverse arrive aussi.
Traiter le sujet sur un petit site
C’est du temps pris sur le contenu, qui produirait bien plus.
Questions fréquentes
Ce qu’il faut retenir de cette page
- Qu’est-ce que c’est ?
- Le budget de crawl est le volume de pages qu’un moteur explore sur un site dans un intervalle donné, déterminé par la capacité du serveur et l’intérêt estimé du site.
- Pourquoi est-ce important ?
- Une page jamais explorée ne peut être ni indexée ni citée. Sur les grands sites, l’exploration se disperse dans des URL sans valeur au détriment des pages stratégiques.
- Comment faire ?
- Analyser les journaux serveur pour voir ce qui est réellement exploré, supprimer ou bloquer les URL sans valeur, réduire les chaînes de redirections et améliorer le maillage.
- Quand est-ce pertinent ?
- Au-delà de quelques milliers d’URL, ou dès que des facettes, filtres et paramètres multiplient les combinaisons.
- Quelles erreurs éviter ?
- S’en préoccuper sur un site de deux cents pages. Bloquer dans robots.txt des URL déjà indexées, ce qui les fige. Confondre exploration et indexation.
- Quels concepts sont liés ?
- Indexation, maillage interne, architecture, facettes, journaux serveur.
Pour aller plus loin
Ressources liées
- Connexe Cartes à collectionner Le cas extrême : des dizaines de milliers de références.
- Connexe Catalogue manga par tomes Des séries longues où chaque tome est une page.
- Concept Maillage interne Ce qui oriente l’exploration vers l’utile.
- Guide Optimiser Shopify pour le SEO Le cas des facettes sur un catalogue.
- Outil Diagnostic de visibilité Évaluer ta dimension technique.
- Étude de cas Manga Insight, le laboratoire Ce que je peux montrer à découvert, et pourquoi.
- Terme Contenu zombie Ce qui consomme l’exploration sans rien produire.
- FAQ Combien d’articles publier par mois ? Ce que la publication en volume coûte à l’exploration.
- Service Campagnes proposées La campagne « Reconquérir son territoire ».