Concept · Diagnostiquer et récupérer son budget de crawl

Budget de crawl : cesser de le dépenser en pure perte

Le budget de crawl désigne la quantité de pages qu’un moteur accepte d’explorer sur un site dans un intervalle donné. Cette page explique à partir de quelle taille il devient réellement un sujet, comment repérer qu’il est gaspillé, et comment le réorienter vers ce qui compte. Elle s’adresse aux sites de plusieurs milliers d’URL, en particulier aux catalogues à facettes. En dessous de quelques milliers de pages, ce n’est probablement pas ton problème.

Révisé le

Comprendre rapidement

Lyra · L’Archiviste
Définition
Le budget de crawl est le volume de pages qu’un moteur explore sur un site dans un intervalle donné, déterminé par la capacité du serveur et l’intérêt estimé du site.
Pourquoi c’est important
Une page jamais explorée ne peut être ni indexée ni citée. Sur les grands sites, l’exploration se disperse dans des URL sans valeur au détriment des pages stratégiques.
Notions liées
Indexation, maillage interne, architecture, facettes, journaux serveur.

Budget de crawl

Volume de pages qu’un moteur explore sur un site dans un intervalle donné.

Il résulte de deux facteurs : ce que ton serveur supporte sans se dégrader, et l’intérêt que le moteur accorde à ton site. Le second se gagne dans le temps ; le premier se corrige techniquement. Sur un site de taille modeste, tout est exploré régulièrement et le sujet n’existe pas.

Aussi appelécrawl budget · budget d’exploration

Les gouffres les plus fréquents

Par ordre décroissant de volume constaté sur les catalogues.

  • Les facettes combinables : trois filtres à dix valeurs produisent mille URL pour un seul contenu utile.
  • Les paramètres de tri et de pagination, qui dupliquent chaque liste autant de fois qu’il y a d’ordres possibles.
  • Les identifiants de session ou de campagne conservés dans l’URL.
  • Les chaînes de redirections héritées de migrations successives.
  • Les pages de recherche interne, souvent explorables par accident.
  • Les variantes de casse et les doublons avec ou sans barre oblique finale.

Comment le récupérer

  1. Mesurer avant d’agir

    Les journaux serveur disent ce qui est réellement exploré. Aucun autre outil ne le sait.

  2. Classer les URL explorées

    Utiles, inutiles, dupliquées. Le volume du deuxième groupe surprend presque toujours.

  3. Traiter à la source

    Ne pas générer le lien vaut mieux que le bloquer après coup.

  4. Vérifier l’effet

    Le rapport d’exploration doit montrer un déplacement vers les pages utiles en quatre à huit semaines.

Erreurs fréquentes

  • Bloquer dans robots.txt des pages déjà indexées

    Le moteur ne peut plus les explorer, donc plus voir qu’elles doivent être désindexées. Elles restent.

  • Confondre exploration et indexation

    Une page peut être explorée sans être indexée, et l’inverse arrive aussi.

  • Traiter le sujet sur un petit site

    C’est du temps pris sur le contenu, qui produirait bien plus.

Questions fréquentes

Ce qu’il faut retenir de cette page

Qu’est-ce que c’est ?
Le budget de crawl est le volume de pages qu’un moteur explore sur un site dans un intervalle donné, déterminé par la capacité du serveur et l’intérêt estimé du site.
Pourquoi est-ce important ?
Une page jamais explorée ne peut être ni indexée ni citée. Sur les grands sites, l’exploration se disperse dans des URL sans valeur au détriment des pages stratégiques.
Comment faire ?
Analyser les journaux serveur pour voir ce qui est réellement exploré, supprimer ou bloquer les URL sans valeur, réduire les chaînes de redirections et améliorer le maillage.
Quand est-ce pertinent ?
Au-delà de quelques milliers d’URL, ou dès que des facettes, filtres et paramètres multiplient les combinaisons.
Quelles erreurs éviter ?
S’en préoccuper sur un site de deux cents pages. Bloquer dans robots.txt des URL déjà indexées, ce qui les fige. Confondre exploration et indexation.
Quels concepts sont liés ?
Indexation, maillage interne, architecture, facettes, journaux serveur.

Prochaine étape

Choisir ton territoire

Temps estimé
-
Impact attendu
-
Réserver un appel
- Territoire non diagnostiqué Exploration · Inconnu du Royaume

Recherche

pour parcourir · Entrée pour ouvrir · Échap pour fermer

Journal de quêtes

TerritoireNon défini

MaturitéNon diagnostiquée

ConfianceAucune donnée

ClasseInconnue

ExplorationInconnu du Royaume

Quête principale

Augmenter la visibilité de mon site

  • Choisir mon territoire
  • Identifier mon adversaire
  • Terminer le diagnostic
  • Obtenir ma feuille de route
  • Vérifier une preuve et ses limites
  • Débloquer trois compétences

Campagne à 0 %

Battle Log

    Ressources débloquées

      Confort · profils d’expérience

      Adapter l’expérience

      Le profil est choisi automatiquement à partir de ton appareil, de tes préférences système et de ton réseau. Tu peux en changer à tout moment : le choix s’applique aussitôt et reste mémorisé.

      Détection en cours

      Choisir un profil d’expérience

      Question 1 sur 3

      Quel est ton objectif principal ?