Crawl budget : arrêter de gaspiller des visites
Repérer les URL inutiles qui épuisent le crawl et prioriser ce qui compte vraiment.
6 min de lecture
4,9sur 5550 votes
- 5,5Klecteurs
- 12en ce moment
- 129partages
Le crawl budget désigne le volume de passages qu’un moteur de recherche consacre à un site pendant une période donnée. Il se gaspille quand des adresses sans valeur absorbent ces passages à la place des pages qui rapportent des visites. Trois gestes suffisent pour reprendre la main.
- Repérer les URL réellement explorées, avec le rapport sur l’exploration et les fichiers journaux du serveur.
- Soustraire à l’exploration tout ce qui ne mérite ni visite ni indexation.
- Vérifier ensuite que les pages utiles sont bien explorées plus souvent qu’avant.
Sur un site de quelques centaines d’adresses, le sujet semble lointain. Il devient concret dès que le catalogue grandit, que les filtres se multiplient et que les balises s’empilent au fil des refontes. Ce guide montre comment mesurer le gaspillage, puis le réduire sans abîmer le référencement déjà acquis.
Crawl budget : ce que Google compte réellement
Un moteur de recherche ne visite pas un site au hasard. Il combine deux limites. La première dépend de la capacité du serveur à répondre sans ralentir, la seconde reflète l’intérêt qu’il porte aux adresses qu’il connaît. Quand ces deux limites se rejoignent, vous obtenez le nombre de passages effectivement accordés à votre domaine.
La nuance compte : sur un site de moins de quelques milliers de pages, rarement mises à jour, ce plafond n’est presque jamais le facteur bloquant. Le gaspillage devient un vrai sujet quand le site génère des adresses à la volée, publie chaque jour, ou partage un hébergement lent avec d’autres projets.
Retenez aussi la différence entre exploration et indexation. Une page visitée peut être écartée ensuite. Une page jamais visitée, en revanche, ne peut pas être évaluée du tout, quelle que soit sa qualité.
Les fuites de visites les plus courantes
Certaines sources de gaspillage reviennent sur presque tous les sites marchands, annuaires ou médias. Le tableau ci-dessous aide à les reconnaître rapidement.
| Source | Signe visible | Correctif durable |
|---|---|---|
| Paramètres d’URL et filtres à facettes | Des milliers d’adresses très proches explorées | Attributs de filtre, canoniques cohérentes, combinaisons inutiles soustraites |
| Recherche interne | Adresses de type /?s= explorées en masse | Exclusion de l’exploration, retrait des liens du gabarit |
| Pagination profonde | L’activité se concentre sur les pages 9, 15, 22 | Liens principaux vers les premières pages, suite chargée autrement |
| Archives par date et par auteur | Des listes sans contenu propre revisitées chaque semaine | Fusion, suppression ou désindexation, maillage revu |
| Redirections en chaîne | Le temps de réponse moyen grimpe | Liens entrants corrigés, saut direct vers l’adresse finale |
| Sitemap trop large | Beaucoup d’adresses envoyées, peu retenues | Déclarer uniquement les pages canoniques et utiles |
Un site qui cumule trois lignes de ce tableau dépense une part importante de ses passages sur des adresses que personne ne consulte. Le problème n’est pas seulement technique : il déplace l’attention du robot loin des fiches produit, des articles ou des pages de service.
Lire le rapport sur l’exploration avant de toucher au fichier robots.txt
La tentation est de tout bloquer dès la première intuition. C’est souvent une erreur. Avant d’écrire la moindre ligne, examinez les statistiques d’exploration proposées par la Search Console. Le total sur trois mois, la répartition par type de fichier, par code de réponse, par finalité et le temps moyen de téléchargement racontent déjà l’essentiel.
Croisez ensuite ces chiffres avec les fichiers journaux du serveur, qui donnent la liste brute des adresses visitées et l’identité du robot. Vous découvrirez parfois qu’une part énorme des passages concerne des ressources annexes : images déclinées à l’infini, scripts appelés depuis plusieurs domaines, ou pages de test oubliées en ligne.
Trois questions structurent cette lecture : quelles adresses consomment le plus de passages, lesquelles apportent une visite organique, et lesquelles n’apparaissent dans aucune des deux catégories précédentes. Ce dernier groupe est votre gisement d’économies.
Soustraire des adresses sans casser le maillage interne
Deux mécanismes sont souvent confondus. Une règle de blocage dans le fichier robots.txt empêche la visite, mais elle empêche aussi la lecture d’une éventuelle consigne d’indexation. Si vous voulez qu’une page sorte de l’index, laissez le robot l’explorer et placez une balise d’exclusion dans son en-tête. Bloquer une page que l’on souhaite désindexer revient à l’enfermer sans jamais lui dire de partir.
La pagination mérite un traitement particulier. Elle doit rester accessible aux robots, car c’est par elle que les fiches anciennes sont découvertes. En revanche, rien n’oblige à pointer les vingt dernières pages depuis le gabarit. Un maillage qui privilégie les trois ou quatre premières suffit à la découverte.
Pour le reste, préférez la propreté à l’empilement. Une adresse supprimée pour de bon se traite avec un code de disparition définitive plutôt qu’une redirection vers l’accueil. Les redirections vers l’accueil, multipliées, créent des signaux contradictoires et consomment des passages à chaque cycle.
Prioriser les pages qui méritent une visite du robot
Réduire le gaspillage ne suffit pas si les bonnes pages restent invisibles. Un sitemap à jour, limité aux adresses canoniques, sert de liste de courses au robot. Un maillage interne cohérent, avec des liens contextuels depuis les pages fortes, raccourcit le chemin vers les contenus récents.
La fraîcheur joue également. Une fiche mise à jour ou un article enrichi attire davantage de passages qu’une page laissée à l’abandon. Le stock de contenus morts, lui, occupe de la place dans les listes d’exploration sans rien apporter en retour.
Enfin, traquez les pages orphelines. Elles existent, elles sont parfois indexables, mais aucun lien ne mène à elles. Elles consomment des passages quand un sitemap les déclare, sans jamais recevoir la moindre visite.
Mesurer l’effet du nettoyage sur les visites utiles
Comptez six à dix semaines avant de juger. Les indicateurs qui bougent en premier sont le délai entre la publication d’une page et sa première exploration, puis la fréquence de passage sur les adresses importantes. Un nettoyage réussi se traduit aussi par une baisse nette des visites sur les familles d’URL écartées, sans recul du trafic organique.
Comparez toujours deux périodes de même durée, en tenant compte des variations saisonnières. Si les visites utiles progressent alors que le total de passages stagne, l’opération est gagnante : le robot travaille mieux, pas forcément plus.
Trois situations reviennent régulièrement dans les questions posées par les webmasters. Voici des réponses directes.
Un site de deux cents pages doit-il vraiment se préoccuper de son crawl budget ?
Rarement, et ce serait une perte de temps. Un site de cette taille est exploré sans difficulté technique. Concentrez vos efforts sur la qualité des contenus et sur les erreurs d’indexation, le sujet du budget d’exploration ne devient prioritaire qu’avec la volumétrie.
Faut-il bloquer les filtres à facettes dans le fichier robots.txt ?
Cela dépend du besoin. Si les combinaisons de filtres n’ont aucune valeur pour la recherche, la soustraction est utile. Si certaines pages filtrées captent du trafic, mieux vaut les garder explorables et retirer les combinaisons sans intérêt avec des attributs dédiés.
Combien de temps avant de constater un effet sur les passages du robot ?
Le robot ajuste ses habitudes progressivement. Un premier changement est souvent perceptible en quelques semaines, une tendance stable demande deux à trois mois. La suppression d’adresses très anciennes peut prendre davantage de temps si des liens externes pointent encore vers elles.
Un sitemap fait-il grossir le budget d’exploration ?
Non, il ne l’augmente pas de lui-même. Il oriente la découverte vers des adresses précises. En revanche, un sitemap qui déclare des milliers d’URL secondaires détourne l’attention vers ce qui compte le moins, ce qui revient à gaspiller les passages disponibles.
L’exclusion d’indexation suffit-elle à économiser des passages ?
Pas complètement. Une page marquée pour exclusion reste explorable, donc visitable. Pour économiser réellement, combinez la désindexation avec la suppression des liens internes qui la rendent inutilement visible.
L’auteur
Consultante technique SEO
Indépendante, je teste moi-même ce que je recommande. Ma spécialité : crawl, indexation, performance web et migrations.
Voir tous ses articlesVotre avis compte
Cet article vous a-t-il été utile ?
4,9sur 5550votes
Commentaires
Soyez le premier à réagir.
