Guide crawl Semrush 2026

Le crawl avec Semrush
comprendre et optimiser le budget de crawl

Comment le robot de Semrush parcourt ton site, ce que revele le rapport Crawled Pages, et comment corriger profondeur, pages orphelines et budget de crawl gaspille.

100
pages par defaut
100k
pages max/projet
≤ 3
profondeur ideale
⚡ Réponse rapide

Le crawl, c’est la facon dont le robot de Semrush decouvre et parcourt tes pages. Bien le configurer, c’est s’assurer que rien d’important n’echappe a l’analyse.

Par defaut Semrush crawle 100 pages, ce qui suffit pour un petit site mais rate les problemes d’un gros. Regle la limite selon ta taille reelle, surveille la profondeur et traque les pages orphelines qui gaspillent ton budget de crawl.

Le crawl, point de depart de tout audit

Avant meme de parler d’erreurs ou de score, il faut comprendre une chose : Semrush ne peut analyser que ce qu’il arrive a atteindre. Le crawl, c’est cette phase d’exploration ou le robot part de ton domaine et suit les liens de page en page, exactement comme le fait Googlebot. Si une page n’est reliee a rien, le robot ne la trouve pas, et elle reste dans l’angle mort de ton audit. Cette page fait partie de mon guide de l’audit SEO Semrush, dont elle detaille le moteur d’exploration.

Comprendre le crawl, c’est comprendre pourquoi certaines pages rankent et d’autres restent invisibles. Google alloue a chaque site un budget de crawl, c’est-a-dire un nombre de pages qu’il accepte d’explorer sur une periode donnee. Si ce budget part dans des pages inutiles, des filtres e-commerce ou des redirections en cascade, il en reste moins pour tes vraies pages importantes. Le Site Audit de Semrush te montre precisement ou ce budget fuit.

Pour un debutant, la bonne nouvelle c’est que tout ca se configure sans une seule ligne de code. Tu peux meme t’entrainer avec le compte gratuit Semrush qui autorise le crawl de 100 URL, de quoi comprendre la mecanique sur un petit site avant de passer a l’echelle superieure.

Beaucoup de debutants passent des heures a produire du contenu sans jamais verifier si les moteurs arrivent seulement a le lire. C’est mettre la charrue avant les boeufs. Un article parfait sur une page que le robot n’atteint pas ne rankera jamais. Maitriser le crawl, c’est s’assurer que le travail editorial ne part pas dans le vide, et c’est pour ca que je considere cette etape comme le veritable point de depart de toute strategie SEO serieuse.

Le crawl avec le Site Audit de Semrush

Comment fonctionne le robot de Semrush

Le robot demarre a l’adresse que tu lui donnes et explore ton site selon la source de crawl choisie. Trois options s’offrent a toi, et le choix n’est pas anodin car il determine quelles pages seront vues.

Source de crawl Ce que le robot suit Quand la choisir
Website Les liens internes depuis la page de depart Audit standard, decouverte naturelle
Sitemap du site Les URL declarees dans le sitemap.xml Verifier que le sitemap est propre
Fichier de URL Une liste d’adresses que tu fournis Auditer une selection precise de pages

Balayez le tableau sur mobile.

En complement, tu choisis d’auditer la version desktop ou mobile du site, tu actives ou non le rendu JavaScript, et tu peux inclure ou exclure des chemins precis. Ce cadrage evite que le robot ne se perde dans des sections sans valeur SEO. Sur un site propre, la source Website suffit ; sur un site complexe, croiser Website et sitemap revele souvent des ecarts revelateurs.

Le rapport Crawled Pages

Une fois le crawl termine, le rapport Crawled Pages liste toutes les URL que le robot a parcourues. C’est ma section preferee pour un diagnostic rapide, parce qu’elle donne une vue page par page du statut de ton site : code de reponse, profondeur, nombre de liens entrants, problemes detectes.

Ce rapport repond a une question simple mais cruciale : le robot a-t-il vu ce que je pensais qu’il verrait ? Souvent, la surprise vient du nombre. Tu crois avoir 300 pages, le crawl en trouve 1 200 a cause de parametres d’URL, ou seulement 80 parce qu’une partie du site est orpheline. Dans les deux cas, le rapport Crawled Pages te met le nez sur la realite de ta structure.

Je conseille de trier ce rapport par profondeur et par nombre de liens entrants des le premier coup d’oeil. Les pages a forte profondeur avec peu de liens entrants sont tes candidates prioritaires a la reprise du maillage. C’est aussi la que tu detectes les pages fantomes que tu croyais supprimees et qui repondent encore en 200, ou les vieilles versions d’articles qui cannibalisent tes contenus recents.

La profondeur de crawl, un signal sous-estime

La profondeur de crawl, c’est le nombre de clics necessaires pour atteindre une page depuis la page d’accueil par le chemin le plus court. L’accueil est a une profondeur de 0, une page liee directement depuis l’accueil est a 1, et ainsi de suite. Plus une page est profonde, moins le robot la juge importante, et moins elle recoit de jus interne.

La bonne pratique que je recommande : garder tes pages importantes a une profondeur de 3 ou moins. Au-dela, tu envoies a Google le signal que ces pages sont secondaires, meme si elles sont strategiques pour ton business. Le rapport de Semrush te montre la profondeur de chaque page, ce qui te permet de reperer d’un coup d’oeil les contenus enterres trop loin dans l’arborescence.

0️⃣

Profondeur 0

La page d’accueil, le point de depart de tout le crawl.

1️⃣

Profondeur 1 a 3

La zone ideale pour tes pages importantes et rentables.

🛑

Profondeur 4+

Zone a risque : pages enterrees, peu de jus, mal crawlees.

Offre Semrush

Lancez votre premier crawl gratuitement

Testez le crawl Semrush sur votre propre site et voyez immédiatement les problèmes détectés.

Les pages orphelines, gouffre a budget de crawl

Une page orpheline est une page vers laquelle aucun lien interne ne pointe. Le robot ne peut pas la decouvrir en suivant les liens, ce qui la rend quasiment invisible pour les moteurs. Pire, si tu inclus ces pages orphelines dans ton sitemap.xml, les moteurs vont les crawler quand meme et gaspiller ton budget sur des contenus deconnectes du reste du site.

Le Site Audit identifie ces pages orphelines pour que tu puisses agir. La methode est simple : va dans l’onglet des problemes et cherche le terme orphan. Semrush affiche alors toutes les pages concernees. A toi ensuite de decider, page par page, quoi en faire.

  • Si la page a du contenu de valeur et amene du trafic, ajoute-lui des liens internes depuis des pages pertinentes.
  • Si la page repond a un besoin precis sans avoir besoin de maillage, laisse-la telle quelle.
  • Ne laisse pas trainer une page obsolete orpheline dans ton sitemap : supprime-la.
  • N’ignore pas les orphelines en pensant que Google les trouvera : sans lien, elles restent dans l’ombre.

Le rapport Crawlability

Le rapport Crawlability est le premier que je regarde apres un crawl, parce qu’il concentre les blocages les plus graves. Il te montre trois familles de problemes qui empechent le robot de faire son travail correctement.

Probleme de crawl Effet Correctif
Pages bloquees par robots.txt Le robot ne peut pas les lire Verifier et ajuster les regles robots.txt
Pages en 4xx / 5xx Le robot tombe sur des erreurs Corriger, rediriger ou supprimer les liens
Chaines de redirections Budget de crawl gaspille, lenteur Rediriger direct vers la cible finale

Balayez le tableau sur mobile.

Une chaine de trois redirections est une fuite de budget de crawl caracterisee. Chaque saut supplementaire coute au robot et ralentit l’utilisateur. Corriger ces chaines pour pointer directement vers la destination finale est l’un des gains les plus rapides que tu puisses obtenir sur la crawlabilite d’un site.

Je traite toujours ce rapport dans l’ordre de gravite : d’abord les pages bloquees par erreur qui devraient etre indexees, ensuite les erreurs serveur qui signalent un probleme technique, enfin les chaines de redirections. Cet ordre n’est pas anodin : une page bloquee par robots.txt est invisible immediatement, alors qu’une redirection en trop ne fait que ralentir. Attaquer d’abord ce qui rend du contenu totalement inaccessible, c’est recuperer du trafic le plus vite possible.

Optimiser concretement son budget de crawl

Optimiser son budget de crawl, ce n’est pas de la magie, c’est de la discipline. L’objectif est simple : faire en sorte que chaque passage du robot serve a explorer des pages qui comptent, pas du bruit. Voici les leviers que j’actionne dans l’ordre.

🧹

Nettoyer les 4xx

Supprimer ou rediriger les pages cassees qui font perdre du temps au robot.

🔗

Reparer les orphelines

Relier les pages de valeur, retirer les pages mortes du sitemap.

↪️

Casser les chaines

Transformer les redirections en cascade en redirections directes.

🧭

Aplatir l’arborescence

Remonter les pages strategiques a une profondeur de 3 ou moins.

🚫

Filtrer les parametres

Exclure les URL a parametres inutiles du crawl et de l’index.

🗺️

Nettoyer le sitemap

Ne declarer que des URL valides, indexables et canoniques.

Chacun de ces leviers, pris isolement, semble mineur. Mis bout a bout sur un site de plusieurs milliers de pages, ils redirigent le budget de crawl vers ce qui rapporte vraiment. C’est souvent la difference entre un contenu publie mais jamais indexe et un contenu qui remonte dans les resultats en quelques jours.

Crawl Semrush face au crawl de Google

Une confusion frequente chez les debutants : penser que le crawl de Semrush et celui de Google sont identiques. Ils partagent la meme logique d’exploration, mais ils ne servent pas le meme but. Voici comment je les distingue.

Crawl Semrush
  • Sert a diagnostiquer la sante technique de ton site
  • Tu controles la limite, la source et la frequence
  • Genere un rapport pedagogique et priorise les correctifs
  • Simule le comportement de Googlebot pour t’alerter
  • Ideal pour anticiper et corriger avant Google
Crawl Google
  • Sert a indexer et classer les pages du web
  • Google decide seul du budget qu’il t’alloue
  • Aucun rapport detaille, juste des donnees dans la Search Console
  • Impacte directement ta visibilite reelle
  • Tu le subis, tu ne le pilotes pas directement

La logique est donc de se servir du crawl de Semrush comme d’un miroir : il te montre ce que Google est susceptible de voir et de penaliser, pour que tu corriges avant que ca ne coute des positions. Un site propre pour Semrush a toutes les chances d’etre propre pour Google.

Crawl et rendu JavaScript, le piege des sites modernes

De plus en plus de sites reposent sur du JavaScript pour afficher leur contenu : frameworks React, Vue, Angular, contenus charges dynamiquement apres l’affichage initial. Le probleme, c’est qu’un crawl classique lit le code HTML brut renvoye par le serveur, avant que le JavaScript ne s’execute. Si ton contenu principal apparait uniquement apres ce rendu, le robot risque de voir une page vide.

Semrush propose, sur ses plans superieurs, un crawl avec rendu JavaScript qui execute le code comme le ferait un navigateur avant d’analyser la page. C’est indispensable pour auditer correctement une application web moderne. Le rapport dedie te montre l’ecart entre ce que voit le robot avec et sans rendu JavaScript, ce qui revele immediatement les contenus qui dependent trop du client pour etre correctement indexes.

Mon conseil : si ton site est en HTML classique ou en WordPress standard, tu n’as pas besoin d’activer ce rendu, il ralentirait le crawl sans rien apporter. Mais si tu constates que des pages riches en contenu remontent comme quasi vides dans le rapport, active le rendu JavaScript et compare : l’ecart t’indiquera exactement ce que Google peine a voir.

C’est un piege particulierement sournois parce qu’il est totalement invisible a l’oeil nu : tu ouvres la page dans ton navigateur, tout s’affiche parfaitement, et tu conclus a tort que tout va bien. Or ton navigateur execute le JavaScript, contrairement a un crawler basique. Seul un crawl avec rendu revele le fosse entre ce que voit un humain et ce que recupere reellement un moteur au premier passage.

Profiter de l'essai gratuit de 7 jours Semrush

Crawl technique et sante des backlinks

Un crawl impeccable resout la moitie de l’equation SEO : la partie on-site. Mais un site techniquement parfait peut quand meme souffrir si son profil de liens est pollue. Le robot qui crawle tes pages ne juge pas la qualite des sites qui pointent vers toi, c’est un travail distinct.

C’est la que le Toxic Score entre en jeu : il evalue le risque que representent tes domaines referents. Je detaille toute la methode de detection et de nettoyage dans mon guide du Toxic Score Semrush. Un audit complet croise toujours la crawlabilite on-site et la sante du netlinking, jamais l’un sans l’autre.

Combien de pages crawler selon la taille du site

La question que tout le monde se pose au demarrage : quelle limite de pages regler ? La reponse depend de la taille reelle de ton site, pas de ton envie. Regler une limite trop basse revient a auditer une fraction de ton domaine sans le savoir ; la regler trop haut sur un petit plan consomme des credits pour rien. Voici les reperes que j’utilise.

Type de site Nombre de pages estime Limite de crawl a regler
Site vitrine, petit blog Moins de 100 100 (le crawl par defaut suffit)
Blog etabli, PME 100 a 1 000 1 000 a 2 000 avec marge
Media, gros blog 1 000 a 20 000 Ajuster au nombre reel + 20 %
E-commerce, marketplace 20 000 a 100 000 Selon le plan, jusqu’a 100 000

Balayez le tableau sur mobile.

La marge de 20 % que j’ajoute systematiquement sert a capter les URL que tu n’attendais pas : parametres, pagination, versions dupliquees. Si le crawl atteint sa limite exactement, c’est mauvais signe : il reste probablement des pages non explorees, et donc des problemes invisibles. Une limite jamais atteinte, au contraire, te garantit une vue complete de ta structure.

Bien preparer son crawl avant de le lancer

Un crawl reussi commence avant meme de cliquer sur le bouton. Prendre cinq minutes pour cadrer la configuration t’evite de relancer trois fois un crawl mal parametre et de bruler tes credits. Voici la checklist que je passe en revue avant chaque premier crawl d’un nouveau site.

  • Verifier que le domaine saisi est le bon : avec ou sans www, en http ou https selon la version canonique.
  • Choisir la bonne source de crawl : Website pour un audit standard, sitemap pour verifier ce qui est declare.
  • Regler la limite de pages selon la taille reelle du site, avec une marge de securite.
  • Selectionner la version mobile si ton audience est majoritairement sur telephone.
  • Ne pas lancer un crawl JavaScript sur un gros site sans en avoir besoin : c’est lent et couteux en credits.
  • Ne pas oublier d’exclure les sous-domaines ou chemins de test qui pollueraient le rapport.

Ce cadrage prend cinq minutes et t’en fait gagner trente. Un crawl bien configure du premier coup, c’est un rapport exploitable immediatement, sans avoir a demeler les faux positifs generes par une mauvaise portee ou une source de crawl inadaptee.

Les erreurs de crawl que je vois le plus souvent

A force d’auditer des sites, certains problemes de crawl reviennent en boucle. Les connaitre a l’avance te fait gagner un temps precieux, parce que tu sais ou regarder en premier des que le rapport tombe. Voici mon top des pieges recurrents.

Erreur frequente Symptome dans le rapport Ce que ca coute
robots.txt trop restrictif Sections entieres non crawlees Des pages entieres invisibles
noindex oublie apres migration Pages en noindex non voulu Chute de trafic organique
Pagination mal geree Milliers de pages dupliquees Budget de crawl gaspille
Sitemap non a jour URL en 404 dans le sitemap Signal de negligence a Google

Balayez le tableau sur mobile.

Le point commun de ces erreurs, c’est qu’elles passent inapercues sans un crawl regulier. Personne ne remarque un noindex ajoute par erreur avant que le trafic ne s’effondre. C’est exactement pour ca que je considere le crawl non pas comme un audit ponctuel, mais comme un capteur d’alerte a laisser tourner en permanence.

Programmer des crawls reguliers

Le crawl n’est pas une operation ponctuelle. La sante technique se degrade avec le temps : une mise a jour de plugin casse ton robots.txt, un nouveau developpeur passe par erreur la moitie de ton blog en noindex, un changement de theme casse le maillage. Sans surveillance, tu decouvres le probleme des semaines plus tard, quand le trafic a deja chute.

La parade tient en un reglage : programme un recrawl automatique, quotidien ou hebdomadaire selon l’activite du site. Tu obtiens une ligne de base historique qui te permet de reperer immediatement toute regression. Detecter une anomalie en 24 heures plutot qu’en trois semaines, c’est exactement ce qui separe un site surveille d’un site laisse a l’abandon.

Semrush garde l’historique de tes crawls, ce qui te permet de comparer deux dates et de voir l’evolution du nombre de pages, du score de sante et des erreurs. Cette courbe dans le temps vaut de l’or : elle transforme une photo instantanee en un film ou tu vois si ton site s’ameliore ou se degrade, crawl apres crawl.

💡Mon verdict

Le crawl est la fondation de tout audit technique : sans une exploration bien configuree, ton rapport Semrush est incomplet et tes conclusions faussees. Regle la limite de pages selon ta taille reelle, surveille la profondeur et les pages orphelines, et traque les fuites de budget de crawl que sont les 4xx et les chaines de redirections. C’est un travail invisible pour le visiteur mais decisif pour Google. La plupart des sites qui stagnent en referencement ne souffrent pas d’un manque de contenu, mais d’un contenu que les moteurs peinent a explorer correctement. Regler le crawl, c’est souvent debloquer un potentiel deja present mais mal exploite.

Mon conseil pour démarrer : lance un premier crawl en source Website, compare le nombre de pages trouvees a ce que tu attendais, puis attaque le rapport Crawlability avant tout le reste.

Lucas Fonseque consultant SEO Toulouse
Un crawl a analyser ?

Je peux auditer le crawl de ton site

Tu veux savoir ou fuit ton budget de crawl et pourquoi certaines pages ne s’indexent pas ? Ecris-moi a lucas@lucasfonseque.fr et on regarde ta structure ensemble.

📅 Contacter Lucas

Questions fréquentes

Combien de pages Semrush crawle-t-il par defaut ?

+

Par defaut, le Site Audit crawle 100 pages. C’est suffisant pour un petit site vitrine, mais sur un site de plusieurs milliers de pages, ce simple echantillon peut rater tes pires problemes techniques, car ils se cachent souvent dans les sections que le crawl par defaut n’atteint pas.

Selon ton plan, tu peux monter la limite jusqu’a 100 000 pages par projet. Regle toujours cette limite en fonction de la taille reelle de ton site, sinon tu audites une fraction seulement de ton domaine sans t’en rendre compte.

Qu’est-ce que le budget de crawl ?

+

Le budget de crawl est le nombre de pages qu’un moteur comme Google accepte d’explorer sur ton site pendant une periode donnee. Ce budget n’est pas infini : si le robot le gaspille sur des pages inutiles, il en reste moins pour tes pages importantes.

Le Site Audit de Semrush te montre precisement ou ce budget fuit : pages cassees, chaines de redirections, orphelines dans le sitemap, parametres d’URL. Corriger ces fuites, c’est rediriger le crawl vers ce qui compte vraiment.

Qu’est-ce qu’une page orpheline ?

+

Une page orpheline est une page vers laquelle aucun lien interne ne pointe. Le robot ne peut pas la decouvrir en suivant les liens, ce qui la rend quasiment invisible pour les moteurs de recherche.

Le Site Audit les identifie dans l’onglet des problemes en cherchant le terme orphan. Ensuite, tu relies les pages de valeur avec des liens internes et tu retires du sitemap les pages obsoletes qui gaspillent inutilement le budget de crawl.

Quelle est la profondeur de crawl ideale ?

+

La profondeur de crawl est le nombre de clics necessaires pour atteindre une page depuis l’accueil par le chemin le plus court. L’accueil est a 0, une page liee directement depuis l’accueil est a 1.

Pour tes contenus importants, vise une profondeur de 3 ou moins. Au-dela, tu signales a Google que ces pages sont secondaires et elles recoivent moins de jus interne, meme si elles sont strategiques pour ton activite.

Faut-il crawler la version desktop ou mobile ?

+

Semrush te laisse choisir. Depuis que Google indexe en mobile-first, la version mobile est souvent la plus pertinente a auditer, car c’est celle que Google evalue en priorite pour le classement.

Si ton site a des differences notables entre desktop et mobile, contenu masque, navigation differente, il peut etre utile de crawler les deux versions pour comparer et reperer les ecarts qui pourraient nuire au SEO mobile.

Le crawl de Semrush est-il le meme que celui de Google ?

+

Ils partagent la meme logique d’exploration en suivant les liens, mais ils ne servent pas le meme but. Le crawl de Semrush sert a diagnostiquer et corriger, celui de Google a indexer et classer.

L’interet est d’utiliser le crawl de Semrush comme un miroir de ce que Google est susceptible de voir, pour corriger les problemes avant qu’ils ne coutent des positions. Un site propre pour Semrush a toutes les chances de l’etre pour Google.

Comment reduire les chaines de redirections ?

+

Une chaine de redirections se produit quand une URL redirige vers une autre, qui redirige vers une troisieme, et ainsi de suite. Chaque saut coute du budget de crawl et ralentit l’utilisateur.

Le rapport Crawlability de Semrush liste ces chaines. Le correctif consiste a modifier la premiere redirection pour qu’elle pointe directement vers la destination finale, en supprimant les etapes intermediaires.

Le compte gratuit permet-il de crawler ?

+

Oui, le compte gratuit Semrush autorise le crawl de 100 URL. C’est parfait pour comprendre la mecanique du crawl sur un petit site ou pour tester l’outil avant de t’engager sur un abonnement.

Pour un site plus volumineux, activer le rendu JavaScript ou programmer des recrawls automatiques, il faut passer a un plan payant. Mais pour decouvrir le fonctionnement, le gratuit fait tres bien le travail.

A quelle frequence recrawler son site ?

+

Pour un site actif, je recommande un recrawl automatique hebdomadaire. Ca cree une ligne de base historique et te permet de reperer immediatement une regression apres un deploiement ou une mise a jour.

La sante technique se degrade avec le temps : un plugin qui casse le robots.txt, un noindex ajoute par erreur. Le recrawl regulier transforme le crawl d’un controle ponctuel en une veritable surveillance continue.

Pourquoi Semrush trouve-t-il plus de pages que prevu ?

+

Le cas le plus frequent, ce sont les parametres d’URL : filtres, tris et sessions multiplient les adresses pour un meme contenu. Une seule fiche produit peut exister sous des dizaines de URL differentes, ce qui gonfle le nombre de pages crawlees.

La solution est de supprimer les parametres d’URL connus dans la configuration du crawl et d’exclure les chemins sans valeur SEO. Le nombre de pages crawlees redevient alors coherent avec la structure reelle de ton site.

Faut-il activer le rendu JavaScript pour crawler ?

+

Uniquement si ton site affiche son contenu principal via du JavaScript, comme les applications en React, Vue ou Angular. Dans ce cas, un crawl sans rendu risque de voir des pages vides et de generer de faux problemes de contenu manquant.

Pour un site WordPress classique ou en HTML statique, inutile d’activer ce rendu : il ralentit le crawl et consomme plus de credits sans rien apporter. Active-le seulement si tes pages riches remontent anormalement vides dans le rapport Crawled Pages.

A lire aussi sur le blog

llm.txt le fichier seo pour le GEO
SEOCannibalisation SEO : comment la détecter et la corriger en 2026
Combien coute etre 1er Google
SEOComment utiliser les rapports IA de Google Search Console : le guide complet
Cocon sémantique vs cluster thématique stratégie SEO 2026
SEOSémantique visuelle SEO : comment optimiser le layout de votre site pour Google

Retrouvez-moi sur les réseaux

Je partage mes expérimentations SEO, netlinking et IA au quotidien.