Quand on gère un site internet composé de plusieurs dizaines de pages, la première difficulté n’est pas de créer du contenu, mais de savoir précisément ce qui existe déjà. Une page publiée il y a deux ans, un ancien formulaire de contact devenu obsolète, une landing page oubliée qui charge encore un pixel de tracking sans bandeau de consentement : ces angles morts posent des problèmes concrets, du SEO à la conformité CNIL.
Dresser la liste complète des pages disponibles sur un site web est un préalable opérationnel, pas un exercice théorique.
Traceurs et conformité CNIL : le vrai motif pour inventorier chaque page
On pense souvent qu’un inventaire de pages sert uniquement au référencement. Sur le terrain, la raison la plus pressante est ailleurs. La CNIL rappelle que l’obligation de consentement concerne non seulement les cookies, mais aussi les pixels, le stockage local, le fingerprinting et les identifiants publicitaires. Chaque URL active sur un site peut charger des scripts différents.
Une page produit créée en 2022 intègre peut-être un outil d’audience configuré avant la mise à jour de votre CMP (plateforme de gestion du consentement). Si personne ne l’a vérifiée depuis, cette page peut déposer des traceurs sans consentement valide. Le bandeau conforme affiché sur la page d’accueil ne couvre pas automatiquement toutes les URL du domaine.
Concrètement, un audit page par page doit vérifier les technologies chargées avant et après consentement, et pas seulement recenser les URL découvertes. La CNIL recommande notamment des captures horodatées de chaque version du bandeau et un historique de configuration conservé par la CMP. Autrement dit, une liste de pages utile comporte une date d’exploration et un état de conformité.
En parcourant la liste des pages de Bla Bla Bla, on voit bien comment un sitemap structuré facilite ce type de vérification : chaque URL est identifiable, et on repère vite les sections qui nécessitent un contrôle spécifique.
Sitemap XML et crawl interne : deux approches complémentaires pour lister les pages d’un site

Le fichier sitemap.xml est le point de départ évident. On le trouve en ajoutant /sitemap.xml à la racine du domaine. Il liste les URL que l’administrateur du site souhaite rendre visibles aux moteurs de recherche. Le problème, c’est qu’il ne contient que ce qu’on a bien voulu y mettre.
Les pages orphelines (celles qui ne reçoivent aucun lien interne) n’apparaissent ni dans le sitemap ni dans la navigation. Un crawl interne avec un outil dédié parcourt le site comme le ferait un robot de moteur de recherche, en suivant chaque lien. C’est la seule méthode pour découvrir des URL oubliées.
Ce que le sitemap ne montre pas
- Les pages en noindex qui restent accessibles via leur URL directe, mais que le sitemap exclut par convention
- Les anciennes URL redirigées (301/302) dont la destination a changé ou qui pointent vers une page supprimée
- Les pages générées dynamiquement par des filtres ou des paramètres d’URL, souvent absentes du sitemap mais indexées par Google
Combiner sitemap et crawl couvre la quasi-totalité des URL actives. On recommande de lancer un crawl complet au moins une fois par trimestre sur un site de taille moyenne, et de comparer les résultats avec le sitemap déclaré.
Opérateur site: sur Google et Search Console pour vérifier l’indexation
Une fois la liste interne établie, on la confronte à ce que Google connaît réellement. La commande site:mondomaine.fr dans la barre de recherche affiche les pages indexées. Cette méthode a ses limites : Google ne retourne pas toujours la totalité des URL indexées, surtout sur les gros sites.
La Search Console offre un rapport d’indexation plus fiable. On y distingue les pages indexées, celles exclues volontairement (noindex, canonique pointant ailleurs) et celles refusées par Google pour des raisons techniques. L’écart entre les URL soumises et les URL indexées révèle les problèmes : contenu dupliqué, erreurs serveur, temps de chargement excessif.
Paramètres d’URL et pages fantômes
Les paramètres d’URL (tri, filtres, identifiants de session) génèrent parfois des centaines de variantes d’une même page. Google peut les indexer séparément, ce qui dilue l’autorité du domaine. En Search Console, la section « Paramètres d’URL » permet de signaler ceux que Google doit ignorer.
Les retours varient sur ce point : certains sites constatent une amélioration rapide du crawl budget après nettoyage des paramètres, d’autres ne voient pas de changement notable. L’impact dépend du volume de pages concernées et de la fréquence de crawl du site.

Classer les pages par niveau de dépendance aux outils soumis au consentement
Toutes les pages d’un site ne présentent pas le même risque en matière de conformité. Une page institutionnelle statique sans outil analytique ne pose aucun problème. Une page de conversion qui charge un pixel de remarketing, un outil de heatmap et un tag manager en est à l’opposé.
Un classement opérationnel consiste à trier les URL en trois catégories :
- Pages sans traceur soumis au consentement (mentions légales, pages statiques, certaines pages de blog)
- Pages avec outils d’audience exemptés sous conditions (mesure d’audience strictement anonymisée, selon les lignes directrices CNIL)
- Pages chargeant des traceurs publicitaires ou des outils tiers nécessitant un consentement explicite avant dépôt
Ce tri identifie immédiatement les pages prioritaires pour un audit de conformité. On commence par la troisième catégorie, où le risque de sanction est le plus élevé.
La preuve de conformité ne se limite pas à un bandeau visible. Elle implique que le refus soit aussi simple que l’acceptation, et que le retrait du consentement reste possible à tout moment. Chaque page de la liste doit être vérifiable sur ces trois critères.
Dresser l’inventaire complet d’un site n’est pas une tâche ponctuelle. Les pages évoluent, les scripts changent, les CMP se mettent à jour. Un sitemap à jour, un crawl régulier et un suivi de conformité par URL forment le socle d’un site maîtrisé, autant pour le référencement que pour le respect des obligations légales.



