---
title: "robots.txt & sitemap.xml : le guide SEO complet | Piskee"
description: "Rôles distincts du robots.txt (exploration) et du sitemap.xml (découverte), pièges du blocage, sitemap propre, erreurs qui rendent un site invisible."
url: https://www.piskee.com/seo-technique/robots-txt-sitemap/
site: Piskee
language: fr-FR
content_type: text/markdown
---

Robots & Sitemap

# robots.txt & sitemap.xml : piloter le crawl

Deux petits fichiers texte, deux rôles opposés : l’un dit à Google où ne pas aller, l’autre où aller. Les confondre est l’une des erreurs SEO les plus coûteuses.

- Difficulté Fondamental
- Impact SEO Élevé
- Lecture 7 min
- À jour 15 juillet 2026

À retenir

- robots.txt contrôle l’exploration ; le sitemap.xml aide à la découverte. Deux rôles distincts.
- Bloquer une URL au crawl ne la désindexe pas : c’est noindex qui gère l’indexation.
- Le sitemap ne doit contenir que des URLs canoniques, indexables et en 200.
- Une erreur dans le robots.txt peut rendre un site entier invisible.

## Deux fichiers, deux rôles opposés

La confusion est reine ici, alors posons-la clairement. Le **robots.txt** dit à Google *où il n’a pas le droit d’aller explorer*. Le **sitemap.xml** lui propose *la liste des URLs à découvrir*. L’un restreint, l’autre invite. Aucun des deux ne « désindexe » ni ne « force » quoi que ce soit : ce sont des panneaux de signalisation, pas des ordres d’indexation.

## robots.txt : contrôler l’exploration

Placé à la racine, il indique aux robots les chemins à ne pas explorer (`Disallow`) et ceux autorisés (`Allow`). On y bloque typiquement les zones sans intérêt SEO : panier, compte, recherche interne, certains paramètres. Il peut aussi référencer le sitemap. Sa syntaxe est simple, mais une erreur — un `Disallow: /` oublié — bloque tout le site.

**L’erreur fatale :** un `Disallow: /` hérité d’une préproduction qui passe en production. Le site entier devient inexplorable. À vérifier systématiquement après chaque mise en ligne.

## Le piège : bloquer n’est pas désindexer

Erreur la plus répandue : croire qu’un `Disallow` retire une page de Google. En réalité, une URL bloquée au crawl mais **déjà connue** (via des liens) peut rester indexée, affichée sans description. Pire : comme Google ne peut plus l’explorer, il ne peut pas lire un éventuel `noindex`. Pour [désindexer](https://www.piskee.com/seo-technique/indexation-google/), il faut laisser Google explorer la page et y trouver un `noindex` — l’inverse d’un blocage.

## sitemap.xml : guider la découverte

Le sitemap liste les URLs que vous voulez faire connaître à Google. Il est particulièrement utile sur les grands sites, les pages peu [maillées](https://www.piskee.com/guides/maillage-interne/) ou récemment publiées. Il n’impose pas l’indexation : il accélère la **découverte**. Google décide ensuite, selon la qualité de chaque page.

## Un sitemap propre, sinon rien

Un bon sitemap ne contient que des URLs :

- **Canoniques** — jamais de variantes ni de non-canoniques.
- **Indexables** — pas de pages en `noindex`.
- En **200** — ni redirections, ni 404.
- À jour — la fraîcheur du sitemap est un signal en soi.

Un sitemap rempli d’URLs incohérentes envoie des signaux contradictoires et perd son intérêt. La cohérence entre sitemap, [canonicals](https://www.piskee.com/seo-technique/url-canonique-contenu-duplique/) et [redirections](https://www.piskee.com/seo-technique/redirections-301/) est un marqueur de rigueur technique.

## En résumé

Retenez la ligne de partage : **robots.txt = exploration, sitemap = découverte, noindex = indexation**. Trois leviers distincts, à ne jamais confondre. Bien réglés et cohérents entre eux, ils orientent efficacement le [crawl](https://www.piskee.com/seo-technique/budget-crawl/) vers les pages qui comptent.

Sur cette page

À explorer ensuite

## Crawl & indexation

[Crawl budget Budget de crawl Concentrer l’exploration de Google sur vos pages qui comptent.](https://www.piskee.com/seo-technique/budget-crawl/)

[Indexation Indexation Google Pourquoi vos pages ne sont pas indexées — et comment y remédier.](https://www.piskee.com/seo-technique/indexation-google/)

[Logs Analyse de logs Lire les logs serveur pour voir le SEO par les yeux de Googlebot.](https://www.piskee.com/seo-technique/analyse-logs-seo/)

![Louis-Alexandre Tachon](https://www.piskee.com/images/migrated/67581d9dec18771442ab449a_louis-alexandre-1--4c6f6f.webp)

Écrit par

[Louis-Alexandre Tachon](https://www.piskee.com/author/louis-alexandre-tachon/)

Fondateur de Piskee

[LinkedIn](https://www.linkedin.com/in/louis-alexandre-tachon/)

[X](https://x.com/louis_alexandre)

FAQ

## Questions fréquentes

### Bloquer une page dans robots.txt la désindexe-t-elle ?

Non, et c’est un piège fréquent. Le robots.txt empêche l’exploration, mais une URL déjà connue (via des liens) peut rester indexée sans son contenu. Pour empêcher l’indexation, il faut une balise noindex — or Google doit pouvoir explorer la page pour la lire. Bloquer au robots.txt et vouloir désindexer sont donc contradictoires.

### Quelles URLs mettre dans le sitemap ?

Uniquement des URLs canoniques, indexables, renvoyant un code 200. On exclut les pages en noindex, les redirections, les 404, les non-canoniques et les paramètres. Un sitemap propre est un signal de qualité ; un sitemap plein d’URLs incohérentes brouille la découverte.

### Le sitemap garantit-il l’indexation ?

Non. Le sitemap aide Google à découvrir les URLs, surtout sur les grands sites ou les pages peu maillées. Mais il ne force pas l’indexation : Google décide toujours selon la valeur et la qualité de chaque page. Le sitemap accélère la découverte, il ne remplace pas la qualité.

### Faut-il un sitemap si le site est petit ?

Un petit site bien maillé est découvert sans sitemap. Il reste néanmoins utile : il liste explicitement les URLs à connaître, signale les mises à jour et facilite le suivi dans la Search Console. Le coût est nul, l’intérêt réel dès que le site grandit.

Sources officielles

- [Google — Exploration & indexation](https://developers.google.com/search/docs/crawling-indexing)  — Crawl, redirections, robots, sitemaps
- [Google — robots.txt](https://developers.google.com/search/docs/crawling-indexing/robots/intro)  — Spécification et bonnes pratiques
- [sitemaps.org](https://www.sitemaps.org)  — Spécification officielle des sitemaps

## Un doute sur votre robots.txt ?

On audite votre robots.txt et vos sitemaps : cohérence, blocages accidentels, URLs incohérentes et signaux de découverte.

[Auditer mes fichiers techniques](https://www.piskee.com/contact)
