Rendre votre site lisible par la recherche IA
Une checklist pour être trouvé et cité par Google, ChatGPT, Claude et Perplexity : accès des robots, indexation, contenu orienté réponses et données structurées.

Ce que la recherche IA lit vraiment
Les assistants qui répondent en citant leurs sources, comme la recherche de ChatGPT, Claude, Perplexity et les fonctions IA de Google, dépendent toujours du web ouvert. Ils récupèrent des pages, déterminent le sujet de chacune et citent ou mettent en lien celles qui répondent le plus clairement.
La visibilité dans l’IA est donc avant tout une question technique et éditoriale, pas une nouvelle astuce. Si un robot ne peut pas atteindre une page, ne sait pas quelle URL est la bonne ou ne trouve pas de réponse directe dans le texte, la page a peu de chances d’être citée, aussi bonne que soit l’entreprise derrière.
Voici la checklist que nous utilisons pour notre propre site. Rien ici ne garantit un classement ou une citation ; elle supprime les raisons pour lesquelles une page serait ignorée.
1. Laisser entrer les bons robots
Commencez par le robots.txt. Beaucoup de sites bloquent les robots d’IA par accident : une règle générale copiée d’un modèle, un réglage de préproduction passé en production ou une extension de sécurité.
Chaque robot a un rôle différent, alors décidez en connaissance de cause :
- Les robots de recherche et de réponse, comme OAI-SearchBot, Claude-SearchBot et PerplexityBot, récupèrent les pages pour les afficher et les citer dans les réponses.
- Les agents déclenchés par l’utilisateur, comme ChatGPT-User et Claude-User, récupèrent une page quand quelqu’un pose une question à son sujet.
- Les robots d’entraînement, comme GPTBot et ClaudeBot, collectent du contenu pour entraîner des modèles. Google-Extended détermine si Google peut utiliser le contenu pour Gemini ; il n’a aucun effet sur la recherche Google.
Bloquer l’entraînement tout en autorisant la recherche est un choix légitime. Tout bloquer et espérer être cité ne l’est pas.
2. Rendre chaque page indexable et sans ambiguïté
Un robot peut atteindre une page et recevoir pourtant l’instruction de l’ignorer. Vérifiez la présence de noindex dans la balise meta robots et dans l’en-tête X-Robots-Tag ; les deux sont faciles à oublier après un lancement.
Chaque page doit déclarer une seule URL canonique. Sur un site multilingue, les liens hreflang indiquent quelle version linguistique afficher, et une entrée x-default couvre tous les autres. Le sitemap XML ne doit contenir que des URL canoniques et indexables qui renvoient HTTP 200.
3. Écrire des réponses, pas des slogans
Les réponses des IA sont construites à partir de passages. Un passage est utile lorsqu’il répond seul à une question précise, sans que le lecteur ait besoin du reste de la page.
- Utilisez des titres qui reprennent les questions que les gens posent.
- Donnez la réponse directe dans les une ou deux premières phrases de chaque section, puis ajoutez les détails.
- Soyez précis : nommez les livrables, les étapes, les limites et ce qui n’est pas inclus.
- Gardez des affirmations vérifiables. Les superlatifs vagues sont rarement cités ; les énoncés concrets, si.
C’est aussi, tout simplement, une bonne écriture pour les humains, et c’est bien le propos : la même clarté sert les deux publics.
4. Ajouter des données structurées fidèles à la page
Les données structurées (JSON-LD avec les types schema.org) décrivent les faits d’une page sous une forme que les machines lisent sans deviner : qu’il s’agit d’une Organisation, d’un Service, d’un Article avec une date de publication ou d’une liste de questions-réponses.
Ne balisez que ce qui est visible sur la page et gardez-le exact. Des données structurées qui contredisent le contenu sont pires qu’aucune.
5. Envisager un fichier llms.txt
llms.txt est un court fichier Markdown placé à la racine d’un site, qui résume l’activité de l’organisation et renvoie vers ses pages les plus importantes. C’est une convention émergente, pas une norme, et aucun assistant n’est tenu de le lire.
Il coûte peu à maintenir et offre un résumé clair et lisible à tout outil qui le consulte. Voyez-le comme un index utile, pas comme un levier de classement.
6. Vérifier chaque semaine
La visibilité technique se dégrade sans bruit. Un déploiement modifie un réglage, un modèle perd la balise canonique, une nouvelle page part sans description. Personne ne le remarque avant la baisse du trafic.
Pour notre propre site, un audit automatique hebdomadaire vérifie l’accès des robots, le sitemap, llms.txt, les codes de statut, les temps de réponse, les titres, les descriptions, noindex, les balises canoniques et hreflang, les intertitres et les données structurées, puis envoie un rapport noté par e-mail. L’objectif est de repérer les régressions en quelques jours plutôt qu’en quelques mois.
7. Garder des pages rapides et lisibles sans JavaScript
De nombreux robots, dont plusieurs robots d’IA, lisent le HTML envoyé par le serveur et n’exécutent pas JavaScript de façon fiable. Si votre texte principal, vos titres ou vos liens n’apparaissent qu’après le chargement des scripts, certains systèmes verront une page vide.
Servez le contenu important dans le HTML initial, gardez des pages rapides et ne cachez pas les réponses derrière des onglets, des fenêtres surgissantes ou un défilement infini. Une page qui se charge vite et se lit bien sans scripts est plus facile à traiter pour tous les robots.
8. Rester cohérent sur qui vous êtes
Les systèmes d’IA cherchent à savoir à quelle organisation appartient une page et si elle constitue une source crédible sur le sujet. Facilitez-leur la tâche :
- Utilisez le même nom d’entreprise, la même description et les mêmes coordonnées sur tout le site.
- Tenez une page À propos claire qui dit ce que vous faites, pour qui, et ce que vous ne faites pas.
- Ajoutez des données structurées Organization avec votre nom, votre site et votre logo.
- Vérifiez que les profils externes que vous gérez vous décrivent de la même façon.
Des descriptions incohérentes compliquent le rattachement de vos pages à votre organisation, pour n’importe quel système.
Mesurer la visibilité dans l’IA
Il n’existe pas encore de tableau de bord unique pour les citations par l’IA ; combinez donc plusieurs signaux :
- Google Search Console et Bing Webmaster Tools montrent les problèmes d’indexation et les impressions de recherche page par page.
- Le trafic de référence des assistants IA, comme les visites depuis chatgpt.com ou perplexity.ai, apparaît dans la plupart des outils d’analyse.
- Une liste fixe de questions posée chaque mois aux principaux assistants montre si et comment vous êtes mentionné. Les réponses varient d’une fois à l’autre : regardez les tendances, pas les résultats isolés.
Notez ce que vous changez et quand, afin de relier les progrès au travail qui les a produits.
Les erreurs fréquentes à vérifier d’abord
- Une balise noindex ou une règle Disallow restée d’un site de préproduction.
- Un réglage de CDN ou de sécurité qui bloque les robots d’IA alors que robots.txt les autorise. Certains services le proposent désormais, et certains l’activent par défaut.
- Des versions linguistiques d’une même page sans hreflang, qui se concurrencent.
- Des réponses importantes disponibles uniquement dans des images, des PDF ou des scripts.
- Des méta-descriptions écrites comme des slogans plutôt que comme un résumé de la page.
Chacune se corrige vite une fois repérée. Le plus difficile est de les remarquer : c’est pourquoi une vérification régulière compte plus qu’un audit ponctuel.
Un plan sur 30 jours
Si vous partez de zéro, cet ordre traite d’abord les corrections les plus importantes :
- Semaine 1 : vérifiez robots.txt, les réglages CDN et sécurité, les balises noindex, les URL canoniques et le sitemap. Corrigez tout ce qui bloque ou trompe les robots.
- Semaine 2 : listez les dix questions que vos clients posent le plus et vérifiez que votre site répond clairement à chacune sur une page précise.
- Semaine 3 : réécrivez ou créez les pages qui y répondent, avec des réponses directes dès les premières lignes, et ajoutez des données structurées exactes.
- Semaine 4 : configurez Search Console et Bing Webmaster Tools, enregistrez un point de départ des réponses IA pour votre liste de questions et planifiez une vérification technique hebdomadaire.
Après le premier mois, le travail devient une routine : continuer à bien répondre aux nouvelles questions et empêcher les bases techniques de se dégrader.
Questions fréquentes
Le GEO est-il différent du SEO ? C’est en grande partie la même base, avec davantage d’accent sur des réponses claires et citables et sur l’accès des robots d’IA. Un site facile à comprendre pour les moteurs de recherche l’est généralement aussi pour les assistants IA.
Faut-il bloquer les robots d’entraînement ? C’est une décision d’entreprise. Les bloquer n’arrête pas les robots de recherche et de réponse, tant que vous les autorisez séparément.
llms.txt améliore-t-il le classement ? Rien ne le prouve. C’est un résumé peu coûteux que certains outils peuvent lire.
Quand verrons-nous des résultats ? Les corrections techniques prennent effet à mesure que les pages sont à nouveau explorées, ce qui peut prendre de quelques jours à quelques semaines. Être cité plus souvent dépend de la qualité du contenu et de la concurrence, et n’est jamais garanti.
Ce que cela ne fait pas
Un site techniquement propre est la base, pas le résultat. Qu’une page soit citée dépend toujours du fait qu’elle soit la réponse la plus utile à la question posée. C’est un travail éditorial : comprendre ce que votre public demande et y répondre mieux que quiconque.
Pour faire examiner votre site selon cette checklist, découvrez notre service SEO et visibilité dans la recherche IA.
Lectures associées
Un enregistrement, de nombreux contenus utiles