01
Politique d'accès des crawlers IA, sur les deux couches
Couche fichier. Audit et réécriture complète du robots.txt, agent par agent, avec une décision explicite pour chacun : GPTBot, OAI-SearchBot et ChatGPT-User, ClaudeBot et le crawler de recherche d'Anthropic, PerplexityBot et Perplexity-User, Google-Extended, Applebot-Extended, Bytespider, Amazonbot, CCBot, Meta-ExternalAgent. Les principaux acteurs déclarent respecter le standard, ce qui rend ce fichier utile, à condition qu'il soit lu.
Couche réseau. Audit du pare-feu applicatif et des règles CDN, qui s'appliquent avant le fichier et priment sur lui. Vérification des règles de filtrage, des limites de débit, des protections anti-bot génériques et des paramètres par défaut qui ont pu changer sans notification.
L'arbitrage que nous vous aidons à poser. Entraînement, recherche en temps réel et agents autonomes ne se traitent pas de la même façon. Vous pouvez refuser de nourrir les modèles tout en autorisant la citation en temps réel. Encore faut-il que la distinction soit posée dans votre configuration, ce qui est rarement le cas.
Test réel, pas déclaratif
Nous interrogeons votre site en nous présentant comme chaque agent, depuis l'extérieur, et nous constatons le code de réponse obtenu. C'est la seule vérification qui vaut.
02
Disponibilité du contenu sans JavaScript
La majorité des crawlers de moteurs génératifs n'exécutent pas, ou exécutent mal, le JavaScript. Un contenu injecté côté client peut être parfaitement visible dans un navigateur et totalement absent pour le robot.
- Comparaison du HTML brut et du DOM rendu sur chacun de vos gabarits.
- Inventaire de ce qui disparaît sans exécution : texte, liens, titres, données structurées, contenus en onglets ou en accordéons.
- Recommandation d'architecture de rendu, gabarit par gabarit.
03
Découpage en passages et HTML sémantique
Les moteurs génératifs ne récupèrent pas des pages, ils récupèrent des fragments qu'ils recombinent. Un fragment qui perd son sens hors contexte ne sera pas retenu.
- Analyse du découpage réel de vos pages et correction des sections dépendantes de leur contexte.
- Hiérarchie de titres cohérente, sections autonomes, ancres nommées et adressables.
- Tableaux en HTML natif et non en images, listes structurées, définitions courtes.
- Blocs de synthèse extractibles placés dans le premier tiers.
- Nettoyage du bruit : bandeaux, encarts et éléments d'interface qui polluent les fragments extraits.
04
Graphe d'entité et données structurées
Avant de vous citer, un modèle doit savoir qui vous êtes et vous relier aux entités qu'il connaît déjà.
- Balisage
Organization complet, avec propriété sameAs pointant vers vos profils de référence.
- Balisage
Person pour vos auteurs, relié à leurs pages et profils.
- Types adaptés à vos contenus :
Article, FAQPage, Product, Dataset, HowTo, BreadcrumbList.
- Cohérence stricte entre le contenu visible et les données déclarées.
- Alignement de votre entité avec les bases de connaissance ouvertes, quand votre notoriété le permet.
- Uniformité de la dénomination, de la description d'activité et des chiffres sur l'ensemble de vos propriétés.
05
Fraîcheur et datation
La date est un critère de sélection des sources, et c'est l'un des plus faciles à corriger.
- Dates de publication et de dernière modification visibles et balisées.
- Cohérence entre la date affichée, la donnée structurée et l'attribut de mise à jour du sitemap.
- Politique de mise à jour des contenus stratégiques, avec traçabilité des révisions.
06
Accessibilité des actifs non HTML
- Documents PDF : structure du texte, métadonnées, indexabilité, alternative HTML pour les documents stratégiques.
- Vidéos : transcription publiée en HTML, chapitrage, balisage dédié. Une vidéo sans transcription est muette pour un modèle.
- Images et schémas : textes alternatifs réellement descriptifs, données du graphique reprises en texte.
- Podcasts et webinaires : transcriptions et notes d'épisode structurées.
07
Instrumentation de la mesure
Sans mesure, vous ne saurez pas si les corrections ont produit un effet.
- Identification des agents IA dans vos logs serveur : qui vient, à quelle fréquence, sur quelles pages, avec quel code de réponse.
- Suivi du trafic référent en provenance des moteurs de réponse, avec les paramètres d'attribution adaptés.
- Alerte sur les changements de configuration réseau susceptibles de rétablir un blocage.
- Tableau de bord mensuel croisant accès des robots, citations obtenues et trafic entrant.