DéveloppeursAgents et crawlers IA

Agents et crawlers IA

Ce que BoostEcom publie pour les crawlers et les agents LLM, les bots autorisés, et comment lire la documentation par programme.

Le site de BoostEcom (https://www.boostecom.app) est fait pour être lu par les agents, et pas seulement toléré par eux.

Les index

SurfaceFormatRôle
/llms.txtMarkdownUn index éditorial, trié à la main, pour les crawlers LLM.
/llms.jsonJSONLa variante structurée, pour les agents récents.
/sitemap.xmlXMLDérivé : contenus MDX, marketplace, agents.
/robots.txttexteLa liste des crawlers autorisés.

/llms.txt est tenu à la main, pas généré à partir du sitemap. C'est tout l'intérêt : un crawler qui le suit tombe sur les pages qui méritent d'être lues, et non sur toutes les URL qui existent.

Crawlers autorisés

robots.txt autorise explicitement, entre autres :

  • GPTBot
  • ClaudeBot
  • anthropic-ai
  • PerplexityBot
  • Google-Extended

Cette liste d'autorisations est voulue, ce n'est pas un oubli. Nous tenons à ce que nos pages figurent dans les moteurs de réponse.

Données structurées

Chaque page porte le JSON-LD qui correspond à son type : WebPage et Article partout, FAQPage là où il y a une FAQ, HowTo sur les tutoriels et les guides de connexion par client, Product avec AggregateRating et Offer sur les annonces du marketplace, Event sur les événements de la communauté.

Chaque page de contenu émet son fil d'Ariane sous forme de BreadcrumbList.

Ce qui échappe volontairement aux crawlers

Deux surfaces sont en noindex et hors du sitemap, à dessein :

  • Les fiches Intelligence sur /intelligence/stores/<domaine>, parce qu'elles décrivent des boutiques tierces.
  • Les contenus à intégrer sur /embed/bulletin et /embed/widget : les deux seuls chemins où l'interdiction d'affichage en iframe, appliquée à tout le site, est levée.

Lire cette documentation en tant qu'agent

Cette documentation est servie sur https://docs.boostecom.app. Ses pages publiques (Documentation, Tools et Centre d'aide) sont listées dans son propre /llms.txt et son sitemap, et chacune existe aussi en Markdown brut : récupérer l'URL suffit pour obtenir le texte complet. Les pages réservées à l'équipe n'apparaissent sur aucune de ces surfaces.

Depuis un client MCP, les outils searchDocs et getDoc (scope boostecom:docs.read) cherchent et lisent la documentation produit que sert l'application. Voir Outils MCP et scopes.

Notre propre profil d'agent

Quand BoostEcom agit comme client auprès d'une boutique Shopify, il publie ses capacités sur /.well-known/ucp-agent. Chaque boutique que nous interrogeons le lit pour négocier avant de répondre. Il déclare un accès en lecture au catalogue et ne contient aucun secret.