Transparence

OGPN Bot

OgpnBot est le robot d'indexation de l'Observatoire de la gouvernance et des politiques numériques, développé dans le cadre d'un travail de recherche sur les politiques d'accès des sites web européens vis-à-vis des robots d'intelligence artificielle, et sur leur degré de souveraineté numérique. Cette page décrit à la fois son comportement technique et la méthode qui encadre les données qu'il collecte.

Identité

Qui est ce robot ?

Identifiant technique (User-Agent) :

OgpnBot/1.0 (+https://ogpn.eu/bot; hello@ogpn.eu)

Comportement

Que fait ce robot ?

Pour chaque domaine visité, dans cet ordre exact.

1. Il lit robots.txt

Si le domaine refuse l'accès à OgpnBot spécifiquement, ou via User-agent: * le robot s'arrête immédiatement et ne consulte aucune autre page. Ce refus est lui-même une donnée : il est enregistré comme tel, jamais contourné.

2. S'il est autorisé

Il consulte la page d'accueil ainsi qu'un petit nombre de fichiers standards que les sites publient volontairement à l'attention des robots (les mêmes que consultent la plupart des moteurs de recherche et des robots d'IA respectueux )

  • llms.txt
  • ai.txt (à la racine et dans /.well-known/)
  • ai-policy.json (à la racine et dans /.well-known/)
  • tdmrep.json (à la racine et dans /.well-known/)

Certains de ces fichiers sont recherchés aux deux emplacements possibles, car la convention de placement n'est pas encore stabilisée d'un site à l'autre.

Aucune autre page, aucun contenu applicatif, aucun formulaire n'est jamais visité.

Limites

Ce que ce robot ne fait pas

  • Il ne collecte ni email, ni numéro de téléphone, ni aucune donnée à caractère personnel.
  • Il ne remplit aucun formulaire, ne crée aucun compte, ne clique sur aucun lien menant à une autre page du site.
  • Il ne contourne jamais un refus exprimé dans robots.txt.
  • Il n'exploite aucune faille, ne tente aucune intrusion, ne cherche jamais à accéder à du contenu non public.

Blocage

Comment bloquer ce robot

Ajoutez ceci à votre robots.txt :

User-agent: OgpnBot
Disallow: /

Le robot vérifie ce fichier avant chaque visite. Le blocage est pris en compte dès son prochain passage, sans délai particulier de notre côté.

Rythme

Rythme de passage

Le robot est volontairement léger et espacé, avec un nombre de requêtes limité par domaine et par heure. Il ne génère jamais de rafale de trafic vers un même site.

Transparence partielle

Pourquoi pas une transparence totale sur nos données ?

Un site pourrait être tenté de publier des signaux volontairement trompeurs (un fichier annonçant une politique d'ouverture qu'il ne respecte pas réellement, par exemple) dans le seul but d'améliorer artificiellement son image dans nos résultats. Décrire dans le détail chacun de nos critères de détection faciliterait ce type de manipulation ciblée. C'est la raison principale de notre réserve sur les aspects les plus techniques de notre méthode.

Notre approche part d'un constat simple : c'est la masse des données, pas une donnée isolée, qui donne une direction fiable. Un signal trompeur ponctuel n'a qu'un effet négligeable sur une statistique agrégée portant sur des dizaines de milliers de domaines. C'est précisément ce qui rend la démarche robuste, même sans divulguer chaque critère.

Indicateurs

Ce que nous observons

Pour chaque domaine autorisé, nous relevons quatre grandes familles d'indicateurs.

Données du site

Pays, langue, secteur d'activité déclaré ou déduit du contenu public de la page d'accueil, l'identité et le contexte général du domaine.

Données IA

Ce que le site autorise ou interdit, par robot, tel qu'exprimé dans ses propres fichiers publics (Machine Readable Files) et l'adoption ou non des standards émergents de gouvernance IA.

Données EU (dépendances)

Des indices publics et techniques permettant d'estimer la dépendance d'un site à des infrastructures extra-européennes (hébergement, services tiers embarqués).

Réseaux sociaux et code

La présence publique d'une organisation sur les principaux réseaux sociaux et plateformes de code européens et internationaux, quand elle est explicitement indiquée sur le site.

Couverture

Une base qui s'enrichit progressivement

Notre couverture actuelle (robots IA suivis, fournisseurs techniques reconnus, réseaux sociaux détectés) est volontairement un point de départ, pas une liste figée. Elle s'élargit au fil du temps, à mesure que de nouveaux acteurs et de nouveaux standards apparaissent. Nous ne publions pas nos listes complètes, mais voici quelques exemples parmi les plus connus, à titre purement illustratif.

Robots IA suivis (exemples)

  • GPTBot
  • ClaudeBot
  • Google-Extended
  • CCBot
  • PerplexityBot

Fournisseurs techniques reconnus (exemples)

  • Cloudflare
  • Google Analytics
  • Google Fonts
  • Stripe
  • WordPress

Réseaux détectés (exemples)

  • Facebook
  • LinkedIn
  • Instagram
  • YouTube
  • Mastodon

Illustration

À quoi ressemble une observation

Un exemple simplifié, sur un domaine fictif, pour donner une idée concrète de la forme des données (pas notre schéma technique exact).

{
  "domaine": "exemple.eu",
  "pays": "BE",
  "membre_ue": true,
  "langue": "fr",
  "secteur": "Administration publique",

  "ia": {
    "robots_txt": "trouvé",
    "acces_robots_ia": "autorisé (majorité des robots)",
    "fichiers_standards_ia_presents": ["llms.txt", "tdmrep.json"]
  },

  "souverainete": {
    "hebergement": "à déterminer séparément",
    "services_tiers_detectes": "CDN, outil de mesure d'audience, police de caractères externe (exemples)",
    "reseaux_et_plateformes": ["LinkedIn", "Mastodon"]
  },

  "derniere_observation": "2026-07-01"
}

Sources

D'où viennent les domaines observés

La liste des domaines européens que nous observons est constituée à partir de Common Crawl, un index public et ouvert du web, complétée progressivement au fil du temps. Nous ne visitons que des domaines réellement enregistrés et publiquement accessibles (jamais de sous-domaines devinés, de ports non standards, ni de zones non destinées à un accès public).

Cette découverte se fait dans le respect des règles d'usage de Common Crawl : requêtes espacées, sans parallélisation excessive, à un rythme raisonnable qui ne pèse jamais sur leur infrastructure. C'est la même exigence de politesse et de respect que nous appliquons à chaque site individuel observé, décrite plus haut.

Usage

Usage des données

Les données individuelles ne sont jamais publiées domaine par domaine. Il n'existe aucune interface publique permettant de consulter les données précises d'un site en particulier. Seuls nos rapports, jamais les données brutes elles-mêmes, sont rendus publics.

Seules des statistiques agrégées (par pays, par secteur, par taille d'échantillon) alimentent nos rapports périodiques, gratuits et publics, avec un objectif de suivi de tendance dans le temps plutôt que de classement ou de mise en cause individuelle. L'objectif premier de cette collecte est d'alimenter la réflexion propre de l'observatoire. C'est le principe même de notre méthode : une observation menée par nos chercheurs, pas un service de données à la demande.

Aucune donnée n'est vendue. OGPN fonctionne sans but lucratif, à la manière d'une organisation d'intérêt général, avec pour seul objectif l'observation et la compréhension des transformations numériques. Il peut arriver, à titre exceptionnel, qu'une analyse spécifique soit produite à la demande, mais cela ne constitue jamais une vente de données individuelles.

Contact

Une question sur notre robot ou notre méthode ?

Pour toute question sur le comportement du robot, une donnée le concernant, notre méthodologie, ou pour signaler un problème, contactez l'observatoire.