Transparence
OGPN Bot
OgpnBot est le robot d'indexation de l'Observatoire de la gouvernance et des politiques numériques, développé dans le cadre d'un travail de recherche sur les politiques d'accès des sites web européens vis-à-vis des robots d'intelligence artificielle, et sur leur degré de souveraineté numérique. Cette page décrit à la fois son comportement technique et la méthode qui encadre les données qu'il collecte.
Identité
Qui est ce robot ?
Identifiant technique (User-Agent) :
OgpnBot/1.0 (+https://ogpn.eu/bot; hello@ogpn.eu)
Comportement
Que fait ce robot ?
Pour chaque domaine visité, dans cet ordre exact.
1. Il lit robots.txt
Si le domaine refuse l'accès à OgpnBot spécifiquement, ou via User-agent: * le robot s'arrête immédiatement et ne consulte aucune autre page. Ce refus est lui-même une donnée : il est enregistré comme tel, jamais contourné.
2. S'il est autorisé
Il consulte la page d'accueil ainsi qu'un petit nombre de fichiers standards que les sites publient volontairement à l'attention des robots (les mêmes que consultent la plupart des moteurs de recherche et des robots d'IA respectueux )
llms.txtai.txt(à la racine et dans/.well-known/)ai-policy.json(à la racine et dans/.well-known/)tdmrep.json(à la racine et dans/.well-known/)
Certains de ces fichiers sont recherchés aux deux emplacements possibles, car la convention de placement n'est pas encore stabilisée d'un site à l'autre.
Aucune autre page, aucun contenu applicatif, aucun formulaire n'est jamais visité.
Limites
Ce que ce robot ne fait pas
- Il ne collecte ni email, ni numéro de téléphone, ni aucune donnée à caractère personnel.
- Il ne remplit aucun formulaire, ne crée aucun compte, ne clique sur aucun lien menant à une autre page du site.
- Il ne contourne jamais un refus exprimé dans robots.txt.
- Il n'exploite aucune faille, ne tente aucune intrusion, ne cherche jamais à accéder à du contenu non public.
Blocage
Comment bloquer ce robot
Ajoutez ceci à votre robots.txt :
User-agent: OgpnBot
Disallow: /
Le robot vérifie ce fichier avant chaque visite. Le blocage est pris en compte dès son prochain passage, sans délai particulier de notre côté.
Rythme
Rythme de passage
Le robot est volontairement léger et espacé, avec un nombre de requêtes limité par domaine et par heure. Il ne génère jamais de rafale de trafic vers un même site.
Transparence partielle
Pourquoi pas une transparence totale sur nos données ?
Un site pourrait être tenté de publier des signaux volontairement trompeurs (un fichier annonçant une politique d'ouverture qu'il ne respecte pas réellement, par exemple) dans le seul but d'améliorer artificiellement son image dans nos résultats. Décrire dans le détail chacun de nos critères de détection faciliterait ce type de manipulation ciblée. C'est la raison principale de notre réserve sur les aspects les plus techniques de notre méthode.
Notre approche part d'un constat simple : c'est la masse des données, pas une donnée isolée, qui donne une direction fiable. Un signal trompeur ponctuel n'a qu'un effet négligeable sur une statistique agrégée portant sur des dizaines de milliers de domaines. C'est précisément ce qui rend la démarche robuste, même sans divulguer chaque critère.
Indicateurs
Ce que nous observons
Pour chaque domaine autorisé, nous relevons quatre grandes familles d'indicateurs.
Données du site
Pays, langue, secteur d'activité déclaré ou déduit du contenu public de la page d'accueil, l'identité et le contexte général du domaine.
Données IA
Ce que le site autorise ou interdit, par robot, tel qu'exprimé dans ses propres fichiers publics (Machine Readable Files) et l'adoption ou non des standards émergents de gouvernance IA.
Données EU (dépendances)
Des indices publics et techniques permettant d'estimer la dépendance d'un site à des infrastructures extra-européennes (hébergement, services tiers embarqués).
Réseaux sociaux et code
La présence publique d'une organisation sur les principaux réseaux sociaux et plateformes de code européens et internationaux, quand elle est explicitement indiquée sur le site.
Couverture
Une base qui s'enrichit progressivement
Notre couverture actuelle (robots IA suivis, fournisseurs techniques reconnus, réseaux sociaux détectés) est volontairement un point de départ, pas une liste figée. Elle s'élargit au fil du temps, à mesure que de nouveaux acteurs et de nouveaux standards apparaissent. Nous ne publions pas nos listes complètes, mais voici quelques exemples parmi les plus connus, à titre purement illustratif.
Robots IA suivis (exemples)
- GPTBot
- ClaudeBot
- Google-Extended
- CCBot
- PerplexityBot
Fournisseurs techniques reconnus (exemples)
- Cloudflare
- Google Analytics
- Google Fonts
- Stripe
- WordPress
Réseaux détectés (exemples)
- YouTube
- Mastodon
Illustration
À quoi ressemble une observation
Un exemple simplifié, sur un domaine fictif, pour donner une idée concrète de la forme des données (pas notre schéma technique exact).
{
"domaine": "exemple.eu",
"pays": "BE",
"membre_ue": true,
"langue": "fr",
"secteur": "Administration publique",
"ia": {
"robots_txt": "trouvé",
"acces_robots_ia": "autorisé (majorité des robots)",
"fichiers_standards_ia_presents": ["llms.txt", "tdmrep.json"]
},
"souverainete": {
"hebergement": "à déterminer séparément",
"services_tiers_detectes": "CDN, outil de mesure d'audience, police de caractères externe (exemples)",
"reseaux_et_plateformes": ["LinkedIn", "Mastodon"]
},
"derniere_observation": "2026-07-01"
}
Sources
D'où viennent les domaines observés
La liste des domaines européens que nous observons est constituée à partir de Common Crawl, un index public et ouvert du web, complétée progressivement au fil du temps. Nous ne visitons que des domaines réellement enregistrés et publiquement accessibles (jamais de sous-domaines devinés, de ports non standards, ni de zones non destinées à un accès public).
Cette découverte se fait dans le respect des règles d'usage de Common Crawl : requêtes espacées, sans parallélisation excessive, à un rythme raisonnable qui ne pèse jamais sur leur infrastructure. C'est la même exigence de politesse et de respect que nous appliquons à chaque site individuel observé, décrite plus haut.
Usage
Usage des données
Les données individuelles ne sont jamais publiées domaine par domaine. Il n'existe aucune interface publique permettant de consulter les données précises d'un site en particulier. Seuls nos rapports, jamais les données brutes elles-mêmes, sont rendus publics.
Seules des statistiques agrégées (par pays, par secteur, par taille d'échantillon) alimentent nos rapports périodiques, gratuits et publics, avec un objectif de suivi de tendance dans le temps plutôt que de classement ou de mise en cause individuelle. L'objectif premier de cette collecte est d'alimenter la réflexion propre de l'observatoire. C'est le principe même de notre méthode : une observation menée par nos chercheurs, pas un service de données à la demande.
Aucune donnée n'est vendue. OGPN fonctionne sans but lucratif, à la manière d'une organisation d'intérêt général, avec pour seul objectif l'observation et la compréhension des transformations numériques. Il peut arriver, à titre exceptionnel, qu'une analyse spécifique soit produite à la demande, mais cela ne constitue jamais une vente de données individuelles.
Contact
Une question sur notre robot ou notre méthode ?
Pour toute question sur le comportement du robot, une donnée le concernant, notre méthodologie, ou pour signaler un problème, contactez l'observatoire.