Transparence

OGPN Bot

OgpnBot est le robot de collecte de l'Observatoire de la Gouvernance et des Politiques Numériques (OGPN), développé dans le cadre d'un travail de recherche indépendant sur les politiques d'accès des sites web européens vis-à-vis des robots d'intelligence artificielle, et sur leur degré de souveraineté numérique. Cette page décrit à la fois son comportement technique, l'infrastructure et la méthode qui encadre les données collectées.

Mission

Pourquoi OGPN Bot ?

Le web européen manque aujourd'hui d'une cartographie indépendante et régulièrement mise à jour de ses pratiques numériques : qui autorise ou bloque les robots d'IA, qui dépend de quels hébergeurs et fournisseurs non européens, qui adopte les standards émergents de gouvernance (llms.txt, ai.txt, protocole TDM), qui respecte ses obligations de consentement.

Ces questions relèvent directement de la souveraineté numérique européenne — un sujet suivi de près par la recherche académique, les institutions publiques et les décideurs politiques, mais rarement mesuré à grande échelle et dans la durée. C'est l'objet de cet observatoire : un instrument de mesure ouvert, dont les résultats agrégés sont mis gratuitement à disposition de la recherche académique, institutionnelle et indépendante.

Identité

Qui est ce robot ?

Identifiant technique (User-Agent) :

OgpnBot/1.0 (+https://ogpn.eu/bot; hello@ogpn.eu)

Comportement

Que fait ce robot ?

Pour chaque domaine visité, dans cet ordre exact.

1. Il lit robots.txt

Si le domaine refuse l'accès à OgpnBot spécifiquement, ou via User-agent: *, le robot s'arrête immédiatement et ne consulte aucune autre page. Ce refus est lui-même une donnée : il est enregistré comme tel, jamais contourné. Ce principe n'est pas configurable : c'est la toute première chose que fait le robot, systématiquement, avant toute autre requête.

2. S'il est autorisé

Il consulte la page d'accueil ainsi qu'un petit nombre de fichiers standards que les sites publient volontairement à l'attention des robots (les mêmes que consultent la plupart des moteurs de recherche et des robots d'IA respectueux).

  • llms.txt
  • ai.txt (à la racine et dans /.well-known/)
  • tdmrep.json (à la racine et dans /.well-known/)
  • security.txt (à la racine et dans /.well-known/)
  • humans.txt

Certains de ces fichiers sont recherchés aux deux emplacements possibles, car la convention de placement n'est pas encore stabilisée d'un site à l'autre.

Aucune autre page, aucun contenu applicatif, aucun formulaire n'est jamais visité.

Limites

Ce que ce robot ne fait pas

  • Il ne collecte ni email, ni numéro de téléphone, ni aucune donnée à caractère personnel.
  • Il ne remplit aucun formulaire, ne crée aucun compte, ne clique sur aucun lien menant à une autre page du site.
  • Il ne contourne jamais un refus exprimé dans robots.txt, quelle que soit la méthode.
  • Il n'exploite aucune faille, ne tente aucune intrusion, ne cherche jamais à accéder à du contenu non public.
  • Il ne revend, ne partage et ne publie jamais ses résultats domaine par domaine à des fins commerciales, publicitaires ou de profilage.

Vos réglages

Autoriser, bloquer, et à quel rythme

Autoriser

Comment autoriser ce robot

Par défaut, si votre robots.txt ne mentionne rien, OgpnBot est déjà autorisé — c'est le comportement standard du protocole. Vous n'avez donc rien à faire pour être inclus dans l'observatoire.

Pour l'autoriser explicitement :

User-agent: OgpnBot
Allow: /

Cela ne vous engage à rien de particulier : votre domaine est simplement inclus dans les statistiques agrégées de l'observatoire, au même titre que les autres.

Blocage

Comment bloquer ce robot

Ajoutez ceci à votre robots.txt :

User-agent: OgpnBot
Disallow: /

Le robot vérifie ce fichier avant chaque visite. Le blocage est pris en compte dès son prochain passage, sans délai particulier de notre côté.

Rythme

Rythme de passage

La collecte tourne à un rythme de l'ordre de 2 500 domaines par heure sur l'ensemble de la population observée, ce qui représente plusieurs mois avant qu'un même domaine ne soit revisité. Un domaine n'est donc consulté qu'occasionnellement, jamais en rafale.

Exception : pendant des phases de test ponctuelles, certains TLD ou domaines spécifiques peuvent être consultés plus fréquemment, le temps de valider une évolution technique de l'observatoire. Ces phases sont temporaires et n'affectent pas le rythme général décrit ci-dessus.

Infrastructure

D'où proviennent les requêtes du robot

Les requêtes d'OgpnBot peuvent provenir de plusieurs infrastructures distinctes, utilisées en parallèle pour répartir la charge de collecte : GitHub Actions, Render (datacenter en Allemagne), OVH et Infomaniak (France/Suisse). Cette diversité d'origine est normale et attendue — elle ne doit pas être interprétée comme une activité suspecte ou coordonnée entre plusieurs acteurs.

Toutes ces requêtes s'identifient avec le même User-Agent OgpnBot, ce qui reste le moyen fiable de les reconnaître dans vos journaux, quelle que soit l'adresse IP ou l'hébergeur d'origine du moment. Nous ne publions pas de liste fixe d'adresses IP ou de plages ASN : cette infrastructure évolue dans le temps, et le User-Agent reste la référence stable.

Transparence partielle

Pourquoi pas une transparence totale sur nos données ?

Un site pourrait être tenté de publier des signaux volontairement trompeurs (un fichier annonçant une politique d'ouverture qu'il ne respecte pas réellement, par exemple) dans le seul but d'améliorer artificiellement son image dans nos résultats. Décrire dans le détail chacun de nos critères de détection faciliterait ce type de manipulation ciblée. C'est la raison principale de notre réserve sur les aspects les plus techniques de notre méthode.

Méthode

Le principe de la masse : une orientation, pas un verdict

La collecte automatisée à grande échelle a des limites inhérentes que nous assumons pleinement : un robots.txt mal formé, une page d'accueil atypique, une redirection non standard peuvent produire un faux positif, une détection incomplète, ou un résultat impossible à classer pour un domaine donné, pris isolément.

C'est précisément pour cette raison que les résultats d'OGPN doivent être lus comme une indication globale, une orientation, une direction — jamais comme un verdict individuel sur un site en particulier. La fiabilité de l'observatoire ne repose pas sur l'exactitude de chaque mesure isolée, mais sur la régularité statistique qui émerge à l'échelle de dizaines de milliers de domaines. C'est cette échelle qui donne du sens aux résultats, pas l'examen d'un cas unique.

Indicateurs

Ce que nous observons

Pour chaque domaine autorisé, nous relevons plusieurs grandes familles d'indicateurs.

Données du site

Pays, langue, secteur d'activité déclaré ou déduit du contenu public de la page d'accueil, l'identité et le contexte général du domaine.

Données IA

Ce que le site autorise ou interdit, par robot, tel qu'exprimé dans ses propres fichiers publics (Machine Readable Files) et l'adoption ou non des standards émergents de gouvernance IA.

Données EU (dépendances)

Des indices publics et techniques permettant d'estimer la dépendance d'un site à des infrastructures extra-européennes (hébergement, CDN, services tiers embarqués).

Réseaux sociaux et code

La présence publique d'une organisation sur les principaux réseaux sociaux et plateformes de code européens et internationaux, quand elle est explicitement indiquée sur le site (liens uniquement, jamais le contenu des pages).

Consentement et conformité

La présence d'une bannière ou d'un gestionnaire de consentement reconnu, comme indice public de conformité aux obligations européennes en matière de protection des données.

Statut du domaine

Actif, injoignable, ou en vente (détection multilingue, couvrant les principales langues européennes), pour distinguer les domaines réellement exploités de ceux qui ne le sont plus.

Couverture

Une base qui s'enrichit progressivement

Notre couverture actuelle (robots IA suivis, fournisseurs techniques reconnus, réseaux sociaux détectés) est volontairement un point de départ, pas une liste figée. Elle s'élargit au fil du temps, à mesure que de nouveaux acteurs et de nouveaux standards apparaissent. Nous ne publions pas nos listes complètes, mais voici quelques exemples parmi les plus connus, à titre purement illustratif.

Robots IA suivis (exemples)

  • GPTBot
  • ClaudeBot
  • Google-Extended
  • CCBot
  • PerplexityBot

Fournisseurs techniques reconnus (exemples)

  • Cloudflare
  • Google Analytics
  • Google Fonts
  • Stripe
  • WordPress

Réseaux détectés (exemples)

  • Facebook
  • LinkedIn
  • Instagram
  • YouTube
  • Mastodon

Illustration

À quoi ressemble une observation

Un exemple simplifié, sur un domaine fictif, pour donner une idée concrète de la forme des données (pas notre schéma technique exact).

{
  "domaine": "exemple.eu",
  "pays": "BE",
  "membre_ue": true,
  "langue": "fr",
  "secteur": "Administration publique",

  "ia": {
    "robots_txt": "trouvé",
    "acces_robots_ia": "autorisé (majorité des robots)",
    "fichiers_standards_ia_presents": ["llms.txt", "tdmrep.json"]
  },

  "souverainete": {
    "hebergement": "à déterminer séparément",
    "services_tiers_detectes": "CDN, outil de mesure d'audience, police de caractères externe (exemples)",
    "reseaux_et_plateformes": ["LinkedIn", "Mastodon"]
  },

  "conformite": {
    "consentement_detecte": true
  },

  "statut": "actif",
  "derniere_observation": "2026-07-01"
}

Sources

D'où viennent les domaines observés

La liste des domaines européens que nous observons est constituée à partir de Common Crawl, un index public et ouvert du web, complétée progressivement au fil du temps. Nous ne visitons que des domaines réellement enregistrés et publiquement accessibles (jamais de sous-domaines devinés, de ports non standards, ni de zones non destinées à un accès public).

Cette découverte se fait dans le respect des règles d'usage de Common Crawl : requêtes espacées, sans parallélisation excessive, à un rythme raisonnable qui ne pèse jamais sur leur infrastructure. C'est la même exigence de politesse et de respect que nous appliquons à chaque site individuel observé, décrite plus haut.

Usage

Vos données ne sont jamais individualisées

C'est un principe central de l'observatoire. Les données individuelles ne sont jamais publiées domaine par domaine. Il n'existe aucune interface publique permettant de consulter les données précises d'un site en particulier. Seuls nos rapports, jamais les données brutes elles-mêmes, sont rendus publics.

Seules des statistiques agrégées (par pays, par secteur, par TLD, par taille d'échantillon) alimentent nos rapports périodiques, gratuits et publics, avec un objectif de suivi de tendance dans le temps plutôt que de classement ou de mise en cause individuelle. L'objectif premier de cette collecte est d'alimenter la réflexion propre de l'observatoire. C'est le principe même de notre méthode : une observation menée par nos chercheurs, pas un service de données à la demande.

Aucune donnée n'est vendue. OGPN fonctionne sans but lucratif, à la manière d'une organisation d'intérêt général, avec pour seul objectif l'observation et la compréhension des transformations numériques. Il peut arriver, à titre exceptionnel, qu'une analyse spécifique soit produite à la demande, mais cela ne constitue jamais une vente de données individuelles.

Éthique

Une démarche fondée sur le respect

OGPN se construit autour de quelques engagements simples, que ce robot applique strictement : respecter systématiquement les choix exprimés par les sites (robots.txt), ne collecter que ce qui est public et volontairement exposé, ne jamais individualiser les résultats publics, rester transparent sur l'existence et le fonctionnement du robot, et publier des méthodes et des résultats ouverts, gratuits et vérifiables — au service de la recherche académique, institutionnelle et indépendante sur la gouvernance et la souveraineté numériques européennes.

Contact

Une question sur notre robot ou notre méthode ?

Pour toute question sur le comportement du robot, une donnée le concernant, notre méthodologie, ou pour signaler un problème, contactez l'observatoire.