Flux publics pour robots d’exploration
Une surface de données publique au sein de l’Observatoire des robots d’exploration de Scrubnet
Pourquoi l’Observatoire publie ces flux
Scrubnet publie des flux HTML, JSON, TXT et Markdown issus de sources autorisées afin que le comportement des robots d’exploration puisse être observé sur une surface publique cohérente. Des structures stables, des liens vers les sources et des horodatages facilitent la description de la découverte, de la réexploration et de la répartition des requêtes entre les robots de recherche, d’IA et d’archivage.
Ces flux font partie de l’Observatoire des robots d’exploration de Scrubnet : une capacité de recherche spécialisée intégrée à un ensemble plus vaste d’outils et de connaissances destiné aux spécialistes du SEO technique et aux développeurs web.
Les questions que nous observons
- Quels robots découvrent les flux sans soumission directe ?
- Dans quel délai les robots reviennent-ils après la modification d’un flux ou d’une page source ?
- Comment les requêtes vérifiées se répartissent-elles entre HTML, JSON, TXT et Markdown ?
- En quoi les requêtes de robots vérifiées diffèrent-elles des requêtes non vérifiées ?
- Comment les schémas de récupération observables peuvent-ils éclairer les analyses de SEO technique et de GEO ?
Explorer les données
Commencez par /feed/sitemap.xml pour découvrir les flux actifs et leurs valeurs <lastmod>.
Utilisez ensuite le tableau de bord des journaux en direct pour filtrer les requêtes
par chemin, robot, état de vérification et date, ou pour les comparer par robot et par format.
Accès technique
- Découverte : récupérez
https://scrubnet.org/feed/sitemap.xml. - Fraîcheur : comparez les valeurs
<lastmod>et ne récupérez de nouveau que les flux modifiés. - Requêtes conditionnelles : envoyez
If-Modified-SinceouIf-None-Matchlorsque ces en-têtes sont pris en charge. - Formats : utilisez la représentation HTML, JSON, TXT ou Markdown liée dont votre analyse a besoin.
- Provenance : conservez l’URL source et les horodatages lorsque vous analysez ou citez des enregistrements.
Limites méthodologiques
Les journaux d’accès confirment qu’une requête a atteint un flux Scrubnet. Ils ne prouvent pas que le contenu a été indexé, classé, utilisé pour entraîner un modèle, récupéré dans une réponse ou cité à un utilisateur. Les résultats sont des observations descriptives issues de l’environnement de Scrubnet et ne permettent pas d’établir pourquoi un robot s’est comporté d’une certaine manière.
ScrubberDuck
ScrubberDuck/1.0 est le compilateur de flux à faible cadence, respectueux des règles destinées aux robots, qui crée et actualise les flux autorisés des sites participants. Il fournit la surface d’observation ; ce n’est ni un moteur de recherche ni un robot de classement.
Équipes de recherche et d’exploration
Pour proposer un site, suggérer une question d’observation ou discuter de l’accès aux données complémentaires, écrivez à contact@scrubnet.org.