44up.io · Crawler
StorePulse in Ihren Logs?
StorePulse ist das Messinstrument des 44up Observatory. Es beobachtet die öffentlich erreichbaren Websites von Bio-Lieferdiensten im DACH-Raum: ob sie erreichbar sind, wie barrierefrei sie sind, wie gut Suchmaschinen und KI-Assistenten sie lesen können, und wie sich Sortiment und Preise entwickeln.
So meldet sich der Crawler
Mozilla/5.0 (compatible; StorePulse-<Werkzeug>/1.0; +https://44up.io)python-requests/<Version> StorePulse-<Werkzeug>/1.0 (+https://44up.io) <Werkzeug> benennt die Messung, zum Beispiel ClosureWatch, A11y, AIReadiness oder Fetch. Wir geben uns nicht als Browser und nicht als Crawler eines anderen Anbieters aus.
Diese Kennung tragen alle unsere Anfragen an Websites von Anbietern und an öffentliche Verzeichnisse, mit zwei Ausnahmen: Baut eine Seite ihren Inhalt erst per JavaScript auf, rendern wir sie in einem automatisierten Chromium-Browser, der sich als Browser meldet (HeadlessChrome). Die Ladezeit lassen wir von Google PageSpeed Insights messen; diese Anfragen kommen von Google. Bietet ein Shop eine vorgerenderte Fassung seiner Seiten an, lesen wir statt eines Browser-Renderings diese (Parameter ?_escaped_fragment_=), mit unserer Kennung.
Was wir abrufen
| Wann (UTC) | Was |
|---|---|
| täglich 05:40 | Ihre robots.txt und die Startseite; bei getrenntem Shop danach die Shop-Adresse. Antwortet die Startseite nicht, einmal die Variante mit www oder per http. Keine Unterseiten. |
| täglich 11:40 und 17:40 | Nur Websites, deren Morgenprüfung nicht eindeutig war (Zeitüberschreitung, Fehlerseite): je eine Nachprüfung. |
| montags 02:30 | robots.txt, sitemap.xml und die darin verlinkten Teil-Sitemaps, um neue und entfernte Seiten zu erkennen. Finden wir keine Sitemap, einmal die Startseite. |
| am 1. des Monats ab 03:00 | Einzelne öffentliche Seiten: Startseite, Impressum oder Kontakt, AGB, FAQ, Stellen- oder Karriereseite, Liefergebiet, Barrierefreiheitserklärung, Shop- und Produktseiten für Preise (wo vorhanden über die öffentliche Produktsuche des Shops), bis zu acht weitere von der Startseite verlinkte Unterseiten, robots.txt, sitemap.xml, llms.txt. Manche dieser Seiten suchen wir unter üblichen Adressen (z. B. /karriere), daher können einzelne 404-Antworten auftreten. Bei einzelnen Anbietern das öffentliche Newsletter-Archiv. Dazu misst Google PageSpeed Insights die Startseite (mobil und Desktop). |
| am 1. Januar, April, Juli, Oktober 04:00 | Startseite und bis zu sechs Seiten zu Zahlung und Versand (z. B. /zahlungsarten, /agb). Außerdem DNS- und TLS-Daten Ihrer Domain; das sind keine Seitenabrufe. |
Die Anfragen kommen von einem Server in einem Rechenzentrum in Frankfurt am Main.
Was wir nicht tun
- Kein Login, kein Warenkorb, keine Bestellungen, keine Newsletter-Anmeldung.
- Antwortet eine Adresse mit HTTP 429, fragen wir sie höchstens ein weiteres Mal ab, ohne Wiederholungsschleife.
- Wir geben uns nicht als Googlebot, GPTBot oder anderer fremder Crawler aus.
- Wir beachten Ihre robots.txt. Eine Gruppe
User-agent: StorePulsegilt für alle unsere Messungen; ohne eigene Gruppe giltUser-agent: *. Das gilt auch für die Ladezeitmessung: Verbietet Ihre robots.txt den Abruf, beauftragen wir Google PageSpeed Insights nicht.
Website austragen
Zwei Wege, beide ohne Konto:
User-agent: StorePulsemitDisallow: /in Ihrer robots.txt. Gilt ab dem nächsten Lauf. Wir rufen dann nur noch Ihre robots.txt ab.- Eine E-Mail an crawler@44up.io mit der Adresse Ihrer Website, gesendet von einer Adresse unter derselben Domain. Wir bestätigen per Antwort und nehmen die Website aus allen Messungen – auch aus dem Abruf der robots.txt und aus PageSpeed Insights. Bereits erhobene Werte zeigen wir nicht mehr für Ihre Website an; sie bleiben nur in anonymen Marktzahlen enthalten.