Zum Inhalt springen
kiintegration.com
00 online·2.407 Dienstleister
Transparenz · Crawler

Was KiIntegrationBot abruft und wie Sie ihn aussperren.

Der Bot aus Ihren Logs ruft drei HTML-Seiten Ihrer Domain ab — Startseite, Impressum, Kontakt —, mit einer Anfrage gleichzeitig und zwei Sekunden Abstand. Er beachtet robots.txt, und ein 403 versteht er als Nein: Er kommt nicht wieder.

Die Kennung im Log

Genau dieser String steht in jedem Request. Er ändert sich nur mit der Versionsnummer.

KiIntegrationBot/0.1 (+https://kiintegration.com/bot)

Der Bot maskiert sich nicht als Browser, benutzt keine Proxy-Pools und keine Cookies (COOKIES_ENABLED = False). Wenn ein Request nicht so aussieht, ist er nicht von uns.

Wer crawlt

Betrieben wird der Bot für das KI Integration Register, ein Verzeichnis von Betrieben im DACH-Raum, die KI-Projekte umsetzen. Der Eintrag entsteht aus öffentlich zugänglichen Angaben, nicht aus Selbstauskunft.

Verantwortlicher
Christopher Nonne (Einzelunternehmen), Schloßgrund 26, 96472 Rödental, Deutschland. Vollständige Angaben im Impressum.
Kontakt
infotion.cominfotion.com — wird an jedem Werktag gelesen. Telefonisch: +49 (0) 20 80 637+49 (0) 20 80 637.
Zweck
Aufbau und Pflege des Registers. Kein Preisvergleich, kein Adresshandel, kein Training von Sprachmodellen.

Was der Bot abruft

Höchstens drei Seiten je Domain, alle davon HTML.

  • Startseite — Leistungsbeschreibung, verlinkte Social-Profile.
  • Impressum — Firmierung, Rechtsform, Anschrift, Register, USt-IdNr., Kammer.
  • Kontaktseite — soweit vorhanden, für die Anschrift.

Was er nicht anfasst

  • Bilder, Videos, Schriften, CSS, JavaScript — der Downloader bricht bei allem ab, was kein HTML ist.
  • Formulare, Logins, Warenkörbe, Suchseiten, alles hinter einer Anmeldung.
  • Seiten tiefer als zwei Klicks von der Startseite (DEPTH_LIMIT = 2).
  • Personenbezogene Daten — außer den Vertretungsberechtigten, die Ihr Impressum ohnehin nennen, weil § 5 DDG das verlangt.

Wie oft, und wie sanft

Die Werte sind bewusst konservativ. Sie sind der Grund, warum dieser Crawler keine Last erzeugt, die auffällt.

GrenzeWertEinstellung
Gleichzeitige Anfragen je Host1CONCURRENT_REQUESTS_PER_DOMAIN
Pause zwischen zwei Anfragen2 sDOWNLOAD_DELAY, zufällig gestreut
Automatische DrosselunganAutoThrottle, bis 60 s bei langsamer Antwort
Seiten je Domain und Laufhöchstens 3Startseite, Impressum, Kontakt
Maximale Antwortgröße4 MBdarüber wird abgebrochen
Zeitüberschreitung20 sDOWNLOAD_TIMEOUT
Wiederholungen2nur bei 5xx, 408 und 429

Drei Regeln, die darüber stehen

  1. robots.txt gilt. ROBOTSTXT_OBEY = True — was dort gesperrt ist, wird nicht geholt.
  2. Conditional GET. Der Bot schickt If-Modified-Since bzw. If-None-Match. Beim zweiten Durchlauf sind die meisten Antworten ein 304 ohne Body.
  3. 403 ist ein Nein. Ein 403 wird nicht wiederholt; der Host wandert in die Quarantäne und wird auch in späteren Läufen nicht erneut angefragt.

Ein vollständiger Durchlauf über eine Domain sind drei Anfragen in etwa sechs Sekunden. Wiederholt wird das frühestens nach mehreren Wochen, und dann meist als 304.

Wie Sie den Bot aussperren

Zwei Wege, beide wirken. Sie müssen sich nicht begründen.

1 · robots.txt

User-agent: KiIntegrationBotDisallow: /

Wirkt ab dem nächsten Lauf, ohne Zutun von uns. Ein Disallow: / unterUser-agent: * wirkt genauso — der Bot liest beide Blöcke.

2 · Eine Mail

Schreiben Sie an infotion.cominfotion.com mit der Domain. Wir tragen sie in die Sperrliste ein; sie wird dann nicht mehr angefragt, auch wenn sich Ihre robots.txt später ändert. Wollen Sie zusätzlich den bestehenden Eintrag entfernt haben, ist Eintrag entfernen der schnellere Weg — das ist ein anderer Vorgang als das Aussperren des Crawlers.

3 · Technisch blocken

Ein 403 auf den User-Agent genügt ebenfalls. Der Bot merkt sich das dauerhaft und versucht es nicht erneut. Ein Rate-Limit brauchen Sie nicht: eine Anfrage alle zwei Sekunden unterschreitet jedes übliche Limit.

Was mit den Daten passiert

Aus dem abgerufenen HTML werden Registerangaben extrahiert — Firmierung, Rechtsform, Register und Registernummer, USt-IdNr., Anschrift, Kammer, Leistungsbeschreibung und verlinkte Profile. Daraus entsteht ein Eintrag im Register, der den Betrieb auffindbar macht und den jeder Betrieb beanspruchen kann.

Weil wir diese Daten aus öffentlichen Quellen übernehmen und nicht bei Ihnen erheben, greift Art. 14 DSGVO. Die vollständige Information — Verantwortlicher, Zwecke, Rechtsgrundlage, Quellen, Speicherdauer, Rechte — steht auf Datenquellen und Art.-14-Hinweis.

Änderungsprotokoll

Jede Änderung am Verhalten des Bots steht hier, mit Datum.

  • 02.09.2026Diese Seite veröffentlicht. Bis dahin nannte der User-Agent zusätzlich die Kontaktadresse im Klartext.
  • 01.09.2026KiIntegrationBot/0.1 in Betrieb genommen: Startseite, Impressum und Kontaktseite, 1 Anfrage je Host, 2 s Abstand.