Was KiIntegrationBot abruft und wie Sie ihn aussperren.
Der Bot aus Ihren Logs ruft drei HTML-Seiten Ihrer Domain ab — Startseite, Impressum, Kontakt —, mit einer Anfrage gleichzeitig und zwei Sekunden Abstand. Er beachtet robots.txt, und ein 403 versteht er als Nein: Er kommt nicht wieder.
Die Kennung im Log
Genau dieser String steht in jedem Request. Er ändert sich nur mit der Versionsnummer.
KiIntegrationBot/0.1 (+https://kiintegration.com/bot)Der Bot maskiert sich nicht als Browser, benutzt keine Proxy-Pools und keine Cookies (COOKIES_ENABLED = False). Wenn ein Request nicht so aussieht, ist er nicht von uns.
Wer crawlt
Betrieben wird der Bot für das KI Integration Register, ein Verzeichnis von Betrieben im DACH-Raum, die KI-Projekte umsetzen. Der Eintrag entsteht aus öffentlich zugänglichen Angaben, nicht aus Selbstauskunft.
- Verantwortlicher
- Christopher Nonne (Einzelunternehmen), Schloßgrund 26, 96472 Rödental, Deutschland. Vollständige Angaben im Impressum.
- Kontakt
- infotion.cominfotion.com — wird an jedem Werktag gelesen. Telefonisch: +49 (0) 20 80 637+49 (0) 20 80 637.
- Zweck
- Aufbau und Pflege des Registers. Kein Preisvergleich, kein Adresshandel, kein Training von Sprachmodellen.
Was der Bot abruft
Höchstens drei Seiten je Domain, alle davon HTML.
- Startseite — Leistungsbeschreibung, verlinkte Social-Profile.
- Impressum — Firmierung, Rechtsform, Anschrift, Register, USt-IdNr., Kammer.
- Kontaktseite — soweit vorhanden, für die Anschrift.
Was er nicht anfasst
- Bilder, Videos, Schriften, CSS, JavaScript — der Downloader bricht bei allem ab, was kein HTML ist.
- Formulare, Logins, Warenkörbe, Suchseiten, alles hinter einer Anmeldung.
- Seiten tiefer als zwei Klicks von der Startseite (
DEPTH_LIMIT = 2). - Personenbezogene Daten — außer den Vertretungsberechtigten, die Ihr Impressum ohnehin nennen, weil § 5 DDG das verlangt.
Wie oft, und wie sanft
Die Werte sind bewusst konservativ. Sie sind der Grund, warum dieser Crawler keine Last erzeugt, die auffällt.
| Grenze | Wert | Einstellung |
|---|---|---|
| Gleichzeitige Anfragen je Host | 1 | CONCURRENT_REQUESTS_PER_DOMAIN |
| Pause zwischen zwei Anfragen | 2 s | DOWNLOAD_DELAY, zufällig gestreut |
| Automatische Drosselung | an | AutoThrottle, bis 60 s bei langsamer Antwort |
| Seiten je Domain und Lauf | höchstens 3 | Startseite, Impressum, Kontakt |
| Maximale Antwortgröße | 4 MB | darüber wird abgebrochen |
| Zeitüberschreitung | 20 s | DOWNLOAD_TIMEOUT |
| Wiederholungen | 2 | nur bei 5xx, 408 und 429 |
Drei Regeln, die darüber stehen
- robots.txt gilt.
ROBOTSTXT_OBEY = True— was dort gesperrt ist, wird nicht geholt. - Conditional GET. Der Bot schickt
If-Modified-Sincebzw.If-None-Match. Beim zweiten Durchlauf sind die meisten Antworten ein 304 ohne Body. - 403 ist ein Nein. Ein 403 wird nicht wiederholt; der Host wandert in die Quarantäne und wird auch in späteren Läufen nicht erneut angefragt.
Ein vollständiger Durchlauf über eine Domain sind drei Anfragen in etwa sechs Sekunden. Wiederholt wird das frühestens nach mehreren Wochen, und dann meist als 304.
Wie Sie den Bot aussperren
Zwei Wege, beide wirken. Sie müssen sich nicht begründen.
1 · robots.txt
User-agent: KiIntegrationBotDisallow: /Wirkt ab dem nächsten Lauf, ohne Zutun von uns. Ein Disallow: / unterUser-agent: * wirkt genauso — der Bot liest beide Blöcke.
2 · Eine Mail
Schreiben Sie an infotion.cominfotion.com mit der Domain. Wir tragen sie in die Sperrliste ein; sie wird dann nicht mehr angefragt, auch wenn sich Ihre robots.txt später ändert. Wollen Sie zusätzlich den bestehenden Eintrag entfernt haben, ist Eintrag entfernen der schnellere Weg — das ist ein anderer Vorgang als das Aussperren des Crawlers.
3 · Technisch blocken
Ein 403 auf den User-Agent genügt ebenfalls. Der Bot merkt sich das dauerhaft und versucht es nicht erneut. Ein Rate-Limit brauchen Sie nicht: eine Anfrage alle zwei Sekunden unterschreitet jedes übliche Limit.
Was mit den Daten passiert
Aus dem abgerufenen HTML werden Registerangaben extrahiert — Firmierung, Rechtsform, Register und Registernummer, USt-IdNr., Anschrift, Kammer, Leistungsbeschreibung und verlinkte Profile. Daraus entsteht ein Eintrag im Register, der den Betrieb auffindbar macht und den jeder Betrieb beanspruchen kann.
Weil wir diese Daten aus öffentlichen Quellen übernehmen und nicht bei Ihnen erheben, greift Art. 14 DSGVO. Die vollständige Information — Verantwortlicher, Zwecke, Rechtsgrundlage, Quellen, Speicherdauer, Rechte — steht auf Datenquellen und Art.-14-Hinweis.
Änderungsprotokoll
Jede Änderung am Verhalten des Bots steht hier, mit Datum.
- 02.09.2026Diese Seite veröffentlicht. Bis dahin nannte der User-Agent zusätzlich die Kontaktadresse im Klartext.
- 01.09.2026KiIntegrationBot/0.1 in Betrieb genommen: Startseite, Impressum und Kontaktseite, 1 Anfrage je Host, 2 s Abstand.