PrestaShop Moduły PrestaShop

AI Crawler Manager: PrestaShop 8 i 9

Odzyskaj kontrolę nad botami AI, które scrapują Twój sklep

Crawlery AI zasysają Twoje karty produktów, aby trenować modele LLM, zasilać asystentów konwersacyjnych i wyszukiwarki AI. Z AI Crawler Manager odzyskujesz kontrolę: ponad 30 śledzonych i rozpoznawalnych jednym kliknięciem botów AI, wizualny kreator robots.txt, blokada HTTP 403 dla botów ignorujących robots.txt, statystyki crawlowania AI w czasie rzeczywistym.

PrestaShop 8 PrestaShop 9 Wielojęzyczny Multistore RODO
  • Zwrot w 30 dni
  • 12 miesięcy aktualizacji
  • Wsparcie 24 h
www.datafirefly.com/pl/
Zarządzanie crawlerami AI i regułami dostępu w PrestaShop
v1.0.0 · zaktualizowano 2026-05-26
Co robi

W skrócie.

01

Ponad 30 śledzonych botów AI w 2026

OpenAI (GPTBot, ChatGPT-User, OAI-SearchBot), Anthropic (ClaudeBot, Claude-Web, anthropic-ai), Google-Extended, Apple (Applebot-Extended), Perplexity, ByteDance (Bytespider), Meta (Meta-ExternalAgent), Mistral, xAI, Cohere, Amazon, Common Crawl, You.com, Diffbot, DuckAssistBot, Kagi i więcej.

02

Wizualny kreator robots.txt

Przełączaj każdego bota między dozwolony a zablokowany jednym przełącznikiem, stosuj gotowe ustawienie jednym kliknięciem (blokuj trenowanie, restrykcyjne, blokuj wszystko, zezwól na wszystko, blokuj Bytespider), podglądaj robots.txt na żywo i zapisuj plik bez ruszania reszty.

03

Blokada HTTP 403

Niektóre boty ignorują robots.txt (Bytespider, anthropic-ai legacy). Blokada HTTP zwraca 403 jeszcze przed wyrenderowaniem strony, oszczędza zasoby serwera i realnie uniemożliwia scrapowanie.

04

Selektywne blokowanie per ścieżka

Zezwól na przykład ClaudeBotowi na karty produktów, ale zablokuj go na blogu. Wzorce wildcard gwiazdka i koniec łańcucha dolar, jak w klasycznym robots.txt.

05

Statystyki crawlowania

Pulpit z KPI (wizyty 30 dni, unikalne boty, zablokowane trafienia), wykres dziennego ruchu, top boty, top odwiedzane adresy URL, dziennik ostatnich wizyt z IP i statusem.

06

Import logów Apache i Nginx

Czyta plik logu dostępu w formacie combined, aby retroaktywnie zliczyć wizyty AI, także te sprzed instalacji. Przyrostowe parsowanie z zapisanym offsetem: żadnych duplikatów, bezpieczne ponowne odczyty. Automatyczne wykrywanie typowych ścieżek (o2switch, cPanel, Apache, Nginx).

Wersja pełna

Wszystko, co warto wiedzieć, zanim zainstalujesz.

Szczegółowe spojrzenie na to, jak działa AI Crawler Manager: PrestaShop 8 i 9, dlaczego zbudowaliśmy go w ten sposób i jaka myśl stoi za powyższymi funkcjami.

§ 01

Po co zarządzać botami AI w 2026

W dwa lata crawlery AI przeszły ze statusu ciekawostki do roli głównego konsumenta pasma na wielu sklepach e-commerce. GPTBot od OpenAI, ClaudeBot od Anthropic, Google-Extended, Applebot-Extended, PerplexityBot, Bytespider od ByteDance i dwadzieścia innych codziennie zasysają Twoje karty produktów, opisy, ceny, opinie klientów i artykuły blogowe. Trzy zastosowania: trenowanie przyszłych dużych modeli językowych, zasilanie w czasie rzeczywistym odpowiedzi asystentów konwersacyjnych (ChatGPT, Claude, Perplexity), budowanie nowych wyszukiwarek AI.

§ 02

Problem ręcznego robots.txt

Zablokowanie bota AI przez robots.txt wymaga znajomości jego dokładnego user-agenta (czasem kilku na jednego wydawcę, część zmieniana bez zapowiedzi), utrzymywania tej listy na bieżąco i świadomości, że nie wszystkie boty respektują robots.txt. Bytespider słynie z ignorowania go, anthropic-ai legacy respektuje go tylko częściowo. Bez dedykowanego narzędzia administrator żongluje plikami tekstowymi, rozproszoną dokumentacją i logami serwera.

§ 03

Co robi AI Crawler Manager

Moduł instaluje ponad 30 gotowych botów AI z ich poprawnymi user-agentami na maj 2026, oficjalną dokumentacją i kategorią zastosowania (trenowanie, asystent, wyszukiwanie, crawlowanie). Administrator zezwala lub blokuje każdego bota jednym wizualnym przełącznikiem, stosuje gotowe ustawienie jednym kliknięciem, podgląda wynikowy robots.txt i zapisuje go bez ryzyka dzięki znacznikom wartowniczym, które zachowują istniejące ręczne dyrektywy.

§ 04

Blokada HTTP dla opornych botów

Dla botów ignorujących robots.txt hook actionDispatcherBefore wykrywa user-agenta już przy pierwszym żądaniu i zwraca kod HTTP 403 przed jakimkolwiek przetwarzaniem PrestaShop. Serwer oszczędza cykle CPU, baza danych nie jest odpytywana, bot jest naprawdę zablokowany.

§ 05

Statystyki z dwóch źródeł

Pierwsze źródło: śledzenie w czasie rzeczywistym przez hook PrestaShop, które zapisuje każdą wykrytą wizytę AI z adresem URL, IP, user-agentem, statusem HTTP i znacznikiem czasu. Drugie źródło: import pliku logu dostępu Apache lub Nginx w formacie combined, z bezpiecznym parsowaniem przyrostowym (offset w bajtach zapisany, nigdy podwójnego odczytu). Moduł automatycznie wykrywa typowe ścieżki (ukośnik var ukośnik log, ukośnik home ukośnik logs na o2switch, ukośnik home ukośnik user ukośnik access myślnik logs na cPanel).

§ 06

Granularność per ścieżka

Dla przypadków, gdy chcesz zezwolić botowi tylko na wybrane strefy (na przykład Anthropic na karty produktów, aby polecał je w Claude, ale nie na blog, aby nie oddać treści redakcyjnej), zakładka Reguły pozwala definiować zezwolenia lub zakazy per ścieżka URL ze wzorcami wildcard i końcem łańcucha, dokładnie jak w klasycznym robots.txt.

§ 07

Solidna architektura

PSR-4 pod namespace DataFirefly ukośnik AiCrawlerManager, wbudowany własny autoloader (żaden composer install przy wdrożeniu nie jest potrzebny), 5 tabel z utf8mb4 i odpowiednimi indeksami, 6 kontrolerów admina pod AdminParentConfigure, oddzielne szablony Smarty, minimalistyczny CSS i JS (natywny wykres canvas, zero zewnętrznych zależności), dołączone tłumaczenia FR i EN. Zgodność z PrestaShop 8.0 do 9.x przez legacy ModuleAdminController.