Siti web

Controllare i crawler AI e i bot di ricerca

The Crawlers tab controls which automated visitors are allowed to index your site, grouped into search engines, AI answer engines, SEO tools, and social preview bots. This guide explains what each…

La scheda Crawlers controlla quali visitatori automatici possono indicizzare il tuo sito, raggruppati in motori di ricerca, motori di risposta AI, strumenti SEO e bot di anteprima social. Questa guida spiega cosa fa ogni gruppo, cosa consente Kapsule per impostazione predefinita e quale sia il costo reale del blocco.

Dove si trovano le impostazioni dei Crawler in KPanel

  1. Accedi a KPanel.
  2. Fai clic su Websites nella barra laterale sinistra, quindi fai clic sul sito.
  3. Nella scheda del sito, apri Performance, quindi Crawlers.

L'indirizzo diretto è /websites/<site-id>/crawlers.

Controlli dei crawler per un sito in KPanel

Cosa cambia effettivamente questa pagina

L'attivazione o la disattivazione di un gruppo riscrivi il file robots.txt del tuo sito. Quel file è una richiesta pubblicata ai visitatori automatici ben educati, e i principali crawler la rispettano.

Ne seguono due conseguenze, entrambe importanti.

È una richiesta, non una barriera. Un crawler che ignora robots.txt non è influenzato da nulla su questa pagina. Se il tuo problema è lo scraping da parte di qualcosa che non si identifica onestamente, questo non è lo strumento giusto: usa invece l'elenco di blocco IP o il filtro geografico nella pagina Security del sito. Vedi Site Security e Country Blocking for a Site.

Controlla il crawling, non ciò che è già indicizzato. Il blocco di un crawler interrompe i recuperi futuri. Il contenuto già in un indice di solito scompare nel tempo, ma non istantaneamente.

Le modifiche vengono salvate nel momento in cui attivi un interruttore. La pagina mostra Saving, quindi Saved, robots.txt updated.

I quattro gruppi

Motori di ricerca. I crawler tradizionali dietro i risultati di ricerca ordinari: Googlebot, Bingbot, DuckDuckBot, Applebot e YandexBot.

Motori di ricerca e risposta AI. Crawler per sistemi che includono il tuo contenuto nelle risposte generate dall'AI e nelle panoramiche di ricerca: GPTBot e OAI-SearchBot di OpenAI, ClaudeBot e anthropic-ai di Anthropic, PerplexityBot, Google-Extended, Cohere, Meta e Diffbot.

Strumenti SEO e analytics. Crawler da piattaforme utilizzate per controllare i siti: AhrefsBot, SemrushBot, MJ12bot, DotBot e Baiduspider.

Social media e anteprima. Crawler che recuperano una scheda di anteprima quando qualcuno condivide un collegamento: Twitterbot, il recuperatore di anteprima di Facebook, LinkedInBot, Slackbot e Discordbot.

Ogni scheda di gruppo elenca ogni crawler in esso, con il suo proprietario, così puoi vedere esattamente cosa copre un interruttore prima di attivarlo.

Predefinito di Kapsule: i Crawler AI sono consentiti

Ogni gruppo è consentito per impostazione predefinita, inclusi i crawler AI, ed è una posizione deliberata piuttosto che un'inadvertenza.

Numerosi host bloccano silenziosamente i crawler AI per conto dei loro clienti. Noi no, perché è il tuo traffico e la tua decisione, e perché l'impostazione predefinita ti costa visibilità. I risultati di ricerca AI sono una fonte reale e crescente di rinvii. Un sito che i sistemi AI non riescono a leggere non appare in quelle risposte, il che significa che non riceve quel traffico.

Se vuoi bloccarli, il controllo è proprio qui. Semplicemente non faremo quella scelta per te senza dirti.

Decidere per ogni gruppo

Motori di ricerca. Lascia consentito a meno che il sito non sia veramente privato, nel qual caso la protezione con password è comunque lo strumento giusto. Vedi Password-Protecting a Site.

Motori di ricerca e risposta AI. Questa è la vera decisione sulla pagina.

Consentili se vuoi traffico e citazioni dalle risposte AI, il che è il caso per quasi tutti i siti commerciali, gli editori e le aziende di servizi.

Considera di bloccarli se il tuo contenuto è il tuo prodotto e il fatto di essere riassunto rimuove il motivo per visitare, se hai restrizioni contrattuali o di licenza su come il contenuto può essere riutilizzato, o se hai fatto una scelta editoriale deliberata riguardante l'addestramento dell'AI.

Sii onesto sul compromesso. Bloccare significa che il tuo sito scompare dalle panoramiche di ricerca e dalle risposte generate dall'AI, ed è un traffico perso misurabile, non un rischio teorico.

Strumenti SEO e analytics. Il gruppo più difendibile da bloccare. Non ti forniscono nulla direttamente: permettono ad altre persone di controllare il tuo sito, e possono aggiungere un carico di crawl reale su un sito grande. Bloccarli significa che il tuo sito è meno visibile negli strumenti di ricerca dei concorrenti, il che alcuni considerano una caratteristica. Il costo è che i tuoi stessi strumenti SEO potrebbero anche perdere dati sul tuo sito.

Social media e anteprima. Lascia consentito a meno che tu non voglia mai anteprime di collegamento. Bloccare questi significa che i collegamenti al tuo sito condivisi su piattaforme social e app di chat appaiono come URL nudi senza titolo, descrizione o immagine, il che riduce misurabilmente il click-through.

Bloccare tutti i Crawler AI contemporaneamente

In fondo alla pagina c'è una scheda zona di pericolo, Block all AI crawlers. Aggiunge regole di disallow per ogni crawler nel gruppo AI in un'unica azione.

Fare clic su di essa chiede prima una conferma, e la conferma espone la conseguenza chiaramente: il tuo sito scomparirà dalle panoramiche di ricerca AI, e questo costa traffico reale.

Questa è una decisione di traffico, non una di sicurezza. Bloccare i crawler AI non protegge il tuo contenuto dall'essere copiato: chiunque può ancora leggere le tue pagine, e un cattivo attore non avrebbe mai onorato robots.txt in primo luogo. Quello che affidabilmente fa è rimuoverti dalle risposte generate dall'AI. Assicurati che questo sia il compromesso che vuoi.

L'azione è reversibile. Attiva di nuovo il gruppo AI e le regole di disallow vengono rimosse al prossimo salvataggio. Il re-inserimento in un indice in seguito richiede tempo.

Chi può modificare questa impostazione

La modifica delle impostazioni dei crawler necessita il permesso di scrittura del sito. Con un ruolo di sola lettura gli interruttori sono disabilitati, e passandone uno sopra con il mouse spiega il motivo. Chiedi a un proprietario dell'account di apportare la modifica o di regolare il tuo ruolo.

Risoluzione dei problemi

Ho bloccato un gruppo ma il crawler sta ancora visitando. I crawler ben educati rileggono robots.txt periodicamente piuttosto che prima di ogni richiesta, quindi dai tempo. Se non si ferma mai, il crawler non sta onorando il file e hai bisogno di un controllo di accesso. Vedi Site Security.

Le mie pagine sono ancora nei risultati di ricerca dopo il blocco. Il blocco interrompe il crawling futuro. Le voci di indice esistenti scadono nel tempo. Per rimuovere rapidamente il contenuto, usa lo strumento di rimozione del motore di ricerca stesso.

Le anteprime dei link hanno smesso di funzionare. Il gruppo social è bloccato. Riattivalo.

Il mio strumento SEO non ha dati per il mio sito. Il gruppo SEO è bloccato, il che influisce sui tuoi strumenti così come su quelli di tutti gli altri.

Il traffico è diminuito dopo che ho cambiato qualcosa qui. Controlla quali gruppi sono bloccati. Se ricerca o AI sono disattivati, quella è la causa, e riattivare ripristina il recupero.

Un crawler che mi interessa non è elencato. I gruppi coprono i principali crawler nominati. Tutto ciò che non è elencato rientra nella regola di allow generale in cima al file e non viene bloccato da questi interruttori.

Il mio sito non viene indicizzato affatto e tutto è consentito qui. Qualcos'altro lo sta bloccando. Controlla se la protezione con password per l'intero sito è attiva, se il filtro geografico blocca la regione del crawler, o se il sito si trova su un indirizzo condiviso piuttosto che sul tuo dominio.

Pagine correlate

Hai ancora bisogno di aiuto?

Scrivici a support@kapsulehost.com oppure apri una chat in KPanel.

Apri KPanel
Controllare i crawler AI e i bot di ricerca