网站

控制AI爬虫和搜索机器人

The Crawlers tab controls which automated visitors are allowed to index your site, grouped into search engines, AI answer engines, SEO tools, and social preview bots. This guide explains what each…

控制 AI 爬虫和搜索机器人

Crawlers 标签控制允许哪些自动化访问者为您的网站编制索引,分为搜索引擎、AI 答案引擎、SEO 工具和社交预览机器人。本指南说明每个组的作用、Kapsule 的默认允许设置,以及阻止实际会给您带来什么成本。

Crawler 设置在 KPanel 中的位置

  1. 登录 KPanel
  2. 点击左侧边栏中的网站,然后点击该网站。
  3. 在网站的标签栏中,打开性能,然后打开 Crawlers

直接地址是 /websites/<site-id>/crawlers

KPanel 中网站的 Crawler 控制

此页面实际更改的内容

切换一个组会重写您网站的 robots.txt 文件。该文件是向表现良好的自动化访问者发出的公开请求,主要爬虫会遵守它。

随之而来有两个结果,两者都很重要。

这是一个请求,而不是防火墙。 忽略 robots.txt 的爬虫不受此页面上任何设置的影响。如果您的问题是被某个不诚实标识自己的东西抓取,这不是正确的工具:请改用网站安全页面上的 IP 阻止列表或国家过滤。请参阅网站安全网站国家阻止

它控制爬行,而不是已编制索引的内容。 阻止爬虫会停止未来的抓取。已在索引中的内容通常会随着时间推移而失效,但不会立即失效。

更改在您切换开关的那一刻保存。页面显示保存中,然后已保存,robots.txt 已更新

四个组

搜索引擎。 传统的爬虫,提供普通搜索结果:Googlebot、Bingbot、DuckDuckBot、Applebot 和 YandexBot。

AI 搜索和答案引擎。 为在 AI 生成的答案和搜索概览中包含您内容的系统提供爬虫:来自 OpenAI 的 GPTBot 和 OAI-SearchBot、来自 Anthropic 的 ClaudeBot 和 anthropic-ai、PerplexityBot、Google-Extended、Cohere、Meta 和 Diffbot。

SEO 和分析工具。 来自用于审计网站的平台的爬虫:AhrefsBot、SemrushBot、MJ12bot、DotBot 和 Baiduspider。

社交媒体和预览。 在有人分享链接时获取预览卡的爬虫:Twitterbot、Facebook 预览获取器、LinkedInBot、Slackbot 和 Discordbot。

每个组卡列出其中的每个爬虫及其所有者,因此您可以在切换前确切了解一个切换覆盖的内容。

Kapsule 的默认设置:允许 AI 爬虫

默认情况下允许每个组,包括 AI 爬虫,这是一个深思熟虑的立场,而非疏忽。

一些主机代表其客户悄悄阻止 AI 爬虫。我们不这样做,因为这是您的流量和您的决定,而且默认设置会使您失去可见性。AI 搜索结果是真实且不断增长的推荐来源。AI 系统无法读取的网站不会出现在这些答案中,这意味着它不会获得该流量。

如果您想阻止它们,控制就在这里。我们只是不会在不告诉您的情况下为您做出选择。

为每个组做出决定

搜索引擎。 除非网站确实是私密的,否则请保持允许,这种情况下密码保护是正确的工具。请参阅密码保护网站

AI 搜索和答案引擎。 这是页面上的真正决定。

如果您想获得来自 AI 答案的流量和引用,请允许它们,这适用于几乎每个商业网站、发布商和服务企业。

如果您的内容是您的产品,并且被总结会消除访问的理由,如果您有关于如何重复使用内容的合同或许可限制,或者如果您已对 AI 培训做出了深思熟虑的编辑选择,请考虑阻止它们。

对交易要诚实。阻止意味着您的网站从 AI 生成的搜索概览和答案中消失,这是可衡量的流量损失,而不是理论上的风险。

SEO 和分析工具。 最能辩护的阻止组。它们不会直接为您提供任何东西:它们让其他人审计您的网站,并且在大型网站上可能会增加真实的爬行负载。阻止它们意味着您的网站在竞争对手的研究工具中的可见度较低,有些人认为这是一个功能。成本是您自己的 SEO 工具可能也会丢失有关您网站的数据。

社交媒体和预览。 除非您从不想要链接预览,否则请保持允许。阻止这些意味着在社交平台和聊天应用上共享的指向您网站的链接显示为没有标题、描述或图像的纯 URL,这会明显减少点击。

一次阻止所有 AI 爬虫

在页面底部有一张危险区卡,阻止所有 AI 爬虫。它在一个操作中为 AI 组中的每个爬虫添加不允许规则。

点击它首先会要求确认,确认清楚地说明了后果:您的网站将从 AI 搜索概览中消失,这会造成真实的流量损失。

这是流量决定,而不是安全决定。阻止 AI 爬虫不能保护您的内容不被复制:任何人仍然可以阅读您的页面,恶意行为者从来不会遵守 robots.txt。它可靠地做的是将您从 AI 生成的答案中删除。确保这是您想要的交易。

该操作是可逆的。将 AI 组切换回开,下次保存时不允许规则将被删除。之后重新进入索引需要时间。

谁可以更改此设置

更改爬虫设置需要网站写入权限。使用只读角色时,开关被禁用,悬停一个开关时会解释原因。请要求账户所有者进行更改或调整您的角色。

故障排除

我阻止了一个组,但爬虫仍在访问。 表现良好的爬虫会定期重新读取 robots.txt,而不是在每次请求前读取,所以请耐心等待。如果它从未停止,爬虫不遵守该文件,您需要访问控制代替。请参阅网站安全

我的页面在阻止后仍在搜索结果中。 阻止停止未来的爬行。现有索引条目随时间推移而过期。要快速删除内容,请使用搜索引擎自己的删除工具。

链接预览停止工作。 社交组被阻止了。将其重新打开。

我的 SEO 工具对我的网站没有数据。 SEO 组被阻止,这会影响您的工具和其他人的工具。

更改此处的某些内容后流量下降。 检查哪些组被阻止。如果搜索或 AI 关闭,这就是原因,将其重新打开会开始恢复。

我关心的爬虫未在列表中。 这些组涵盖主要的命名爬虫。未列出的任何内容都属于文件顶部的常规允许规则,不会被这些切换阻止。

我的网站根本未被索引,这里的所有内容都被允许。 其他东西在阻止它。检查是否启用了整个网站密码保护,国家过滤是否阻止爬虫的区域,或网站是否使用共享地址而不是您自己的域。

相关页面

仍需帮助?

请发送邮件至 support@kapsulehost.com 或在 KPanel 中打开聊天。

打开 KPanel