GEO Robots.txt 检查器
检查您的 robots.txt 是否已准备好进行生成引擎优化。立即查看哪些人工智能搜索和训练机器人可以访问您的网站。
什么是生成式引擎优化 (GEO)?
GEO 是一种优化网站的实践,以便它可以被人工智能驱动的搜索引擎和聊天助手(ChatGPT、Claude、Perplexity、Google AI Overviews、Meta AI 等)发现、引用和引用。第一个先决条件是您的 robots.txt 必须允许这些机器人。
该检查器检查对 GEO 重要的 19 个爬虫程序,包括 AI 训练爬虫程序(GPTBot、ClaudeBot、Google-Extended)、AI 搜索爬虫程序(OAI-SearchBot、PerplexityBot、Claude-SearchBot)、用户触发的抓取程序(ChatGPT-User、Claude-User)和经典搜索爬虫程序(Googlebot、Bingbot),并准确显示您的网站允许哪些爬虫程序。
机器人参考
主要的谷歌搜索爬虫——永远不要阻止它。
控制 Google 是否使用您的内容来训练 Gemini / Bard。
OpenAI 爬虫用于收集用于训练 GPT 模型的内容。
OpenAI 爬虫为 ChatGPT 搜索结果和引文提供支持。
当用户请求 ChatGPT 访问页面时按需获取 URL。
人类爬虫用于收集训练克劳德的内容。
克劳德网络搜索结果的人类爬虫。
当 Claude 用户共享或请求 URL 时按需获取。
Perplexity 爬虫为其 AI 答案引擎提供动力。
用户触发的 Perplexity 对话内的获取。
用于Meta AI、Llama 训练和产品功能的Meta 爬虫。
控制 Apple 是否可以使用您的内容进行 Apple Intelligence 培训。
用于 Alexa 和其他人工智能功能的亚马逊爬虫。
字节跳动/TikTok爬虫用于训练豆宝及相关模型。
Common Crawl——几乎每个LLM都在某个时候使用的开放数据集。
常见问题解答
关于此 GEO Robots.txt 检查器
该检查器专为致力于生成引擎优化的 SEO 和内容团队而构建。您无需手动读取 robots.txt 文件并交叉引用机器人名称,而是可以立即获得 19 个重要爬虫的颜色编码结论,包括经典爬虫(Googlebot、Bingbot)以及来自 OpenAI、Anthropic、Google、Meta、Apple、Amazon、ByteDance、Perplexity 和 Common Crawl 的每个相关 AI 搜索/训练机器人。
解析器遵循 Google 风格的 robots.txt 评估:基于子字符串的用户代理匹配、路径评估中的最长规则获胜以及通配符回退到用户代理:*。它还检测新兴的 Content-Signal 指令并列出每个声明的 Sitemap: 引用。