Google 抓取限制检查器
Googlebot 在 2MB 后停止解析 HTML。检查您的页面是否超出此限制并确定哪些页面占用的空间最多。
关于此工具
Googlebot 在抓取网页时存在技术限制:它会在 2MB(2,097,152 字节)后停止解析 HTML。这意味着,如果您网页的 HTML 超过此限制,Google 不会将您的部分内容编入索引,从而可能会影响您的 SEO 性能。
它是如何运作的
- 获取 Googlebot 看到的页面 HTML(在 JavaScript 执行之前)
- 使用 UTF-8 编码计算准确的字节大小
- 分析哪些内容消耗空间:内联脚本、样式、base64 图像、SVG 图形等。
- 使用特定 CSS 选择器识别前 10 个最大的 HTML 元素
- 生成按优先级排列的可行建议
- 显示不计入限制的外部资源(脚本、CSS、图像)
什么算作 2MB 限制?
计数达到极限
- • 内联 JavaScript(没有 src 的脚本标签)
- • 内联 CSS(样式标签和样式属性)
- • HTML/CSS 中的 Base64 编码图像
- • 内嵌 SVG 图形
- • 所有文本内容和 HTML 结构
- • HTML 注释和空格
不算数
- • 外部 JavaScript 文件(脚本 src="...")
- • 外部 CSS 文件(链接 rel="stylesheet")
- • 外部图像 (img src="...")
- • 外部字体、视频和其他媒体
- • 通过 AJAX/fetch 加载内容
- • JavaScript 呈现的内容
专业提示: 保持在限制范围内的最佳方法是将大型内联脚本和样式外部化到单独的 .js 和 .css 文件中。这也提高了缓存和页面加载性能!
常见问题解答
Google 引入此限制是为了防止非常大的 HTML 文件在抓取过程中消耗过多的资源。大于 2MB 的页面很少见,通常表明存在优化机会。 Googlebot 仍会对前 2MB 建立索引,但该点之后的内容可能不会建立索引。
Googlebot 将在 2MB 后停止解析您的 HTML,这意味着此后的重要内容、链接或结构化数据将不会被看到或编入索引。这会显着影响您的 SEO。该工具可以识别哪些内容正在消耗空间,以便您可以进行相应的优化。
不!外部 JavaScript 文件、CSS 样式表和通过 URL 加载的图像不计入 2MB HTML 限制。只有原始 HTML 内容本身才算数。这就是为什么外部化内联脚本和样式是一种有效的优化策略。
非常准确!该工具完全按照 Googlebot 所看到的方式获取您的页面,并使用 UTF-8 编码(与 Google 使用的方法相同)计算原始 HTML 大小。它在 JavaScript 执行之前分析 HTML,与 Google 的初始抓取行为相匹配。
请遵循该工具提供的建议:外部化内联 JavaScript 和 CSS、将 Base64 图像转换为文件、优化或删除大型 SVG、删除 HTML 注释以及缩小 HTML。这些优化还提高了页面加载性能!
是的!分析页面后,您可以将所有结果导出为 CSV 格式,包括 HTML 大小、按类别细分、顶部空间消费者和推荐。这对于跟踪一段时间内的进度或与开发团队共享非常有用。
reCAPTCHA 有助于防止自动滥用并确保该工具由真实用户使用。获取和分析网页需要服务器资源,因此这种保护可以维持每个人的服务质量。