怎样建博客,怎样核对抓取限制:先查这五项

📍 WDQWDWQD987AAAAA:216.73.217.58
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /cc8ea608aacd.html
📄

怎样建博客,怎样核对抓取限制:先查这五项

核对抓取限制,就是确认搜索引擎能否正常访问你的博客页面。最直接的方法是查看 robots.txt 是否屏蔽了整站或关键目录,再检查页面 HTML 里有没有 noindex 或 nofollow,最后用搜索引擎提供的抓取测试工具验证具体 URL。时间人手有限时,按“先全站、后单页、再服务器”的顺序处理,能最快排除致命问题。

第一项:检查 robots.txt 是否放行

要查什么:博客根目录下的 robots.txt 有没有出现 Disallow: /,或者屏蔽了文章、分类、标签等目录。

怎么查:在浏览器打开 你的域名/robots.txt,逐行看 Disallow 规则。如果写的是 Disallow: /,整站都不允许抓取;如果写的是 Disallow: /tags/,只有标签页被挡。

结果说明什么:出现整站屏蔽,先删掉或改成放行,否则后续所有优化都没有意义。只屏蔽了部分目录,则要判断这些目录是否包含你希望被收录的文章列表页。若博客刚建立,建议先全部放行,等内容结构稳定后再考虑屏蔽低价值页面。

第二项:检查页面级 noindex 标签

要查什么:文章页 HTML 的 <head> 区域有没有 <meta name="robots" content="noindex">。

怎么查:在浏览器打开一篇文章,按 Ctrl+U 查看源代码,搜索 noindex。也可以在浏览器控制台输入 document.querySelector('meta[name="robots"]') 查看返回值。

结果说明什么:如果返回的 content 包含 noindex,该页面即使被抓取也不会进入索引。常见原因是博客后台的“搜索引擎可见性”开关被关闭,或主题模板、SEO 插件默认给某些页面加了 noindex。检查后台阅读设置和插件设置,把需要收录的文章类型改为允许索引。

第三项:检查 HTTP 状态码与跳转链

要查什么:博客首页和几篇代表性文章返回的是 200、301 还是 404、403、500。

怎么查:用浏览器开发者工具的 Network 面板刷新页面,看第一条请求的状态码;或者用命令行 curl -I 你的文章网址 查看响应头。重点看是否有多次 301 跳转,以及最终落地页是否返回 200。

结果说明什么:返回 200 表示页面可正常访问;返回 403 或 500 说明服务器拒绝了抓取请求,需要检查防火墙、安全插件或服务器配置;跳转链超过两三次会浪费抓取配额,应改成直接跳转。若首页正常而文章页 404,问题多半在固定链接规则或伪静态配置。

第四项:检查抓取测试工具的实际结果

要查什么:搜索引擎抓取工具对具体 URL 的判定,包括能否抓取、是否被 robots.txt 拦截、渲染后的 HTML 里有没有 noindex。

怎么查:在搜索引擎站长平台的抓取测试或网址检查功能里输入一篇文章的完整 URL,分别查看“抓取”“robots.txt”“索引”几个判断项。不同搜索引擎的入口名称不一样,以你实际使用的平台为准。

结果说明什么:如果工具显示“已被 robots.txt 屏蔽”,回到第一项修改;如果显示“可抓取但未索引”,说明抓取限制不是主因,应转向内容质量和内链问题。注意工具结果反映的是测试时刻的状态,修改 robots.txt 或标签后需要重新测试确认。

第五项:检查服务器日志里的真实抓取记录

要查什么:搜索引擎爬虫是否真的来过,访问了哪些 URL,返回了什么状态码。

怎么查:在服务器或主机的访问日志里筛选爬虫 User-Agent,比如包含 Googlebot、Bingbot 的记录。看这些请求的响应码分布,以及是否大量集中在少数页面。

结果说明什么:如果日志里几乎没有爬虫记录,说明抓取入口可能被阻断,优先回到第一、三项排查;如果爬虫频繁访问却大量返回 404 或 301,说明站点结构或链接有问题。日志是判断“已经发生的事实”的依据,比单次工具测试更能反映长期状态。

按顺序执行的判断原则

下一步:打开你博客的 robots.txt,确认没有 Disallow: /,然后挑一篇最想被收录的文章,用抓取测试工具跑一遍,把返回的每一项判断结果记下来,再决定改哪里。

图1 图2

nginx