爬虫测试用各家公开的 User-Agent 从我们的服务器发请求,能查出按 UA 拦截的规则(ModSecurity、宝塔等)。Cloudflare、Wordfence 这类防护会校验爬虫 IP,我们的伪装请求被它拦下时标为“无法判断”,真实爬虫通常不受影响。
常见问题
三项测试分别是什么意思?
爬虫能否访问:用该来源公开的爬虫 User-Agent 请求页面,403、406 说明按 UA 拦截了。搜索里有没有:用页面标题让该来源搜一次,看结果里有没有这页。robots.txt:读当前线上文件,按该来源的爬虫名判断。
robots.txt 允许,但爬虫被拒,怎么回事?
robots.txt 只说“可以抓什么”,服务器决定“实际给什么”。防火墙、WAF、安全插件和 CDN 都在 robots.txt 之前起作用,修复要去拦截的那一层放行对应的 User-Agent。
爬虫能访问,但搜索里没有,怎么回事?
能访问只说明没被拦,不代表已收录。搜索索引有延迟,新页面和外链少的页面可能几周都不出现,过段时间重测。
