每次抓取的结果
全部抓取记录
| 抓取批次 | 抓取时间(UTC) | 结果 | URL |
|---|
保存的副本(已禁用脚本)
常见问题
为什么我的网页不在里面?
多数情况是没轮到。Common Crawl 每次只抓一部分网页,外链少的网站概率更低,“本次未抓取”不代表有问题。需要处理的只有两种:被服务器拦截,或 robots.txt 禁止了 CCBot。
被拦截了怎么修复?
在拦截的那一层(主机防火墙、WAF、安全插件、CDN)放行 User-Agent 含 CCBot 的请求,改 robots.txt 没用。改完后运行下面的命令,返回 200 即可,Common Crawl 要到下一批抓取才会重新访问。
curl -I -A "CCBot/2.0 (https://commoncrawl.org/faq/)" https://你的域名/
被收录是不是等于 AI 学过我的网页?
不是。Common Crawl 只是原始数据,各家模型用之前会按语言、质量、重复度筛选。被收录只是进入候选范围,没被收录则基本没有机会通过这条渠道进入训练数据。
