查询范围
抓取批次

免费,无需注册。查询直接从你的浏览器发往 Common Crawl 官方索引,我们不保存查询记录。

常见问题

为什么我的网页不在里面?

多数情况是没轮到。Common Crawl 每次只抓一部分网页,外链少的网站概率更低,“本次未抓取”不代表有问题。需要处理的只有两种:被服务器拦截,或 robots.txt 禁止了 CCBot。

被拦截了怎么修复?

在拦截的那一层(主机防火墙、WAF、安全插件、CDN)放行 User-Agent 含 CCBot 的请求,改 robots.txt 没用。改完后运行下面的命令,返回 200 即可,Common Crawl 要到下一批抓取才会重新访问。

curl -I -A "CCBot/2.0 (https://commoncrawl.org/faq/)" https://你的域名/

被收录是不是等于 AI 学过我的网页?

不是。Common Crawl 只是原始数据,各家模型用之前会按语言、质量、重复度筛选。被收录只是进入候选范围,没被收录则基本没有机会通过这条渠道进入训练数据。

滚动至顶部