很多站点用安全插件"一刀切"屏蔽了AI爬虫,GEO直接归零。robots.txt是AI爬虫进门的"第一道闸门",开错了门就白做了。
完整配置模板
```
# 放行字节跳动爬虫(豆包/头条搜索)
User-agent: Bytespider
Allow: /
# 放行其他主流AI爬虫
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Baiduspider
Allow: /
# 屏蔽后台与接口路径(对所有爬虫生效)
Disallow: /admin/
Disallow: /api/
User-agent: *
Allow: /
Sitemap: https://你的域名/sitemap.xml
```
三个关键要点
- 正文页必须Allow:AI爬虫抓取的是公开内容页,屏蔽了就等于退出AI生态;
- 后台路径要Disallow:/admin、/api等敏感路径必须屏蔽,防止后台数据被抓取;
- 配合限流而非屏蔽:Bytespider抓取激进,应在CDN/Nginx层对Bytespider UA限速(≤2请求/秒),超频返回429——既保收录资格又防源站过载。
配置完怎么验证?
访问"你的域名/robots.txt"确认能打开;用站长平台的"robots测试"工具检查是否生效;等待几天后在服务器日志里 grep "Bytespider" 确认爬虫开始访问。