深色模式
13 · AI 爬虫友好工程
确保 AI 够得着、读得懂你
📚 系列导航:这是《SEO/GEO 入门》的第 13 篇(共 20 篇)。上一篇你在站外攒下了链接和提及,这一篇进入 GEO 专项——先解决最基础的问题:AI 爬虫到底能不能抓到你的真实内容。下一篇:14 · 可引用内容写法。
前面几篇你为 Google 的爬虫做了不少事,但 AI 引擎派来的是另一批爬虫——GPTBot、ClaudeBot、PerplexityBot,名字你可能都没见过。多数站根本不知道自己有没有把它们挡在门外:模板自带的 robots.txt、CDN 的默认防火墙,都可能在你不知情时替你"谢绝了 AI 来访",内容写得再好也进不了答案。这一篇只干一件事:确保主流 AI 爬虫够得着、读得懂你的站,并且验证到日志层。
看完这一篇,你会拿到:
- 一张主流 AI 爬虫清单,分清训练和检索两类用途
- 一套 robots.txt 放行决策框架(全放/选择放/禁的商业权衡)
- 一个半小时上线的 llms.txt 最小实现
- 一份内容可达性四查清单 + 日志层验证方法
01 爬虫矩阵:两类用途,两种赌注
主流 AI 爬虫分两类用途(名单为 2026 上半年口径,以各平台官方文档为准):训练采集类——GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended(Gemini 训练开关),决定你进不进语料、被不被长期记住;实时检索类——OAI-SearchBot(ChatGPT 搜索)、PerplexityBot,决定你被不被现场引用。
好比图书馆的两种人:训练爬虫是采购员,把你的书收进馆藏;检索爬虫是前台查询员,读者问一句现查一次。落地动作:拿这份名单逐个对照你的 robots.txt,查清每个爬虫的待遇。
💡 一句话总结:训练爬虫管"进馆藏",检索爬虫管"被现查"——先搞清你把谁挡在了哪扇门外。
02 放行策略:商业决策,不是情绪决策
放不放行有三档:全放——内容站要的就是曝光,这是默认解;选择放——放行检索类、禁训练类,想被实时引用但不想喂语料的折中;全禁——付费内容、独家数据的商业考量,合理但要认后果。算清这笔账:禁了训练爬虫,等于退出 AI 答案里的长期席位,而竞品会补上你空出的位置。"看到 AI 白嫖内容的新闻就全禁"不是决策,是情绪。
💡 一句话总结:放行是用内容换 AI 时代的曝光席位——可以不换,但要算清代价。
03 llms.txt:提案标准的"做了不亏"
llms.txt 是放在站点根目录的一份 Markdown 文件,给 AI 列出"这个站是干什么的、重要内容在哪"。先说实话:它是提案性标准,尚未被主流引擎正式承诺采用,争议一直有。但最小实现只要半小时:一行站点说明 + 10-20 个最重要页面(标题、链接、一行描述),做了不亏。切记它是给机器的地图,不是给人的广告——"业界领先"这类形容词对机器全是噪声,只写"这里有什么、在哪"。
💡 一句话总结:llms.txt 是张成本半小时的门票——不保证有用,但便宜到不值得纠结,写成地图别写成广告。
04 可达性四查:验证到日志层才算数
robots.txt 放行只是嘴上欢迎,还要四查确认真够得着:渲染——纯客户端 JS 渲染的内容对多数 AI 爬虫是空壳(第 9 篇讲过);登录墙——核心内容别锁在登录后;CDN 拦截——防火墙可能把 AI UA 当攻击拦掉,页面上完全看不出来;响应速度——爬虫预算有限,太慢就被放弃。最终裁判是服务端日志——有 UA、有 200 状态码,才算真的够得着。
💡 一句话总结:浏览器里正常不等于爬虫够得着——渲染、登录墙、CDN、速度四查,最终以日志为准。
05 动手:放行配置 + llms.txt 上线 + 日志验证
任务:
- 对照 01 节清单检查 robots.txt,按 02 节框架做出你的放行决策并改好;
- 上线最小版 llms.txt;
- 用 curl 带 GPTBot 的 UA 请求你的首页,确认返回 200 和完整内容;
- 一周后查服务端或 CDN 日志,搜索 AI 爬虫的 UA 记录。
验收标准:日志中出现至少一种 AI 爬虫的成功抓取记录(UA + 200 状态码)。
两种结果都正常:日志里有 AI 爬虫——通路确认,进下一篇优化内容本身;一周一个都没有——先用 curl 复查是否被 CDN 拦(403 或人机验证页),确认无误就耐心等:小站被光顾的频率本来就低,两三周才见记录很正常。
06 小结
你现在应该能:报出主流 AI 爬虫名单和各自用途、为自己的站做出有依据的放行决策、半小时上线 llms.txt 最小实现、用日志验证 AI 真的够得着你。
够得着只是入场券——AI 凭什么在一堆来源里偏偏引用你?下一篇 14 · 可引用内容写法:让 AI 愿意"抄"你的作业。
📎 实战案例
一个内容站跟风全禁 AI 爬虫「保护内容」,三个月后发现竞品占满了 AI 答案里原本属于它的位置。它重新放行并上了 llms.txt、验证到日志层确认被抓取后,才慢慢夺回被引用的份额。
踩坑
- 我见过跟风全禁 AI 爬虫的站,三个月后发现竞品占满了 AI 答案里原本属于它的位置——禁不禁是商业决策,不是情绪决策。
- llms.txt 写成广告词——机器只需要"这里有什么、在哪",形容词全是噪声。
- 我的 CDN 防火墙默认把 PerplexityBot 当机器人挑战,页面看着一切正常,日志里全是 403,白白挡了六周——放行必须验证到日志层。