返回首页

技术指南

AI 爬虫与 robots.txt

AI 可见度的第一步不是写更多内容,而是确保重要页面没有被 robots、noindex、登录墙或客户端渲染意外挡住。

检查 crawler 可访问性

robots 控制的是访问,不是引用保证

允许 crawler 抓取只代表页面可以被访问,不代表一定被索引或引用。禁止抓取则会让页面从很多 AI 检索链路中消失。对希望被引用的公开内容,应明确允许通用搜索爬虫和目标 AI crawler 访问。

noindex 与 robots 的区别

robots.txt 通常控制 crawler 能否请求路径;页面级 noindex 控制页面是否应被索引。两者都可能影响 AI 搜索可见度。报告页、后台页、用户私有页应 noindex;公开资源页和产品页则应保持可索引。

渲染也会成为抓取门槛

如果关键内容只在客户端 JavaScript 执行后出现,部分 crawler 可能无法看到完整正文。对定义、FAQ、价格、政策和产品说明等重要内容,应优先在服务端 HTML 中输出。

核心检测项

robots.txt 是否允许重要公开页面

公开内容页是否没有 noindex

API、报告、后台和临时结果是否避免被索引

核心正文是否存在于初始 HTML

sitemap 是否列出应被发现的资源页

FAQ

应该允许所有 AI crawler 吗?

这取决于你的内容策略。希望获取 AI 搜索曝光的公开内容通常应该允许抓取;付费内容、私有内容或不希望被训练/引用的内容需要更谨慎地限制。

llms.txt 能替代 robots.txt 吗?

不能。robots.txt 是访问控制约定,llms.txt 更像是给模型和工具看的内容索引说明。两者可以互补,但不能互相替代。