这是什么
robots.txt 是一个位于网站最根目录(地址类似 yourdomain.com/robots.txt)的纯文本文件,用来向搜索引擎爬虫——那些访问网站以读取和索引页面的自动化程序——发出指令。它通常会写着诸如「欢迎抓取本网站的全部内容」这样的话,或者列出不应被抓取的特定区域,比如内部管理后台,或者不需要出现在 Google 中的搜索结果页面。
它是一组礼貌的请求,而不是安全屏障——行为良好的爬虫(比如 Google 和 Bing 的爬虫)会遵守它,但如果有人已经知道某个页面的地址,robots.txt 实际上并不能阻止他们直接访问。
为什么重要
如果没有 robots.txt 文件,大多数爬虫会简单地认为自己可以自由抓取网站上的所有内容,对于没有什么需要排除的小型网站来说,这通常没问题。但它的缺失也意味着你在这件事上完全没有发言权——如果曾经出现一个你不想被抓取的区域(内部工具、意外公开的预发布环境、站内搜索生成的重复内容),却没有文件来说明这一点。
搜索引擎在发现一个新网站时,检查这个文件通常是它们最先做的事情之一,它也常被用来指引爬虫找到你的站点地图,从而让你的其他页面更容易被发现、更快被索引。
如何解决
- 创建一个名字正好是
robots.txt(全部小写)的纯文本文件。 - 至少要包含
User-agent: *,后面跟Allow: /,明确允许所有爬虫访问你的整个网站。 - 如果有你不想被索引的特定区域,为每一个添加一行,比如
Disallow: /admin/。 - 添加一行指向你的站点地图,例如
Sitemap: https://yourdomain.com/sitemap.xml,让爬虫能更快找到你的其他页面。 - 把文件上传到网站的根目录(不是任何子文件夹里),使其可以通过
yourdomain.com/robots.txt访问——大多数网站建设工具都有专门的设置字段,无需手动上传文件。 - 之后在浏览器中访问该地址,确认文件能加载,并以纯文本形式显示你的规则。