技术

什么是 robots.txt 文件?你需要它吗?

网站根目录下一个小小的文本文件,悄悄为每一个访问的搜索引擎设定基本规则。

这是什么

robots.txt 是一个位于网站最根目录(地址类似 yourdomain.com/robots.txt)的纯文本文件,用来向搜索引擎爬虫——那些访问网站以读取和索引页面的自动化程序——发出指令。它通常会写着诸如「欢迎抓取本网站的全部内容」这样的话,或者列出不应被抓取的特定区域,比如内部管理后台,或者不需要出现在 Google 中的搜索结果页面。

它是一组礼貌的请求,而不是安全屏障——行为良好的爬虫(比如 Google 和 Bing 的爬虫)会遵守它,但如果有人已经知道某个页面的地址,robots.txt 实际上并不能阻止他们直接访问。

为什么重要

如果没有 robots.txt 文件,大多数爬虫会简单地认为自己可以自由抓取网站上的所有内容,对于没有什么需要排除的小型网站来说,这通常没问题。但它的缺失也意味着你在这件事上完全没有发言权——如果曾经出现一个你不想被抓取的区域(内部工具、意外公开的预发布环境、站内搜索生成的重复内容),却没有文件来说明这一点。

搜索引擎在发现一个新网站时,检查这个文件通常是它们最先做的事情之一,它也常被用来指引爬虫找到你的站点地图,从而让你的其他页面更容易被发现、更快被索引。

如何解决

  1. 创建一个名字正好是 robots.txt(全部小写)的纯文本文件。
  2. 至少要包含 User-agent: *,后面跟 Allow: /,明确允许所有爬虫访问你的整个网站。
  3. 如果有你不想被索引的特定区域,为每一个添加一行,比如 Disallow: /admin/
  4. 添加一行指向你的站点地图,例如 Sitemap: https://yourdomain.com/sitemap.xml,让爬虫能更快找到你的其他页面。
  5. 把文件上传到网站的根目录(不是任何子文件夹里),使其可以通过 yourdomain.com/robots.txt 访问——大多数网站建设工具都有专门的设置字段,无需手动上传文件。
  6. 之后在浏览器中访问该地址,确认文件能加载,并以纯文本形式显示你的规则。

看看你自己的网站是否也有这个问题

Launch Readiness 会在几秒内检测你的网站是否存在此问题以及其他约 50 个上线前的问题——免费,无需注册。

立即免费检测