TontonTools
搜索引擎优化

如何编写 robots.txt 文件(带有示例)

Enyong Carinton Tegum· March 12, 2026· 1 分钟阅读时间
Robot representing search engine crawler automation
Photo by Tara Winstead on Pexels

robots.txt 文件是一个微小的文本文件,但功能强大:它告诉搜索引擎抓取工具可以访问您网站的哪些部分,不可以访问。使用得当,它可以让爬虫专注于重要的事情。如果使用不当,一行可能会意外地向 Google 隐藏您的整个网站。以下是正确的方法。

robots.txt 做什么(和不做什么)

它位于您的域根目录 (yoursite.com/robots.txt),并提供抓取说明。至关重要的是,它控制抓取,而不是索引——robots.txt 中阻止的页面如果其他网站链接到该页面,仍然会出现在结果中。要真正使页面不被搜索,请改用 noindex 元标记。 Google 的 robots.txt 文档清楚地说明了这一点。

基本语法

两个主要指令:User-agent(规则适用于哪个爬虫)和Disallow(不爬网)。一个简单的文件,允许一切:

用户代理:*
禁止:

还有一个阻止所有爬虫访问私人文件夹的方法:

用户代理:*
禁止:/private/

危险的错误

这一行会阻止每个抓取工具访问您的整个网站

用户代理:*
禁止:/

在从暂存环境迁移的网站上,这是一种常见的事故,在暂存环境中,阻止所有内容都是故意的。在启动之前和之后务必仔细检查此行 - 这是新网站从未出现在 Google 上的首要原因。

添加您的站点地图

最佳做法是将抓取工具从 robots.txt 指向您的站点地图:

站点地图:https://yoursite.com/sitemap.xml

无风险地生成它

我们的免费 robots.txt 生成器不是手动编辑和希望,而是通过简单的选项构建正确的文件,因此您不会意外阻止错误的内容。将其与 XML 站点地图配对以实现完整的抓取控制。

允许规则和爬虫特定的块

除了Disallow之外,您还可以使用Allow来排除例外情况 - 例如,阻止整个文件夹但允许其中的一个文件。您还可以按名称定位特定的抓取工具:User-agent: Googlebot 块仅适用于 Google,而 User-agent: * 则涵盖其他所有人。例如,这可以让您允许 Google 完全访问,同时限制更具攻击性的机器人。规则按照最具体的方式进行匹配,因此命名爬虫遵循自己的块并忽略通配符块。

管理大型网站的抓取预算

在大型网站上,robots.txt 具有性能作用:它可以阻止抓取工具在低价值 URL(分面搜索参数、内部搜索结果、无尽的过滤器组合)上浪费时间,因此它们可以将有限的“抓取预算”花在重要的页面上。对于小型网站来说,这很少是一个问题,但随着您的成长,阻止抓取陷阱可以让 Google 专注于您的重要内容,而不是数百万个几乎相同的参数网址。

在信任之前进行测试

因为错误的一行可能会隐藏您的整个网站,所以切勿盲目编辑 robots.txt。 Google Search Console 包含 robots.txt 报告,该报告显示 Google 如何读取您的文件并标记错误。进行任何更改后,请检查您想要编入索引的页面是否被意外阻止,并确认您的站点地图行指向实时站点地图 URL。两分钟的测试可以防止最具破坏性的 SEO 错误。

底线

robots.txt 引导抓取工具到达网站的正确部分 - 但请记住,它控制抓取,而不是索引,并且 Disallow: / 会隐藏所有内容。仔细生成它,链接您的站点地图,并在每次启动后验证它。这一行文字可以提高或降低您的知名度。

Share X / Twitter Facebook LinkedIn WhatsApp

继续阅读

← 返回所有帖子

We use cookies for analytics and to keep the tools free via ads. See our Privacy Policy.