如何使用Robots.txt 生成器
- 选择默认策略 - 对于实时网站“允许全部”,仅对于临时/私有网站“禁止全部”。
- 列出要阻止的路径,每行一个:/admin/、/cart/、/search - 每一条都成为禁止规则。
- 粘贴您的站点地图 URL(例如 https://yoursite.com/sitemap.xml),以便抓取工具会找到每个页面。
- 复制生成的文件并将其作为 robots.txt 上传到您的网站根目录,然后使用 Google Search Console 的 robots.txt 报告进行测试。
Robots.txt 生成器是什么?
robots.txt 生成器会构建一个小文本文件,告诉搜索引擎爬虫它们可能会访问您网站的哪些部分。该文件位于您的域根目录 (example.com/robots.txt) 并使用简单的指令语法。大多数网站需要的标准示例:
用户代理:*允许:/禁止:/admin/站点地图:https://example.com/sitemap.xml
这说明:所有爬虫 (*) 都可以抓取除 /admin/ 之外的所有内容,这是站点地图。不过,如果语法稍有错误——错误的 Disallow: / 就是典型的灾难——你就可以取消整个网站的索引。生成文件胜过手动输入。
关于Robots.txt 生成器
选择您的默认策略(全部允许或禁止全部),列出要阻止的所有路径(每行一个,例如 /admin/ 或 /cart/),然后添加您的站点地图 URL,正确的 robots.txt 将显示为可供复制。
这涵盖的常见 robots.txt 示例:标准站点(允许所有内容、阻止管理和结账路径、声明站点地图);暂存站点(禁止:/ 将测试版本排除在 Google 之外 - 只需记住在启动时将其删除);和 WordPress 风格的设置(阻止 /wp-admin/,同时保持内容可爬行)。将结果作为 robots.txt 上传到您的网站根目录 - 它必须位于顶层,而不是子文件夹中。
值得了解的一个边界:robots.txt 控制抓取,而不是索引 - 如果其他网站链接到某个被阻止的网址,该网址仍可能出现在结果中。要将页面完全排除在 Google 之外,请在可抓取页面上使用 noindex 元标记。并且 robots.txt 是公开的(任何人都可以读取您的),因此切勿在其中列出秘密路径。
常见问题解答
Learn more
如何编写 robots.txt 文件(带有示例)
robots.txt 控制搜索引擎抓取的内容。如果出错,您可能会隐藏整个网站。以下是如何正确编写一个并举例说明。
Read the guide