运营网站时,robots.txt 是管理搜索引擎爬虫访问行为的关键文件。它位于网站根目录,通过简单的指令告知爬虫哪些页面可以抓取、哪些必须跳过。理解这个文件的语法和配置思路,能帮助你的网站更高效地被搜索引擎收录,同时避免因错误设置造成流量损失。
Robots.txt 是一个遵循"Robots 排除标准"(REP)的纯文本文件。当爬虫访问你的域名时,会先行请求 https://你的域名/robots.txt,读取其中的规则后再决定抓取路径。它的核心价值在于控制抓取范围,节省服务器带宽,并引导爬虫聚焦于重要页面。
需要特别注意的是,robots.txt 的效力建立在爬虫自愿遵守的基础上。Google、Bing 等主流搜索引擎会严格执行这些规则,但一些非正规或恶意爬虫可能无视此文件。因此,不要把敏感数据或私密内容放在依赖 robots.txt 保护的目录中,真正的安全保障应依赖密码验证或其他服务端措施。
创建 robots.txt 只需任意纯文本编辑器,如记事本或代码编辑器。文件名必须严格小写,且不能有其他字符。文件包含一条或多条规则记录,每条记录由以下字段组成:
文件必须上传至网站根目录。假设你的站点为 example.com,那么文件访问地址应为 https://example.com/robots.txt。若文件被放在子目录或命名错误,爬虫会请求失败,随后可能默认为无任何限制,从而抓取全站。配置完成后,建议直接在浏览器中访问该 URL 确认内容正常返回。
允许所有爬虫抓取全站,只需一行开放指令:
User-agent: *
Allow: /
反之,若想完全禁止所有搜索引擎抓取,使用以下写法:
User-agent: *
Disallow: /
若不写 Allow 或 Disallow,留空 Disallow 同样表示允许抓取。
在同一个文件中,可以为 Googlebot、Bingbot 等不同爬虫分别设置规则。文件会按自上而下的顺序匹配,每个爬虫应用第一个匹配到其 User-agent 的记录。例如,你可以对 Googlebot 放开全部权限,同时限制其他爬虫访问特定目录。
在 robots.txt 末尾添加 Sitemap 链接,能指引爬虫直接发现网站地图,对大型或新上线站点尤其有益。写法如下:
Sitemap: https://example.com/sitemap.xml
很多人为了省流量,会禁止爬虫访问 CSS、JS 或图片文件。这种做法往往适得其反,因为搜索引擎需要渲染页面时抓取这些资源,才能正确理解页面布局和内容质量,屏蔽它们可能导致排名评估不准确。除非有明确的资源消耗问题,否则建议对静态资源保持开放。
不会直接导致惩罚,但可能带来负面影响。比如误用 Disallow 屏蔽整个站,会让页面从搜索结果中消失;屏蔽必要的 CSS 和 JS,可能弱化页面质量评估。配置后务必测试,避免意外事故。
标准 REP 协议不支持正则,但 Google 的爬虫支持部分通配符,如美元符号($)匹配路径结尾、星号(*)匹配任意字符序列。其他搜索引擎可能不支持,为兼容性考虑,建议尽量使用直接的路径写法。
完全可以。如果没有该文件,爬虫会默认抓取全站公开页面。对多数小中型站点而言,不创建 robots.txt 并没有问题;但提供一个简洁的配置文件仍可帮助爬虫更好地理解页面优先级。
合理配置 robots.txt 是网站 SEO 的基础工作之一。创建时,提交到根目录并确保按标准语法书写;配置中,为不同爬虫定制规则、声明 Sitemap,并避免屏蔽前端资源。建议每次修改后用搜索引擎的 robots 测试工具验证规则是否生效,并持续观察收录变化。当网站结构发生调整时,同步复查该文件,能帮助你的站点始终保持良好的搜索引擎友好度。