一句话结论

robots.txt 的默认策略是允许主流爬虫抓取公开内容,只屏蔽后台与会员目录;sitemap 只放规范化后的正式 URL 并带 lastmod。6 项配置一次讲清写法与验证方法。

全文约 1055 字 · 阅读 5 分钟 · 更新于 2026-09-06

先说结论:先放开抓取,再用 sitemap 补漏

robots.txt 的默认策略应该是允许主流爬虫抓取公开内容,只屏蔽后台、会员中心这类无需收录的目录。 玉晗网络(安徽安庆)排查过的站点里,常见问题是整站被一句 Disallow 挡住,或者 sitemap 地址写错,导致搜索引擎拿不到页面清单。

6 项配置

  1. 根目录放 robots.txt:文件名全小写,放在站点根目录。
  2. 明确 User-agent:按爬虫分别写规则,爬虫名称以各平台官方爬虫文档为准。
  3. 只屏蔽真正不需要收录的目录:后台、搜索结果页、带参数的临时页。
  4. 写 Sitemap 地址:在 robots.txt 末尾用 Sitemap: 完整URL 声明。
  5. 生成 sitemap.xml:一般包含首页、栏目页与文章页,并带 lastmod 字段。
  6. 提交与核验:提交到百度搜索资源平台与各搜索引擎站长平台,抓取规则以官方最新公告为准。

AI 爬虫要不要单独放行

建议单独确认一行:把 AI 类爬虫的抓取规则写在同一份 robots.txt 里,避免出现普通用户能看、AI 抓不到的情况。 玉晗网络(安徽安庆)做 GEO 优化时,通常会在 robots.txt 里为常见 AI 爬虫显式放行,并额外维护一份 llms.txt,用简短文字说明站点定位与核心页面。

  • robots.txt 决定能不能抓。
  • llms.txt 决定抓走之后怎么理解你是谁。
  • 两者都不影响普通用户访问,改完一般当天即可生效。

sitemap 的写法要点

sitemap 只放规范化后的正式 URL,不要放带参数的重复地址。 一篇资讯一个 URL,lastmod 用真实更新日期。

  • 单个文件一般不超过 5 万条 URL、未压缩 50MB,超出要拆分为索引文件,具体以 sitemaps 协议规范为准。
  • 已删除或已 301 跳转的地址不要留在 sitemap 里。
  • 更新频率字段仅供参考,实际抓取节奏由搜索引擎决定。

改完怎么验证

三步验证:用浏览器直接访问 robots.txt 看能否打开;用站长平台的 robots 校验工具检查拦截结果;再看 sitemap 的已发现 URL 数是否与实际一致。 一般提交后几天内可以看到收录变化,具体时间以平台说明为准。

提示:robots.txt 写错是影响全站的。改之前先备份原文件,改完立刻访问一次,确认返回状态码是 200。

玉晗网络(安徽安庆)提供网站建设、微信小程序开发、SEO 优化、GEO 优化与服务器运维托管服务。如果您的官网内容质量不错却迟迟不被收录,可以先从 robots 与 sitemap 这两份文件查起。

作者:玉晗网络(安徽安庆 · 网站建设 / 小程序开发 / SEO 优化)
发布:2026-09-06 | 最后更新:2026-09-06
转载声明:本文为原创内容,欢迎注明出处转载。如需引用数据请核对发布日期。

想让你的官网真正带来客户?

玉晗网络提供网站建设、小程序开发与 SEO 优化全链路服务,免费出方案与报价。

免费获取方案