百度收录入口:改版或迁移时应核对什么

📍 WDQWDWQD987AAAAA:216.73.216.39
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /e4504975d010.html
📄

百度收录入口:改版或迁移时应核对什么

改版或迁移时,百度收录入口并不是一个需要重新“提交”的按钮,而是一组让百度持续发现、抓取并保留旧地址价值的核对项。核心动作是:保留旧 URL 可访问、正确设置跳转、更新站内链接与站点地图、检查 robots.txt 是否误封,最后用百度搜索资源平台提供的普通收录或抓取诊断工具确认抓取状态。下面用一个假设例子说明核对顺序与常见错误。

先看一个假设例子:从 /old/ 迁到 /new/

假设你有一个页面 https://example.com/old/page.html,改版后内容移到 https://example.com/new/page.html。正确做法是让旧地址返回 301 跳转到新地址,而不是直接删除旧页面。百度在再次抓取旧地址时,会顺着 301 找到新地址,并把旧地址积累的链接关系逐步转移过去。

常见错误有三种。第一,旧地址直接返回 404,百度无法得知内容去了哪里,收录会丢失。第二,用 JavaScript 跳转代替 HTTP 跳转,抓取工具可能不执行脚本,导致迁移信号丢失。第三,旧地址和新地址同时返回 200,形成重复内容,百度需要自行判断哪个是主版本,过程更慢且结果不确定。

核对跳转与可访问性

迁移时逐条核对以下项目,可以用浏览器开发者工具或 curl -I 查看响应头:

判断结果的方法:如果旧地址返回 301 且最终落到 200 的新页面,说明迁移信号基本正确;如果返回 404、302 或跳转成环,需要先修复再谈收录。

核对 robots.txt 与站点地图

改版时容易把测试环境的 robots.txt 带上线,例如误写 Disallow: /,这会让百度无法抓取整站。核对时确认 robots.txt 没有封禁新目录,也没有封禁 CSS、JS 等渲染所需资源。

站点地图方面,把新 URL 写入 sitemap 并提交,可以帮助百度发现页面,但它不保证收录。站点地图只是发现渠道,是否收录仍取决于内容质量、抓取预算和页面可访问性。不要因为提交了 sitemap 就认为旧地址可以随意删除。

需要区分的是:robots.txt 的抓取限制不等于可靠的索引移除。如果只想让某个页面从搜索结果消失,用 robots.txt 封禁抓取往往无效,因为百度可能仍保留已有索引;更合适的方式是让页面返回 404 或 410,或使用平台提供的删除工具。robots.txt 适合控制抓取,不适合精细控制移除。

核对站内链接与规范化标签

改版后,导航、面包屑、文章内链如果还指向旧地址,会持续给百度发送旧 URL 信号,拖慢新地址的替换。核对方法是抽查若干页面,确认站内链接已经指向新 URL,而不是依赖跳转。

同时检查每个新页面的 rel="canonical" 是否指向自身。如果 canonical 仍写旧地址,百度会认为新页面不是主版本,收录可能落到旧地址上,与迁移目标相反。canonical 应使用绝对地址,并保持协议、域名、路径大小写一致。

用百度搜索资源平台确认抓取状态

完成上述修改后,登录百度搜索资源平台,在普通收录中提交新 URL,并用抓取诊断工具测试旧地址和新地址。抓取诊断会返回 HTTP 状态码、抓取时间和页面内容摘要,可以据此判断百度看到的版本是否与预期一致。

如果抓取诊断显示旧地址返回 301,新地址返回 200,说明入口链路正常。如果显示抓取失败或被 robots.txt 拦截,按提示逐项排查。注意抓取诊断是抽样测试,不代表全站已被重新抓取,收录更新需要时间,不要频繁重复提交同一批 URL。

下一步:列出改版涉及的全部旧 URL,用表格记录每条的状态码、跳转目标和 canonical 地址,先修复返回 404 或跳转链过长的条目,再通过百度搜索资源平台提交新地址并观察抓取诊断结果。

图1 图2

nginx