BAIDU INDEXING · UPDATED 2026-08-13

百度不收录网站,先按证据链排查

“site: 域名没有结果”只是一个观察,不足以定位原因。先确认百度能获得正确页面,再通过已验证的百度搜索资源平台查看抓取与索引状态。

第一步:确认规范域名只有一个

HTTP、HTTPS、www 与非 www 应统一到一个永久地址;每个公开页面使用自指 canonical。域名改版后,旧页面应返回真实 404/410 或精确 301,不能全部跳回首页。

curl -I http://example.com/
curl -I https://www.example.com/
curl -I https://example.com/product

第二步:从百度视角检查公开响应

检查首页和核心页是否返回 200 与 text/html,robots.txt 是否返回纯文本,Sitemap 是否为有效 XML。User-Agent 可以伪造,因此模拟 Baiduspider 只能验证服务器规则差异,不能证明真实百度爬虫来访。

curl -sS -I -A "Baiduspider" https://example.com/
curl -sS https://example.com/robots.txt
curl -sS https://example.com/sitemap.xml

第三步:看原始 HTML,不只看浏览器

如果产品介绍、H1 和内部链接只在 JavaScript 运行后出现,部分读取器拿到的可能只是空壳。核心公开页面优先 SSR 或预渲染,并保证脚本失败时仍可读到主要事实。

第四步:验证并提交站点

百度搜索资源平台验证站点,提交 Sitemap 和重要新 URL,查看抓取异常与索引数据。提交是发现入口,不是收录承诺;不要反复制造大量参数 URL 请求抓取。

第五步:处理旧站与重复内容

域名曾经承载其他品牌时,旧标题和旧页面可能继续出现在搜索摘要中。保留新旧 URL 映射,统一品牌事实,逐步清理失效路径,并记录搜索摘要变化。新站上线几天未完全替换旧索引,并不等于抓取系统失效。

旧 URL 该返回 301、404 还是 410?

先为每个旧路径找到精确语义,不要把所有旧 URL 统一跳转到首页。

精确替代旧页面有一对一新页时返回 301,并让新页自指 canonical。
普通失效页面不存在且没有对应内容时返回真实 404,不要返回带“未找到”文案的 200。
明确移除已确认永久删除且希望搜索快速识别时可返回 410。
不要做无关旧页批量 301 到首页会混淆用户与搜索对页面语义的判断。

每次排查如何留下可对比记录

用同一表格记录「检查时间、请求 URL、最终 URL、状态码、canonical、robots 判定、Sitemap 是否包含、原始 HTML 是否有主要正文、服务器日志摘要、站长平台状态」。

checked_at,url,final_url,status,canonical,in_sitemap,ssr_body,source
2026-08-13T10:00:00+08:00,https://example.com/old,/new,301,/new,false,n/a,curl
2026-08-13T10:02:00+08:00,https://example.com/new,/new,200,/new,true,true,curl

搜索结果快照与百度搜索资源平台数据应分开存档:前者是某次公开搜索快照,后者是已验证站点的官方数据,两者都不应被技术检查自动猜测。

无日志未观察到抓取,或日志留存/代理层不完整;继续核对站长平台。
200 空壳网络成功但服务端正文不足,优先解决 SSR/预渲染。
403/429WAF、鉴权或限速拒绝访问,需要检查实际命中规则。
已抓未收抓取与索引是不同阶段,检查重复内容、质量、canonical 与站点信号。
只收首页检查深层页内链、Sitemap、正文差异、状态码与上线时间。
证据边界

服务器日志、curl 和 Sitemap 只能证明抓取条件。百度是否索引应以已验证站点的资源平台数据和实际搜索结果为准;任何提交方式都不能保证收录或排名。

FREE TECHNICAL SCAN

先检查百度收录所需的公开技术条件。

检查规范域名、状态码、robots、Sitemap、canonical 和初始 HTML。这些证据用于定位问题,百度是否已索引仍要以已验证站长平台和实际搜索为准。

检查百度收录技术条件