区分访问抓取与索引结果,核心是看服务器日志和搜索引擎返回的状态:日志里出现的是抓取,索引则要看该 URL 能否被搜索到,或通过站点资源查询工具确认。对于 www 二级域名,抓取只说明搜索引擎来过,索引才说明页面进入了结果库,两者不能互相替代。
抓取是搜索引擎请求你的页面。你可以在服务器访问日志中查找搜索引擎的 User-Agent,观察它请求了哪些 www 二级域名下的 URL、返回码是什么、返回内容长度是多少。
如果日志里完全没有搜索引擎的请求,先排查 robots.txt、服务器屏蔽、DNS 解析和 www 二级域名是否可公开访问,而不是直接判断“没被索引”。
索引是搜索引擎把页面内容处理后存入可检索的结果库。判断索引不能只看日志,也不能只看抓取频次。可执行的方法是:在搜索引擎中用完整 URL 或 site: 查询,观察该 www 二级域名下的页面是否出现在结果中。不同搜索引擎的索引范围和展示方式不同,需要分别核查。
还要注意,site: 查询结果可能包含近似匹配或已删除页面,不能只凭一条结果就断言索引状态。更可靠的做法是结合搜索资源平台提供的 URL 检查工具,查看“已收录”“已发现但未编入索引”“已抓取但未索引”等状态。若工具显示已抓取但未索引,说明抓取已完成,问题在索引环节,而不是访问环节。
访问是用户或爬虫能否打开页面;抓取是搜索引擎是否请求了页面;索引是搜索引擎是否把页面纳入结果库。三层依次递进,但不存在必然的“访问成功就抓取、抓取成功就索引”。
robots.txt 的抓取限制不等于可靠的索引移除。即使 robots.txt 禁止抓取,已索引的页面仍可能因外部链接或历史数据出现在结果中。要移除索引,应使用 noindex 或搜索资源平台的移除工具,并确认页面返回状态正常。
www 二级域名容易和非 www 主域产生重复内容。若两个地址都能访问且内容相同,搜索引擎可能只选其中一个展示。处理时先确定首选版本,再用 301 跳转把另一个版本永久指向首选版本,并保持内部链接一致。
检查项如下:
https://www.example.com/page 和 https://example.com/page,确认是否都返回 200。若都返回 200,说明存在重复入口。站点地图不保证收录,它只是帮助搜索引擎发现 URL。提交站点地图后,仍需通过日志和索引状态确认实际结果。
处理完成后,不要只看一次结果。建议按固定周期复查同一组指标:搜索引擎对 www 二级域名的抓取请求数、返回码分布、已索引 URL 数、site: 查询结果以及搜索资源平台中的索引状态。如果抓取请求增加但索引数不变,重点检查内容质量和规范标签;如果抓取请求减少,重点检查服务器可用性和 robots.txt。
下一步,选取 www 二级域名下 5 到 10 个代表性 URL,分别记录其访问状态、抓取状态和索引状态,形成一张对照表。这样能快速定位问题发生在访问、抓取还是索引环节,而不是把三者混在一起判断。