网站做SEO时,经常会遇到这种情况:
文章已经发布,URL能够正常打开,Sitemap也提交了,但在Google Search Console、Bing Webmaster Tools里仍然显示:
网页未被编入索引。
很多人的第一反应是:
是不是网站权重太低?
是不是文章字数不够?
要不要马上重新提交URL?
其实“未被索引”并不是一个单独问题。
Google官方明确提醒:并不是所有未索引页面都有问题,也不应该追求网站100%的URL全部进入索引。重复页面、筛选参数页、被noindex控制的页面,本来就可能不需要收录。
如果是本来希望获得搜索流量的重要页面,可以优先排查下面几个原因。
第一:搜索引擎还没有发现这个URL
尤其是新网站、新文章,很可能只是:
搜索蜘蛛还不知道这个页面存在。
Google说明,新页面从被发现到抓取、索引本来就需要时间,而且即使主动请求抓取,也不能保证立即进入索引。
可以先检查:
页面有没有站内链接;
有没有进入XML Sitemap;
栏目页能不能找到它;
是不是一个真正的孤立页面。
解决方法很简单:
把页面加入正常网站结构;
添加相关内链;
更新Sitemap;
重要页面再通过URL Inspection请求索引。
不要每天重复提交几十次。
第二:robots.txt把页面挡住了
如果robots.txt存在类似:
Disallow: /blog/
那么/blog/下面的文章可能无法被正常抓取。
Google Search Console的Page Indexing报告会直接显示:
Blocked by robots.txt
Bing Site Explorer也会单独列出被robots.txt禁止抓取的URL。
如果这个页面本来就希望进入搜索结果:
检查robots.txt;
删除错误的Disallow规则;
确认搜索蜘蛛可以访问。
第三:页面存在noindex
例如网页Head里存在:
<meta name="robots" content="noindex">
这句话的意思非常明确:
不要把这个页面编入索引。
Google和Bing都支持noindex指令。搜索蜘蛛重新抓取并识别后,页面不会正常保留在搜索索引里。
WordPress网站尤其建议检查:
是否误勾选了“建议搜索引擎不索引本站”;
SEO插件是否给文章类型加入noindex;
Tag、分类或者自定义页面模板是否设置错误。
第四:页面返回错误HTTP状态码
一个准备参与SEO的正常页面,通常应该返回:
200 OK
如果实际上返回:
404;
403;
500;
503,
搜索蜘蛛可能无法正常处理页面。
Bing Site Explorer就会分别列出404~410、403、5xx等抓取错误。
所以网页浏览器“能打开”,并不代表服务器状态一定正确。
可以通过:
Search Console URL Inspection;
Bing URL Inspection;
服务器日志;
抓取工具
确认实际HTTP响应。
第五:页面发生了重定向
如果URL访问以后301或者302到了其他页面,那么搜索引擎通常不会把原URL当成一个独立内容页面索引。
例如:
/a/ → 301 → /b/
真正应该进入索引的通常是:
/b/
Bing目前也会把Redirect URLs单独列为不进入正常索引的一类URL。
所以发现页面不索引时,先检查它是不是已经被重定向。
第六:Canonical指向了另外一个页面
例如A页面写着:
<link rel="canonical" href="https://example.com/b/">
等于告诉搜索引擎:
B才是这组内容里更主要的版本。
如果A和B内容高度相似,搜索系统很可能只保留B。
这时候A“不被索引”未必是错误。
真正要检查的是:
Canonical是不是你自己设置错了。
如果A本来就是独立页面,就应该重新确认Canonical关系。
第七:内容和其他页面高度重复
这是内容网站做到几百篇以后非常常见的问题。
例如同时存在:
网站SEO怎么做;
企业网站SEO怎么做;
企业官网SEO如何做;
公司网站SEO优化方法。
四篇文章解决几乎相同的问题。
搜索系统可能认为没有必要全部进入索引。
Google也明确提到,大量重复页面、筛选参数页面是网站出现大量非索引URL的常见原因之一。
解决方法不是继续增加第五篇。
而是考虑:
合并内容;
确定一个主要URL;
做301;
优化Canonical;
减少搜索意图重复。
第八:已经抓取,但搜索系统暂时认为没有必要索引
Search Console里比较常见的一种状态是:
Crawled – currently not indexed
也就是:
Google已经抓过页面,但是当前没有把它加入索引。
这种情况下,问题通常已经不是:
蜘蛛找不到页面。
更值得检查:
内容是否太薄;
是否和网站已有页面重复;
页面是否真正解决一个独立问题;
有没有内部链接;
这个URL有没有实际搜索价值。
Bing的IndexNow Insights同样会把Content Quality作为未索引页面的可能原因,并建议改善内容的相关性和价值。
所以看到“已抓取未索引”,不要只是重新提交URL。
先检查页面有没有独立存在的价值。
第九:服务器不稳定,搜索蜘蛛抓取失败
如果网站经常出现:
500;
502;
503;
超时;
访问速度异常,
搜索引擎就可能无法稳定获取页面。
尤其网站升级插件、服务器迁移、CDN配置变化以后,如果大量页面同时掉索引,更应该优先检查服务器。
这种问题属于:
技术SEO。
不是继续增加文章数量能够解决的。
第十:页面其实根本不需要进入索引
最后这一点特别重要。
网站里可能存在:
后台页面;
搜索结果页;
参数URL;
购物车;
重复Tag;
筛选页面;
测试页。
这些页面没有必要全部进入搜索结果。
Google自己也明确表示:
不应该追求100%的URL索引率。
真正应该关注的是:
产品页;
服务页;
解决方案;
案例;
重点文章
这些具有搜索价值的Canonical页面有没有正常进入索引。
网页不索引,可以按照这个顺序快速排查
如果想用最简单的方法处理,可以直接按下面这条链检查:
第一步:搜索引擎知道这个URL吗?
不知道:
补内链、Sitemap。
第二步:蜘蛛能抓吗?
检查robots、403、5xx。
第三步:页面允许索引吗?
检查noindex。
第四步:URL是不是自己跳走了?
检查301、302。
第五步:Canonical是不是指向别人?
检查Canonical。
第六步:内容是不是和已有页面重复?
如果重复,考虑合并。
第七步:内容有没有独立搜索价值?
已经抓取却长期不索引,就重点检查这一项。
然后再通过Google URL Inspection或者Bing URL Inspection查看具体状态,而不是不断重复提交。
最后
网页没有被编入索引,大致可以归纳成三类原因:
发现问题:搜索引擎还没找到。
技术问题:抓不到或者不允许索引。
质量与重复问题:抓到了,但没有选择这个URL进入索引。
所以遇到不收录,别一上来就继续发文章,也不要马上归因于“网站权重低”。
按照:
发现 → 抓取 → 状态码 → Noindex → Canonical → 重复内容 → 页面质量
一层一层检查。
大多数网页为什么没有进入索引,基本都能在这条链里找到原因。
评论
欢迎留下你的看法,评论会按站点设置审核展示。
0 条评论
还没有评论,来写下第一条吧。
请先登录后即可评论
登录评论已关闭