做百度SEO时,经常会遇到这种情况:
文章已经发布。
URL也能正常打开。
资源提交做了。
但过了几天,百度还是没有明显抓取或者收录变化。
这时候很多站长第一反应是:
再提交一次URL。
其实在重复提交以前,更应该先确认一件事情:
百度蜘蛛到底能不能正常访问这个页面,以及百度实际抓到的内容是不是你希望它看到的内容。
百度搜索资源平台提供的“抓取诊断”,就是专门解决这个问题的工具。
百度官方对它的定义很直接:
抓取诊断可以让站长从百度蜘蛛的视角查看网页,判断Baiduspider抓取到的内容是否符合预期。
所以抓取诊断并不是一个单纯的“催收录按钮”。
它真正适合做的是:
检查百度能不能访问页面。
查看服务器返回状态。
检查百度访问到了哪个IP。
判断有没有重定向异常。
检查Robots有没有误封。
查看百度真正读取到的HTML源码。
排查只针对搜索蜘蛛出现的隐藏链接或异常内容。
对于SEO新手来说,这是搜索资源平台里非常值得掌握的一项基础工具。
第一:使用抓取诊断之前,需要先完成网站验证
抓取诊断属于已验证站点的管理工具。
所以使用之前,需要先完成:
百度账号
↓
添加网站
↓
验证网站所有权
↓
进入搜索资源平台
百度搜索资源平台目前仍然把抓取诊断、抓取异常、抓取频次、索引量、流量与关键词等放在站点资源管理体系中;验证网站以后,站长才能更完整地查看自己的站点数据。
如果网站还没有验证,可以先完成上一节:
搜索资源平台添加和验证网站。
验证成功以后再回来操作抓取诊断。
第二:抓取诊断工具在哪里?
登录百度搜索资源平台以后,目前可以从站点资源的数据工具中找到:
抓取诊断。
百度搜索资源平台当前公开页面仍然把它列在“数据统计—站点资源”下面,与:
索引量。
流量与关键词。
抓取频次。
抓取异常。
Robots。
并列。
可以简单理解成:
百度搜索资源平台
↓
选择已经验证的网站
↓
数据统计 / 站点资源
↓
抓取诊断
由于百度后台界面可能继续调整,实际操作时以当前账号页面显示名称为准。
重点找到:
抓取诊断
即可。
第三:进入以后,先输入需要检查的URL
假设现在网站有一篇文章:
https://www.example.com/seo/article-a/
直接把完整URL放到抓取诊断工具中。
这里最好使用:
当前真正希望百度抓取和索引的规范URL。
比如网站已经全部迁移HTTPS,就不要继续拿HTTP旧地址作为主要测试对象。
如果:
http://example.com/a/
最终会301到:
https://www.example.com/a/
可以分别测试两次。
第一次检查HTTP:
是否正确301。
第二次检查HTTPS:
最终页面是否正常返回并能被百度读取。
这样才能完整判断迁移链路。
第四:如果后台提供PC和移动选择,建议两个都检查
百度官方抓取诊断历史使用说明明确建议分别检查:
PC。
和:
移动。
因为两种UA访问网站时,有可能得到不同页面或者不同服务器响应。
例如:
PC打开正常。
移动UA却被安全插件拦截。
或者:
桌面页面正常显示正文。
移动端由于模板错误,只返回一个空页面。
普通浏览器测试可能没有发现。
但Baiduspider实际抓取时就会受到影响。
所以重要页面可以分别进行:
PC抓取
+
移动抓取
尤其是:
首页。
核心服务页。
产品页。
重要文章。
流量较大的页面。
这几类URL值得优先检查。
第五:点击抓取以后,不要只看“抓取成功”四个字
这是使用抓取诊断时最重要的一点。
很多新手看到:
抓取成功
就认为:
没问题了。
其实还应该继续点击抓取结果查看详情。
百度官方早期站点诊断指南就特别提醒,抓取成功以后仍然要继续检查:
提交网址。
实际抓取网址。
抓取UA。
网站IP。
下载时长。
HTTP头信息。
服务器状态码。
网页源码。
等内容。
所以正确操作流程应该是:
提交URL
↓
开始抓取
↓
显示抓取成功
↓
打开抓取详情
↓
继续检查返回结果
真正有用的信息往往都在最后一步。
第六:第一项重点看“实际抓取URL”
比如提交:
https://example.com/a/
最终抓取地址却变成:
https://example.com/
那就要检查:
为什么文章地址被重定向到了首页?
再比如:
https://example.com/a
经过:
301
↓
http://example.com/a/
↓
301
↓
https://www.example.com/a/
说明网站存在多层重定向。
百度抓取诊断官方说明中明确提到,如果连续重定向次数过多,可能直接产生重定向错误;官方手册中给出的异常条件包括连续跳转超过5次。
所以正常网站最好做到:
旧URL
↓
最终URL
尽量一步完成。
第七:第二项重点看HTTP状态码
正常希望参与搜索的文章页面,通常应该看到:
200 OK
如果看到:
301
302
403
404
500
502
503
就需要继续判断。
301
页面发生永久跳转。
如果这是旧URL,通常正常。
如果你正在检查最终文章地址,却仍然301,就要看它跳到哪里。
403
服务器拒绝百度蜘蛛访问。
百度抓取异常工具目前也明确把403归为“访问被拒绝”。
404
页面不存在。
如果这是已删除页面,可以正常。
如果是一篇正在运营的重要文章,就属于明显异常。
5XX
表示服务器端错误。
例如:
500。
502。
503。
百度将5XX归为服务器错误,持续出现会影响搜索蜘蛛正常抓取。
所以抓取诊断第一眼除了看成功与否,还应该养成:
看状态码。
的习惯。
第八:第三项检查百度实际访问到的网站IP
这个功能在网站:
更换服务器。
更换CDN。
更换IP。
以后尤其有用。
例如网站现在真实服务器IP已经变成:
1.2.3.4
但抓取诊断显示百度仍然访问:
5.6.7.8
就要判断:
DNS是不是还存在旧记录。
CDN是不是回源错误。
百度侧是不是还在使用旧IP。
百度官方抓取诊断说明明确提到,该工具可以检查网站与百度之间的连接以及抓取IP,如果IP信息与预期不一致,可以通过工具进行报错处理。
所以网站迁移服务器以后,不要只测试:
我自己的电脑能不能访问。
还应该看:
百度蜘蛛实际去了哪台服务器。
第九:第四项看下载时间,排查服务器过慢
页面最终返回200,也不意味着抓取体验一定正常。
比如:
HTTP 200
但百度抓取页面用了很长时间。
如果这种情况大量发生,就要进一步检查:
服务器性能。
数据库。
动态请求。
插件。
CDN。
带宽。
百度官方抓取诊断错误说明中明确把:
连接超时。
无响应。
连接重置。
内容截断。
抓取超时。
列为服务器连接错误,而且指出服务器过载、网络问题以及网站错误屏蔽Baiduspider,都可能造成抓取失败。
所以如果网站经常出现:
今天能抓。
明天失败。
不要只盯SEO内容。
服务器稳定性同样是SEO基础。
第十:第五项一定要打开“网页源码”看百度到底抓到了什么
这是抓取诊断最有价值的地方之一。
正常浏览器里,你看到的是:
完整网页。
但百度蜘蛛看到的内容可能并不完全一样。
例如页面的主要内容依赖JavaScript加载。
浏览器执行JS以后能看到:
产品价格。
产品参数。
正文。
百度抓取结果里却没有这些信息。
百度官方使用抓取诊断举过类似例子:某些商品页面的价格通过JavaScript输出,百度蜘蛛可能较难获取;修改以后可以再次通过抓取诊断确认结果。
所以打开源码以后重点检查:
Title有没有。
正文有没有。
H1有没有。
产品信息有没有。
链接有没有。
是不是只有一堆JS框架代码。
真正重要的信息如果百度抓不到,页面在浏览器里再漂亮也不能解决这个问题。
第十一:还可以用它检查“只给搜索蜘蛛看的异常内容”
有些网站被攻击以后,站长自己打开网页完全正常。
但攻击者可能根据UA进行判断:
普通用户访问:
正常网站。
Baiduspider访问:
插入大量赌博、色情、垃圾链接或者隐藏文字。
这里不展开这类攻击方式,但站长需要知道这种风险。
百度官方明确把:
检测黑链和隐藏文本
列为抓取诊断工具的用途之一。
因此如果出现:
网站突然大量出现不相关关键词排名。
搜索结果标题异常。
百度快照内容和自己网站不一致。
莫名出现大量垃圾页面。
可以使用抓取诊断对比:
百度看到的源码是不是和站长自己看到的一样。
如果不一样,就需要优先检查网站安全。
第十二:显示Robots封禁怎么办?
如果抓取结果提示:
Robots封禁。
先访问:
https://www.example.com/robots.txt
检查有没有类似:
User-agent: Baiduspider
Disallow: /
或者某个目录被错误禁止。
百度搜索资源平台目前还提供独立Robots工具,可以查看、校验和更新robots.txt,并检查百度侧生效情况。
百度抓取诊断官方手册还说明:
如果工具显示Robots封禁,而网站实际并没有设置对应限制,可以通过抓取诊断中的报错功能提醒百度更新Robots信息。
所以不要一看到:
Robots封禁
就直接删除整个robots.txt。
先确认:
这个目录到底是不是本来就不希望百度抓取。
第十三:显示DNS异常怎么办?
DNS异常意味着Baiduspider无法正常通过域名获得网站IP。
可能涉及:
域名DNS问题。
DNS服务异常。
解析错误。
服务器异常。
错误屏蔽搜索蜘蛛。
百度官方建议,持续出现DNS错误时,应先确认网站域名和IP是否可以正常解析;如果问题反复发生,应进一步联系DNS或服务器服务商处理。
可以重点检查:
域名是否过期。
A记录是否正确。
AAAA记录是否异常。
CDN解析是否正确。
DNS服务是否稳定。
是否存在不同地区解析到错误IP。
DNS问题不是SEO关键词优化能解决的。
它属于网站基础设施问题。
第十四:显示403访问被拒绝,优先检查WAF和安全插件
如果普通浏览器访问正常,而抓取诊断显示:
403
很可能存在:
WAF。
CDN。
服务器安全规则。
防火墙。
WordPress安全插件。
错误把Baiduspider挡住了。
百度官方抓取异常定义中明确把403归为“访问被拒绝”;抓取诊断手册也指出,安全系统、DoS防护、防火墙以及服务器配置都可能误伤百度蜘蛛。
这类问题特别常见于:
网站刚换CDN。
刚开启严格防护。
刚安装安全插件。
所以如果改完服务器配置以后百度抓取突然下降,要及时做一次抓取诊断。
第十五:抓取成功为什么还是不收录?
这也是抓取诊断最容易被误解的地方。
抓取成功只说明:
百度蜘蛛能够正常访问这个URL,并取得页面内容。
它并不等于:
百度已经收录。
更不等于:
页面会获得排名。
一个页面完整的搜索流程还包括:
发现
↓
抓取
↓
分析
↓
索引判断
↓
搜索匹配
↓
排序
所以出现:
抓取成功,但长期不收录
以后,排查重点就应该从服务器访问转向:
页面内容。
重复URL。
页面价值。
网站结构。
内部链接。
索引情况。
百度搜索资源平台本身也把“抓取诊断”和“索引量”作为两套独立工具提供,这两个阶段不能混为一谈。
第十六:抓取诊断、抓取异常、抓取频次分别看什么?
这三个工具名字很像,新手经常混淆。
可以简单记成:
抓取诊断
解决:
某一个具体URL,百度现在能不能正常抓?抓到了什么?
抓取异常
解决:
整个网站有没有批量DNS、403、404、5XX等异常?
百度官方目前将Baiduspider无法正常抓取定义为抓取异常,并提醒大量内容持续无法抓取可能影响抓取、索引以及网站搜索流量。
抓取频次
解决:
百度每天大概抓网站多少次?趋势有没有明显变化?
所以一个网站出现收录下降,可以这样排:
抓取频次
看整体趋势
↓
抓取异常
看有没有批量问题
↓
抓取诊断
针对具体URL做现场测试
三个工具配合使用,比单独盯一个数据有效得多。
第十七:哪些页面最值得定期做抓取诊断?
没有必要把网站几千个URL全部手动检查。
优先选择:
首页
代表整个网站基础连通性。
核心服务页
直接影响业务搜索。
核心产品页
尤其是动态加载产品信息的网站。
新发布的重要文章
检查百度是否能够正常获取正文。
搜索流量突然下降的页面
排查服务器、跳转和源码异常。
刚迁移服务器或CDN后的页面
重点检查IP和响应。
模板刚修改过的页面
避免出现全站级错误。
例如WordPress网站刚更新主题。
最好随机抓:
首页。
服务页。
文章页。
分类页。
至少覆盖几个不同模板。
第十八:抓取诊断次数有限,不建议拿它当批量提交工具
百度不同历史官方文档中,对抓取诊断额度出现过不同版本,例如当前平台工具手册曾写过每站每周70次,早期其他资料也存在不同额度,因此实际可用次数建议以当前账号后台显示为准。官方手册同时说明,诊断结果通常只展示Baiduspider可见内容的前200KB。
因此它更适合:
诊断。
而不是:
网站每天发100篇,我就把100篇全部手动抓一次。
新URL发现应该更多依赖:
正常站内链接。
资源提交。
稳定抓取。
抓取诊断留给真正需要排查的页面。
第十九:完整操作流程,可以直接按照这张图执行
┌───────────────────────────┐
│ 1. 登录百度搜索资源平台 │
└─────────────┬─────────────┘
↓
┌───────────────────────────┐
│ 2. 选择已经验证的网站 │
└─────────────┬─────────────┘
↓
┌───────────────────────────┐
│ 3. 进入“抓取诊断” │
└─────────────┬─────────────┘
↓
┌───────────────────────────┐
│ 4. 输入完整URL │
└─────────────┬─────────────┘
↓
┌───────────────────────────┐
│ 5. PC / 移动分别检查 │
└─────────────┬─────────────┘
↓
┌───────────────────────────┐
│ 6. 开始抓取 │
└─────────────┬─────────────┘
↓
┌─────┴─────┐
↓ ↓
抓取成功 抓取失败
↓ ↓
检查URL/IP/状态码 查看错误类型
下载时间/源码 ↓
↓ DNS / 403 / 404
内容是否正常 5XX / Robots等
↓ ↓
正常 修复问题
↓ ↓
观察索引情况 再次诊断
这套流程基本已经能够覆盖大部分日常百度抓取问题。
第二十:SEO新手最容易犯的5个错误
错误一:抓取成功就等于收录
不等于。
抓取只是索引之前的一个环节。
错误二:抓取失败就不停重新提交
如果是服务器、403、DNS或者Robots错误,不修复原因,重新提交十遍通常也没有意义。
错误三:只检查首页
首页正常不代表所有模板都正常。
文章页、产品页、服务页都需要抽样检查。
错误四:只看结果,不看源码
抓取成功以后仍然应该确认百度真正取得了什么内容。
错误五:网站刚换服务器却不检查抓取IP
自己能正常打开网站,不代表百度蜘蛛已经访问到正确环境。
抓取诊断真正解决的是“百度看到的网站和你看到的是不是同一个网站”
所以回到标题:
搜索资源平台抓取诊断应该怎么操作?
真正值得记住的不是点击几下按钮。
而是一套排查逻辑:
URL能不能抓?
↓
抓到了哪个URL?
↓
访问了哪个IP?
↓
服务器返回什么状态?
↓
下载是否正常?
↓
百度看到的源码是什么?
↓
有没有Robots、403、404、5XX等异常?
↓
修复以后再次验证
百度官方一直把抓取诊断定位为“从百度蜘蛛视角查看网页”的工具,而抓取异常、抓取频次、Robots等功能则分别负责观察全站抓取问题。
所以以后再遇到:
文章为什么不收录?
不要第一时间只做资源提交。
先挑一篇重要URL进入抓取诊断。
看看百度蜘蛛到底能不能访问。
再看看它真正抓到了什么。
如果抓取本身存在问题,就先解决技术问题。
如果:
状态码正常。
IP正常。
源码正常。
正文也完整。
那么下一步才应该继续检查:
索引、内容质量、重复页面、搜索意图和网站整体结构。
这才是抓取诊断真正应该在SEO排查流程里承担的位置。
评论
欢迎留下你的看法,评论会按站点设置审核展示。
0 条评论
还没有评论,来写下第一条吧。
请先登录后即可评论
登录评论已关闭