Categories


Tags


【院长帮帮忙】页面无用时间信息导致网页不被爬虫抓取(第一期)

在【院长帮帮忙】栏目露过面的站点是编织汇(www.bianzhihui.com),该站点通过反馈中心反馈页面内容迟迟不被抓取,经百度工程师追查,原来是因为页面上的无用时间信息——没有想到是不是?同学们快来看看这个案例吧。也想让院长帮助追查吗?快来看看这里!

站点求助:现象

编织汇网站内容发布后几个礼拜都未曾收录。案例如下:

http://www.bianzhihui.com/t/6717(教程详细页面举例)

http://www.bianzhihui.com/u/12306 (用户页面举例)

http://www.bianzhihui.com/h/154 (编织花样页面举例)

我们已将这些url放入sitemap,并使用了百度统计的集成的JS推荐,但是未曾有改善。

站点求助:自查

根据反馈中心的回复,使用抓取异常工具诊断:未发现异常

院长出手,内部追查

工程师结论: spider抓取很及时,但因为该网站没有设置内容产出时间,网站底部却有个老旧时间日期,导致spider误以为网页内容老旧(具体策略较复杂,在此不做赘述)。建议增加页面内容产生时间,去掉没有必要的时间信息

*以上为旧页面截图,“2014年9月9日”对时间识别造成干扰。

站点总结:

1,网页上切忌勿乱加时间,如我们网站的(始于2014年9月9日)这种时间是一个大忌

2,网页内容尽可能加上产出时间,也就是发布时间

3,百度site的结果时间和权重并无太多关系

4,跟百度沟通的时候,一定要条例清晰,证据确凿。自身的问题一定要先排查准确。

来源:百度搜索资源平台 百度搜索学堂


Public @ 2015-07-21 15:22:04

我不想我的网站被Baiduspider访问,我该怎么做?

Baiduspider遵守互联网robots协议。您可以利用robots.txt文件完全禁止Baiduspider访问您的网站,或者禁止 Baiduspider访问您网站上的部分文件。 注意:禁止Baiduspider访问您的网站,将使您的网站上的网页,在百度搜索引擎以及所有百度提供搜索引擎服务的搜索引擎中无法被搜索到。关于 robots.txt的写作方法,请参看我们的介绍:robots.txt写

Public @ 2017-02-03 15:38:41

sogou spider 喜欢收录什么样的页面?

内容优良而独特的页面,如果您的页面内容和互联网上已存在的其他页面有高度的相似性,可能不会被 sogou spider 收录。链接层次较浅的页面,过深的链接层次,尤其是动态网页的链接,会被丢弃而不收录。如果是动态网页,请控制一下参数的数量和URL的长度。搜狗更偏好收录静态网页。重定向次数越多的页面,越有可能被 sogou spider 丢弃。

Public @ 2011-08-12 15:38:57

【院长帮帮忙】站点打不开,可能是referer设置问题!(第六期)

站点反馈,在移动搜索下站点被百度屏蔽了经查站点在PC端打开无影响,仅移动端无法打开,且落地页体验、内容均良好,站点并不是被百度屏蔽,而是站点M端的Referer值太长,导致网站打不开(Referer长度不能超过256,超过以后抓取结果为404)站点referer值referer值长度要求各位站长们记住了哦,如遇以上这种情况,被百度屏蔽的锅,我们可不背哦!来源:百度搜索资源平台 百度搜索学堂

Public @ 2022-06-28 15:22:06

【院长帮帮忙】我的网站排名为什么突然下降?(第十期)

可能有多种原因导致您网站排名突然下降,以下是一些可能的原因及解决方法: 1. 竞争对手优化反击:您的竞争对手执行了更好的搜索引擎优化策略,导致他们的网站排名上升,您的网站排名下降。 解决方法:通过了解您的竞争对手的优化策略,制定更好的策略,例如添加更好的关键词、更好的网站内容以及实施更专业的SEO技巧。 2. 网站内容更新不及时或质量下降:搜索引擎对网站内容有一定的要求,如果您的网站缺乏新的

Public @ 2023-06-03 06:00:25

更多您感兴趣的搜索

0.420547s