Categories


Tags


为什么我的网站内一些不设链接的私密性网页,甚至是需要访问权限的网页,也会被搜狗收录?

sogou spider对网页的抓取,是通过网页与网页之间的链接实现的。

网页之间的链接类型,除了站点内部的页面链接之外,还有不同网站之间的互相链接。因此,某些网页即便通过您的网站内部链接无法访问到,但是,如果别人的网站上有指向这些页面的链接,那么这些页面还是会被搜索引擎所收录。

搜狗Spider的访问权限,和普通用户是一样的。因此,普通用户没有权限访问的内容,Spider也没有权限访问。之所以看上去某些访问权限限制内容被搜狗收录,原因有两点:

A. 该内容在Spider访问时是没有权限限制的,但抓取之后,内容的权限发生了变化。

B. 该内容有权限限制,但是由于网站安全漏洞问题,导致用户可以通过某些特殊路径直接访问。而一旦这样的路径被公布在互联网上,则Spider就会循着这条路径抓出受限内容。

如果您不希望这些私密性内容被搜狗收录,一方面可以通过robots协议加以限制;另一方面,也可以通过删除快照反馈给我们进行解决或者通过站长平台使用死链提交告知我们对其进行删除。


Public @ 2017-04-25 15:55:44

网站不收录怎么办,这几个自测是否没做过?

作为AI语言模型,我没有实际的实施过程,但我可以提供一般的建议: 1. 确认是否已经提交了网站地图,如果没有提交,则应该立即提交。 2. 确认网站是否符合搜索引擎的收录规则,例如确保网站没有搜集用户数据等违规行为。 3. 搜索引擎爬虫是否能够访问网站,确认是否有robots.txt文件阻止搜索引擎爬虫访问网站。 4. 如果以上三点都确认无误,则需要耐心等待搜索引擎的收录。 如果以上步骤都已完成

Public @ 2023-04-27 00:50:12

提高网站内容收录四大方法

1、网站提高收录的10种方法①保持规律的更新②保持原创度和内容长度③站上添加最新发布模块或者最新的更新模块④已收录的页面锚文本给未收录的页面⑤验证百度资源平台,设置好网站类型⑥手动在搜索引擎上做主动推送⑦每天手工的更新Sitemap⑧未收录页面的链接展示在首页一段时间⑨站外给未收录的页面引蜘蛛⑩百度资源平台诊断未收录的页面2、日志分析,查看蜘蛛抓取情况下载网站日志,查看蜘蛛抓取情况,如果返回值20

Public @ 2017-05-07 15:55:30

更多您感兴趣的搜索