什么是搜索引擎蜘蛛?SEO搜索引擎蜘蛛工作原理
作为一名编辑乃至站长,在关注网站在搜索引擎排名的时候,最重要的就是蜘蛛(spider)。搜索引擎蜘蛛是一个自动抓取互联网上网页内容的程序,每个搜索引擎都有自己的蜘蛛,那么,蜘蛛是怎样在网站上抓取内容的呢?一起来看看它的工作原理吧!
SEO是由英文Search Engine Optimization缩写而来,中文意译为“搜索引擎优化”,是指在了解搜索引擎自然排名机制的基础上,对网站进行内部及外部的调整优化,改进网站在搜索引擎中关键词的自然排名,获得更多的展现量,吸引更多目标客户点击访问网站,从而达到网络营销及品牌建设的目标。
作为一个SEO初学者,首先要做的并不是急于学习发外链,静态化,meta设置等,而是去理解SEO的原理以及作用。因此,先给大家讲解一下搜索引擎的原理,帮助大家更好地理解SEO。
今天我主要讲一下网页抓取程序——蜘蛛(Spider),有的地方也叫机器人(robot)。蜘蛛是搜索引擎的一个自动应用程序,它的作用很简单,就是在互联网中浏览信息,然后把这些信息都抓取到搜索引擎的服务器上,再建立索引库等操作。我们可以把蜘蛛当作采集网站内容的工具,因此越是有利于爬取的操作,就越有利于SEO。其实,蜘蛛的工作也挺简单,具体步骤参见下图。
这里提到一点重要的信息:蜘蛛爬取的是网站代码内容,而不是我们看到的显示内容,因此没有文本化直接从数据库中读取的内容,引擎是获取不到的。如:https://x.hs.net/html/apiservice/apilist.html
显示内容:
代码内容:
蜘蛛爬取的是第二个页面,而我们真的是要把这个代码的内容给引擎看吗?显然不会。
下面介绍一下蜘蛛抓取网页的规律:
1、深度优先
搜索引擎蜘蛛在一个页面发现一个链接后顺着这个链接爬下去,然后在下一个页面又发现一个链接,这样一个页面接一个页面,直到抓取全部链接,这就是深度优先抓取策略。这里告诉SEOER们,做好网站内链的重要性,一定要用绝对地址。
2、宽度优先
搜索引擎蜘蛛先把整个页面的链接全部抓取一次,然后再抓取下一个页面的全部链接。宽度优先主要告诉SEOER们,不要把网站的目录设置太多,层次要清楚。
3、权重优先
这个比较好理解,主要是搜索引擎蜘蛛比较喜欢爬取质量好的链接内容。例如网易首页面,蜘蛛经常来,而不是很好的网站,蜘蛛就很少来。权重优先对SEOER的提醒是做质量好的外链很重要。
4、重访抓取
例如,搜索引擎蜘蛛前一天抓取了某网站的页面,而第二天该网站又增加了新的内容,那么搜索引擎蜘蛛就可以再次抓取到新的内容。长此以往,该网站在蜘蛛的“印象”中就很友好了。这个重访抓取策略不仅对SEOER有用,对网站建设也很有用:时时更新网站内容,也能使客户体验提升。
以上介绍了蜘蛛的爬取方式与内容,你应该理解为什么SEOER这么注重代码问题,URL设置,与原创更新了吧,希望这篇文章能帮助各位优化自己的网站,做出受“蜘蛛”欢迎的网站!
相关建站知识
- 02-16帝国CMS教程模板导入导出详解
- 03-23帝国cms模板这样操作设置变得更自动化
- 11-06帝国cms上传文件大小的限制php.ini设置方法
- 08-01帝国CMS列表页调用随机数字
- 07-15帝国cms内容页灵动标签调用当前栏目多篇文章并且排除当前文章
- 12-10帝国cms模板里增加当前页面刷新时间
- 02-12帝国CMS动态版循环栏目伪静态地址
- 10-29帝国cms专题调用标题-简介-文章数-创建时间-浏览数
- 05-29帝国cms分页问题的自动化如何实现
- 02-15帝国cms判断某个字段必须是会员或者VIP会员才能查看的方法
- 10-24帝国CMS解决文章自动提取简介后双引号显示成”方法
- 06-08帝国CMS的灵动标签同时调用头条(1级、2级)、推荐(1级、2级)多种方法
- 07-01帝国cms灵动标签标题属性加粗颜色失效
- 12-08帝国CMS二次开发禁止内容图片和链接中的alt与title替换成关键词
- 02-08帝国CMS自定义附件前缀教程
- 08-30帝国CMS灵动标签调用指定时间段的信息
- 03-05帝国CMS二次开发判断会员是否登陆教程
- 12-17帝国CMS模板调用标签:只调用当天发布的信息
- 08-04帝国cms全站去版权方法
- 08-17帝国CMS实现tagid伪静态tag的方法