什么是搜索引擎蜘蛛?SEO搜索引擎蜘蛛工作原理
作为一名编辑乃至站长,在关注网站在搜索引擎排名的时候,最重要的就是蜘蛛(spider)。搜索引擎蜘蛛是一个自动抓取互联网上网页内容的程序,每个搜索引擎都有自己的蜘蛛,那么,蜘蛛是怎样在网站上抓取内容的呢?一起来看看它的工作原理吧!
SEO是由英文Search Engine Optimization缩写而来,中文意译为“搜索引擎优化”,是指在了解搜索引擎自然排名机制的基础上,对网站进行内部及外部的调整优化,改进网站在搜索引擎中关键词的自然排名,获得更多的展现量,吸引更多目标客户点击访问网站,从而达到网络营销及品牌建设的目标。
作为一个SEO初学者,首先要做的并不是急于学习发外链,静态化,meta设置等,而是去理解SEO的原理以及作用。因此,先给大家讲解一下搜索引擎的原理,帮助大家更好地理解SEO。
今天我主要讲一下网页抓取程序——蜘蛛(Spider),有的地方也叫机器人(robot)。蜘蛛是搜索引擎的一个自动应用程序,它的作用很简单,就是在互联网中浏览信息,然后把这些信息都抓取到搜索引擎的服务器上,再建立索引库等操作。我们可以把蜘蛛当作采集网站内容的工具,因此越是有利于爬取的操作,就越有利于SEO。其实,蜘蛛的工作也挺简单,具体步骤参见下图。
这里提到一点重要的信息:蜘蛛爬取的是网站代码内容,而不是我们看到的显示内容,因此没有文本化直接从数据库中读取的内容,引擎是获取不到的。如:https://x.hs.net/html/apiservice/apilist.html
显示内容:
代码内容:
蜘蛛爬取的是第二个页面,而我们真的是要把这个代码的内容给引擎看吗?显然不会。
下面介绍一下蜘蛛抓取网页的规律:
1、深度优先
搜索引擎蜘蛛在一个页面发现一个链接后顺着这个链接爬下去,然后在下一个页面又发现一个链接,这样一个页面接一个页面,直到抓取全部链接,这就是深度优先抓取策略。这里告诉SEOER们,做好网站内链的重要性,一定要用绝对地址。
2、宽度优先
搜索引擎蜘蛛先把整个页面的链接全部抓取一次,然后再抓取下一个页面的全部链接。宽度优先主要告诉SEOER们,不要把网站的目录设置太多,层次要清楚。
3、权重优先
这个比较好理解,主要是搜索引擎蜘蛛比较喜欢爬取质量好的链接内容。例如网易首页面,蜘蛛经常来,而不是很好的网站,蜘蛛就很少来。权重优先对SEOER的提醒是做质量好的外链很重要。
4、重访抓取
例如,搜索引擎蜘蛛前一天抓取了某网站的页面,而第二天该网站又增加了新的内容,那么搜索引擎蜘蛛就可以再次抓取到新的内容。长此以往,该网站在蜘蛛的“印象”中就很友好了。这个重访抓取策略不仅对SEOER有用,对网站建设也很有用:时时更新网站内容,也能使客户体验提升。
以上介绍了蜘蛛的爬取方式与内容,你应该理解为什么SEOER这么注重代码问题,URL设置,与原创更新了吧,希望这篇文章能帮助各位优化自己的网站,做出受“蜘蛛”欢迎的网站!
相关建站知识
- 06-11帝国CMS二次开发会员中心URL模板路径汇总
- 11-23帝国CMS按小时发布文章数的统计(详细说明)
- 03-16帝国CMS内容页面中Description里面调用简介信息
- 05-29帝国CMS在下载内容页downpath字段显示下载点数
- 12-08帝国cms解决tags中文地址的问题
- 04-21帝国cms正则提取正文newstext字段中所有图片的方法
- 05-20帝国cms二次开发常用变量、模板和函数大全免费分享给大家
- 07-16帝国CMS在内容模板里控制内容简介smalltext显示字数
- 05-13帝国CMS列表内容模板(list.var)调用会员头像会员名会员积分
- 05-14帝国cms使用灵动标签标题属性加粗颜色失效的解决方法
- 04-26帝国cms怎么上传大文件
- 12-05帝国cms内容页如何实现用键盘左右键翻页跳转下一页?
- 10-24帝国CMS用PHP获取任意栏目ID
- 02-13帝国模板列表栏目页面模板如何调用当前栏目ID方法是什么?
- 02-28帝国CMS调用栏目自定义字段方法
- 06-15帝国cms灵动标签同时调用头条(1级、2级)、推荐(1级、2级)
- 08-18帝国CMS内容页附件中文显示或者显示代码名称下载
- 12-07phome_enewspubvar 数据表字段解释(扩展变量表)
- 06-09帝国cms调用栏目别名的方法有哪些?
- 12-20帝国CMS广告JS防止被浏览器过滤拦截