百度如何判断网页文章的重复度?两个页面相似度确认方法介绍
这种方法能够计算的比较准确,可时间复杂度太高,计算很费时间。通过对一个页面中的某些重要信息进行签名,然后比较两个页面的签名,来计算相似度,这种方式比较简单高效,计算速度比较快,比较适合百度这种海量信息的应用场景。
1,网站重复内容的判断
A,获取多个网页;
B,分别提取网页的网页正文;
C,从网页正文中提取一个或多个句子,并根据一个或多个句子计算网页正文句子签名;
D,根据网页正文句子签名对多个网页进行聚类;
E,针对每一类下的网页,计算网页的附加签名;
F,根据附加签名判断每一类下的网页是否重复。
通过上述方式,网页重复的判断系统及其判断方法通过包括网页正文句子签名在内的多维度签名有效且快速地判断网页是否重复。
网站页面基本架构
提取正文
A,对网页进行分块;
B,对分块后的网页进行块过滤,以获取包含网页正文的内容快;
C,从内容块中提取网页正文。
正文分句
A,对网页正文进行分句;
在本步骤中,可利用分号,句号,感叹号等表示句子完结的标志符号来对网页正文进行分句。此外,还可以通过网页正文的视觉信息来对网页正文进行分句。
B,对分句后的网页正文进行过滤及转换;
在步骤中,首先过滤掉句子中的数字信息;版权信息以及其他对网页重复判断不起决定性作用的信息。随后,对句子进行转换,例如,进行全角/半角转换或者繁体/简体转换,以使得转换后的句子的格式统一。
C,从过滤及转换后的网页正文中提取最长的一个或多个句子;
在本步骤中,过滤及转换后的网页正文提取出最长的一个句子或者做场的预定数量连续句子的组合。例如,某个网页实例中,经过过滤及转换后的某段最长,远超其他句子,因此可选择该段为网页正文句子,或者选择最长的连续句子组合作为网页正文句子。
D,对一个或多个句子进行hash签名运算,以获取网页正文句子签名。
simhash算法就是比较各网页的附加签名是否相同或相似来判断网页是否重复。具体来说,在比较利用simhash签名运算获得的网页正文签名时,比较网页正文签名的不同位数,不同位越少,表示网页重复的可能性越高,在比较其他的附加签名时,若附加签名相等,表示网页在该纬度上重复。
总结:
1、两个网页的真实标题签名相同。
2、两个我那工业的网页内容签名相同。
3、两个网页的网页正文签名的不同位数小于6.。
4、两个网页的网页位置签名相同,并且url文件名签名相同。
5、评论块签名、资源签名、标签标题签名、摘要签名、url文件名签名中有三个签名相同。
附加信息整站判断重复标准:
通过两两页面比较,可以得到真重复url的集合。一般来说,如果这个真重复url集合中的网页的数量/整个网页集中网页的数量大于30%,则认为整个网页集都是真重复,否则就是假重复。
相关建站知识
- 10-02灵动标签调用当前信息栏目名称和链接
- 11-06帝国CMS多表联合调用代码
- 03-03帝国CMS下载内容页模板中调用下载扣除点数
- 07-18帝国CMS评论调用自定义字段的方法
- 07-03帝国cms后台出现Fail to connect ftp host!
- 12-16帝国CMS调用栏目别名的两种方法!
- 12-03内容权限判断帝国cms教程
- 01-03帝国CMS调用最新DIGG顶的最多的文章
- 08-28帝国CMS列表页模板随机有规律的插入增加广告流隔行广告
- 04-30帝国CMS截取标题后面显示...
- 03-12帝国cms网站模板系统批量清理会员使用方法
- 01-18帝国cms网站URL路径栏目目录的灵活更改方式
- 10-11帝国CMS二次开发自定义页面调用会员信息
- 02-22帝国CMS灵动标签循环子栏目导航
- 12-05帝国cms模板利用php实现无限级导航的代码
- 04-14帝国CMS自定义JS语法集合
- 12-28帝国CMS支持显示标题颜色的标题灵动标签
- 09-10phome_enewspublic 数据表字段解释(系统参数配置表)
- 04-28帝国cms灵动标签同时调用头条和推荐
- 02-18帝国CMS新手教程no.num标签的用法