ARTICLES
百度的搜索引擎是如何工作的
2017-07-25 09:04:500字号:
  当搜索工具蜘蛛将目标网站内容索引后就会通过中文分词语相关技术进行入库。这应该是一个庞大的工程,百度搜索工具对中文分词语相关技术掌握非常熟练,这也应该是在中文搜索领域百度搜索工具一直独大可能的因素。下面大家来看百度中文分词语的基本运行规律。
 
   这个不复杂,就应该是根据词语组的统计,如果查找到两个相邻的字出现的频率最多,那么这个词语就比较重要,就可以作为客户群体提供字符串中的分隔符。这些词语出现得比较多,就从这些词语里面分开来。
  这些分出来的词语,把它们都作为你站点的主题页,导入链接权重上来了,竞争力就大了,因为这些页面把它内链起来。用锚链接,指向主页的目标关键词语。这就应该是分词语的好处。它能够提升目标关键词语的排名的竞争力,同时给站点带来一定流量。一旦导入链接权重上来了,竞争力就大了,因为这些页面把它内链起来。
  最短路径分词语法。这个怎么理解呢?就应该是对一段话切出最少的词语数。还应该是用上面那句话“不知道你在说哪些内容”举例,用最短路径分词语法来分,就应该是把这句话分成最少的词语。“不知道,你在,说哪些内容”,这就应该是最短路径分词语法,分出来后只有3个词语。当然,上面三种可以相互结合组成一些分词语方法。比如,正向最大匹配法和反向最大匹配法组合起来就可以叫作双向最大匹配法。
  字符串匹配的分词语方法首先来看正向最大匹配法,就应该是把一个词语从左至右来分词语。举个例子:“不知道你在说哪些内容”,这句话采用正向最大匹配法应该是如何分的呢?分出来应该是:“不知道,你,在,说哪些内容。”其次应该是反向最大匹配法。
  这其实就应该是一种机器语音判断的分词语方法。比较不复杂,进行句法、语义分析,利用句法信息和语义信息来处理歧义现象进行分词语。这种分词语方法,现在还不成熟,处在测试阶段。来看上面我举的例子“不知道你在说哪些内容”用反向最大匹配法如何分。答案应该是:“不,知道,你在,说,哪些内容。”这个就分得比较多了,反向最大匹配法就应该是从右至左来分词语。
  中文分词语问题应该是绝大多数中文信息处理的基本问题,在搜索工具.推荐系统(尤其应该是相关主题推荐和基于内容的过滤推荐)、大量文本自动分类等方面应该是一个关键部件。