中文搜索引擎指南网

标题: 搜索引擎工作原理 [打印本页]

作者: sowang 时间: 2021-2-9 15:48
标题: 搜索引擎工作原理
基本流程

抓取网页。每个独立的搜索引擎都有自己的网页抓取程序爬虫（Spider）。爬虫顺着网页中的超链接，从这个网站爬到另一个网站，通过超链接分析连续访问抓取更多网页。被抓取的网页被称之为网页快照。由于互联网中超链接的应用很普遍，理论上，从一定范围的网页出发，就能搜集到绝大多数的网页。

处理网页。搜索引擎抓到网页后，还要做大量的预处理工作，才能提供检索服务。其中，最重要的就是提取关键词，建立索引库和索引。其他还包括去除重复网页、分词（中文）、判断网页类型、分析超链接、计算网页的重要度/丰富度等。

提供检索服务。用户输入关键词进行检索，搜索引擎从索引数据库中找到匹配该关键词的网页；为了用户便于判断，除了网页标题和URL外，还会提供一段来自网页的摘要以及其他信息。

搜索引擎的自动信息搜集功能

提交网站搜索。站长主动向搜索引擎提交网址，它在一定时间内定向向你的网站派出爬虫，扫描你的网站并将有关信息存入数据库，以备用户查询。由于搜索引擎索引规则相对于过去已发生很大变化，主动提交网址并不保证你的网站能进入搜索引擎数据库，因此站长应该在网站内容上多下功夫，并让搜索引擎有更多机会找到你并自动将你的网站收录。

当用户以关键词查找信息时，搜索引擎会在数据库中进行搜寻，如果找到与用户要求内容相符的网站，便采用特殊的算法——通常根据网页中关键词的匹配程度，出现的位置、频次，链接质量等——计算出各网页的相关度及排名等级，然后根据关联度高低，按顺序将这些网页链接返回给用户。

欢迎光临中文搜索引擎指南网 (http://sowang.com/bbs/)