搜索引擎基本工作原理【转】

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

了解搜索引擎的工作原理对我们日常搜索应用和网站提交推广都会有很大帮助。

........................................................................................

 ■ 全文搜索引擎

  在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立网页数据库的概念。搜索引擎的自动信息搜集功能分两种。一种是定期搜索,即每隔一段时间(比如Google一般是28天),搜索引擎主动派出“蜘蛛”程序,对一定IP地址范围内的互联网站进行检索,一旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库。

  另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内(2天到数月不等)定向向你的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库,以备用户查询。由于近年来搜索引擎索引规则发生了很大变化,主动提交网址并不保证你的网站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接,让搜索引擎有更多机会找到你并自动将你的网站收录。

  当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相符的网站,便采用特殊的算法——通常根据网页中关键词的匹配程度,出现的位置/频次,链接质量等——计算出各网页的相关度及排名等级,然后根据关联度高低,按顺序将这些网页链接返回给用户。

........................................................................................

 ■ 目录索引

  与全文搜索引擎相比,目录索引有许多不同之处。

  首先,搜索引擎属于自动网站检索,而目录索引则完全依赖手工操作。用户提交网站后,目录编辑人员会亲自浏览你的网站,然后根据一套自定的评判标准甚至编辑人员的主观印象,决定是否接纳你的网站。

  其次,搜索引擎收录网站时,只要网站本身没有违反有关的规则,一般都能登录成功。而目录索引对网站的要求则高得多,有时即使登录多次也不一定成功。尤其象Yahoo!这样的超级索引,登录更是困难。(由于登录Yahoo!的难度最大,而它又是商家网络营销必争之地,所以我们会在后面用专门的篇幅介绍登录Yahoo雅虎的技巧

  此外,在登录搜索引擎时,我们一般不用考虑网站的分类问题,而登录目录索引时则必须将网站放在一个最合适的目录(Directory)。

  最后,搜索引擎中各网站的有关信息都是从用户网页中自动提取的,所以用户的角度看,我们拥有更多的自主权;而目录索引则要求必须手工另外填写网站信息,而且还有各种各样的限制。更有甚者,如果工作人员认为你提交网站的目录、网站信息不合适,他可以随时对其进行调整,当然事先是不会和你商量的。

  目录索引,顾名思义就是将网站分门别类地存放在相应的目录中,因此用户在查询信息时,可选择关键词搜索,也可按分类目录逐层查找。如以关键词搜索,返回的结果跟搜索引擎一样,也是根据信息关联程度排列网站,只不过其中人为因素要多一些。如果按分层目录查找,某一目录中网站的排名则是由标题字母的先后顺序决定(也有例外)。

  目前,搜索引擎与目录索引有相互融合渗透的趋势。原来一些纯粹的全文搜索引擎现在也提供目录搜索,如Google就借用Open Directory目录提供分类查询。而象 Yahoo! 这些老牌目录索引则通过与Google等搜索引擎合作扩大搜索范围(注)。在默认搜索模式下,一些目录类搜索引擎首先返回的是自己目录中匹配的网站,如国内搜狐、新浪、网易等;而另外一些则默认的是网页搜索,如Yahoo。

  (注):Yahoo已于2004年2月正式推出自己的全文搜索引擎,并结束了与Google的合作。

【转自:http://www.se-express.com/about/about2.htm

Elasticsearch搜索引擎 本篇博客系统地介绍了Elasticsearch 7.14.0在windows环境下安装、基本使用、Springboot集成Elasticsearch以及ELK搭建。 阅读详情

相关推荐

ElasticSearch——全文搜索引擎

一、为什么需要全文搜索引擎? 首先先来了解一个概念,在我们生活中一般来说有两种数据:结构化数据、非结构化数据 结构化数据:指具有固定格式或有限长度的数据,如数据库,元数据等。 非结构化数据: 非结构化数据又可称为全文数据,指不定长或无固定格式的数据,如邮件,word文档等。 对于结构化数据我们可以直接从数据库查询,而对于非结构化的数据此时就要用到全文检索的方式查询,比如对一个文档或者网页中的内容文本每个词建立一个索引,把这些非结构化的变成结构化的方式然后来查询。 全文搜索引擎百度百科定义:全文搜索引擎是目前

hl404的博客 1万+

openwrt-tbs5520se_openwrt_www.5520se.com_tbs5520se_dvb_5520se.co

openwrt挂载TBS5520SE,DVB-S、DVB-C、DVB-T,搭建Tvheadend服务器

搜索引擎工作原理解析

本篇文章从整个搜索引擎架构技术大框架方面来学习,搜索引擎工作原理。 1 搜索引擎基本模块 2 爬虫 网络爬虫(Web crawler),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本,它们被广泛用于互联网搜索引擎或其他类似网站,可以自动采集所有其能够访问到的页面内容,以获取或更新这些网站的内容和检索方式。从功能上来讲,爬虫一般分为数据采集,处理,储存三个部分。传统爬...

安东尼的博客 1万+

一文详解搜索引擎工作原理

本文将对搜索引擎工作原理进行详解

2401_83912923的博客 2696

se网站服务器,www.se8088.com服务器iP

2021-07-23-----2021-08-10101.32.211.1032021-07-02-----2021-07-24154.13.30.102021-06-30-----2021-07-23154.13.30.82021-07-09-----2021-07-23154.13.30.112021-05-16-----2021-07-22154.13.30.92021-05-08-----...

weixin_33733806的博客 4万+

搜索引擎工作原理分析

(1)搜索引擎前台工作原理:当用户在百度搜索信息时,百度呈现其需要的信息页面反回给用户。首先百度根据用户提供的信息关键词通过检索器按照词组进行划分、消噪等检索服务后在索引数据库寻找用户需要的信息,在得到所需的关键词信息后对其进行计算、排序等流程反回给检索器,检索器再反回到百度搜索页面呈现需要的信息给用户。 (2)搜索引擎后台工作原理: 后台处理方式是以蜘蛛程序进行的,搜索引擎派出蜘蛛根据各个网站的...

KKKkJzy的博客 1093

搜索引擎基本工作原理

搜索引擎基本工作原理包括如下三个过程:首先在互联网中发现、搜集网页信息;同时对信息进行提取和组织建立索引库;再由检索器根据用户输入的查询关键字,在索引库中快速检出文档,进行文档与查询的相关度评价,对将要输出的结果进行排序,并将查询结果返回给用户。   工作原理编辑 1、抓取网页。每个独立的搜索引擎都有自己的网页抓取程序爬虫(spider)。爬虫Spider顺着网页中的超链接,从这个网站爬到...

weixin_33869377的博客 917

[]搜索引擎基本工作原理

搜 索 引 擎 分 类   搜索引擎按其工作方式主要可分为三种,分别是全文搜索引擎(Full Text Search Engine)、目录索引类搜索引擎(Search Index/Directory)和元搜索引擎(Meta Search Engine)。  ■ 全文搜索引擎   全文搜索引擎是名副其实的搜索引擎,国外具代表性的有Google、Fast/AllTheWeb、AltaVis...

weixin_33739627的博客 216

SEO必读:搜索引擎基本知识及其工作原理

首先我们得提一个SEO的专有名词“蛛蛛”。这个也是每个搜索引擎用来爬行和访问页面的一个程序,也叫机器人。这里我为蛛蛛这个名词做一下解释:在我看来,之所以把他称为蛛蛛。是因为蛛蛛都是顺着网上的链接代码来访问互联网上的每个网站,而且每个网站的这些链接其实就像一张非常复杂的网,蛛蛛要做的就是在这张网上抓取信息,这个形式非常类似蛛蛛这个动物,所以也就有了一个形像的比喻。

jrseo的专栏 408

搜索引擎基本工作原理(自:http://www.se-express.com/about/about2.htm)

搜索引擎基本工作原理 了解搜索引擎工作原理对我们日常搜索应用和网站提交推广都会有很大帮助。 ...................................

半亩方塘 1667

ES6数组换:基于gh_mirrors/es/es6features项目的entries方法

你是否还在为数组遍历中需要同时获取索引和值而编写额外代码?是否觉得传统for循环不够简洁直观?本文将基于[gh_mirrors/es/es6features](https://link.gitcode.com/i/41e71ef0333500fcde92235f9b2583a0)项目,详细介绍ES6中数组换的强大工具——`entries()`方法,帮你轻松解决这些问题。读完本文,你将掌握`ent...

gitblog_00907的博客 704

Elasticsearch基本概念

本文主要是对ES基本概念进行整合,理论先行,夯实对ES的基本概念,在知道“是什么”,才能提高学习效率,保姆级学习教程请移步: ES入门笔记. 一、前文介绍 Elasticsearch(简称ES)是一个基于Apache Lucene™的开源搜索引擎,无论在开源还是专有领域,Lucene 可以被认为是迄今为止最先进、性能最好的、功能最全的搜索引擎库。注意,Lucene 只是一个库。想要发挥其强大的作用,你需使用 Java 并要将其集成到你的应用中。 Lucene 非常复杂,你需要深入的了解检索相关知识来理解它

chwensrong的博客 4万+

ES基本介绍

简介 ES是一个基于RESTful web接口并且构建在Apache Lucene之上的开源分布式搜索引擎。 同时ES还是一个分布式文档数据库,其中每个字段均可被索引,而且每个字段的数据均可被搜索,能够横向扩展至数以百计的服务器存储以及处理PB级的数据。 可以在极短的时间内存储、搜索和分析大量的数据。通常作为具有复杂搜索场景情况下的核心发动机。 ES就是为高可用和可扩展而生的。一方面可以通...

NasubiZW 31万+

全文搜索引擎 ES(Elasticsearch) 简单使用说明

全文搜索引擎 ES(Elasticsearch) 简单使用说明

lianzuo123的博客 5062

搜索引擎基本工作原理

搜索引擎基本工作原理包括如下三个过程:首先在互联网中发现、搜集网页信息;同时对信息进行提取和组织建立索引库;再由检索器根据用户输入的查询关键字,在索引库中快速检出文档,进行文档与查询的相关度评价,对将要输出的结果进行排序,并将查询结果返回给用户。 工作原理 1、抓取网页。每个独立的搜索引擎都有自己的网页抓取程序爬虫(spider)。爬虫Spider顺着网页中的超链接,

basycai的博客 3104

Elasticsearch:什么是搜索引擎

搜索引擎对于希望快速有效地查找特定信息的用户来说是有用的工具。它们的范围、功能和索引的内容类型各不相同。这种多功能性可以满足不同环境下的特定用户需求。搜索引擎可以是巨大的互联网搜索引擎,旨在对网络上的所有内容进行编目,也可以是旨在在组织内部使用以使内部信息发现更容易的企业搜索引擎。它们甚至包括为本地网络上的文件建立索引的桌面搜索引擎

Elastic 中国社区官方博客 3532

ElasticSearch学习总结(二):ES介绍与架构说明

本文主要从概念以及架构层面对Elasticsearch做一个简单的介绍,在介绍ES之前,会先对ES的“发动机”Lucene做一个简单的介绍 1. Lucene介绍 为了更深入地理解ElasticSearch的工作原理,特别是索引和查询这两个过程,理解Lucene的工作原理至关重要。本质上,ElasticSearch是用Lucene来实现索引的查询功能的。 1.1 定义 Lucene是一...

不积跬步,无以至千里;不积小流,无以成江海! 1万+

深入探索ES之关于Elasticsearch的基本了解

关于Elasticsearch的基本了解 Elasticsearch是实时的分布式索引分析引擎,内部使用Lucene做索引与搜索。 实时:指的是新增的数据会很快被检索到; 分布式:可以动态调整集群规模,弹性扩容。 Lucene:是Java语言编写的全文搜索框架,用于处理纯文本的数据,但它只是一个库,提供建立索引、执行搜索等接口,但是不提供分布式服务。 ES中的基本概念 cluster:代表一个集...

蹊源的奇思妙想的博客 2552
上一篇: 搜索引擎常用搜索方法问答
下一篇: 网络搜索与信息收集路路通
husn
博客等级 码龄21年 11粉丝 64原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值