网络搜索查询指自动从万维网搜集信息,经过一定整理以后,提供给用户进行查询的系统。
工作原理搜索引擎的工作原理大致可以分为:1
搜集信息:搜索引擎的信息搜集基本都是自动的。搜索引擎利用称为网络蜘蛛的自动搜索机器人程序来连上每一个网页上的超链接。机器人程序根据网页链到其中的超链接,就像日常生活中所说的“一传十,十传百……”一样,从少数几个网页开始,连到数据库上所有到其他网页的链接。理论上,若网页上有适当的超链接,机器人便可以遍历绝大部分网页。
整理信息:搜索引擎整理信息的过程称为“创建索引”。搜索引擎不仅要保存搜集起来的信息,还要将它们按照一定的规则进行编排。这样,搜索引擎根本不用重新翻查它所有保存的信息而迅速找到所要的资料。想象一下,如果信息是不按任何规则地随意堆放在搜索引擎的数据库中,那么它每次找资料都得把整个资料库完全翻查一遍,如此一来再快的计算机系统也没有用。
接受查询:用户向搜索引擎发出查询,搜索引擎接受查询并向用户返回资料。搜索引擎每时每刻都要接到来自大量用户的几乎是同时发出的查询,它按照每个用户的要求检查自己的索引,在极短时间内找到用户需要的资料,并返回给用户。目前,搜索引擎返回主要是以网页链接的形式提供的,这样通过这些链接,用户便能到达含有自己所需资料的网页。通常搜索引擎会在这些链接下提供一小段来自这些网页的摘要信息以帮助用户判断此网页是否含有自己需要的内容。
整理信息及接受查询的过程,大量应用了文本信息检索技术,并根据网络超文本的特点,引入了更多的信息。
发展史1990年初当时万维网还未出现,为了查询散布在各个分散的主机中的文件,曾有过Archie、Gopher等搜索工具,随着互联网的迅速发展,基于HTTP访问的web技术的迅速普及,他们就不再能适应用户的需要。在1994年1月,第一个既可搜索又可浏览的分类目录EINet Galaxy(Tradewave Galaxy)上线,它还支持Gopher和Telnet搜索。同年4月,Yahoo目录诞生,随着访问量和收录链接数的增长,开始支持简单的数据库查询。这就是我们说的早期的目录导航系统,他们的缺点是网站收录/更新都要靠人工维护,所以在信息量剧增的条件下,就不是非常受用了。
1994年7月,Lycos推出了基于robot的数据发掘技术,并支持搜索结果相关性排序,并且他第一个开始在搜索结果中使用了网页自动摘要。Infoseek也是同时期的一个重要代表,他们是搜索引擎史上一个重要的进步。
1995年全球第一个华文搜索引擎蕃薯藤于台湾成立。
1995年,一种新的搜索引擎工具出现了——中介搜索引擎(Meta Search Engine)或称为元搜索引擎,第一个中介搜索引擎是华盛顿大学的学生开发的Metacrawler。用户只需提交一次搜索请求,由中介搜索引擎负责转换处理后提交给多个预先选定的独立搜索引擎,并将从各独立搜索引擎返回的所有查询结果,集中起来处理后再返回给用户。
1995年12月才登场亮相的AltaVista推出了大量的创新功能使它迅速到达当时搜索引擎的顶峰,它第一个支持自然语言搜索的搜索引擎,具备了基于网页内容分析,智能处理的能力,第一个实现高级搜索语法的搜索引擎(如AND、OR、NOT等),同时AltaVista还支持搜索新闻组,搜索图片等具有划时代意义的功能。同时期还有inktomi、HotBot等搜索引擎。
1997年8月Northernlight公司正式推出搜索引擎,它第一个支持对搜索结果进行简单的自动分类,也是当时拥有最大数据库的搜索引擎之一。
1998年台湾PChome的前身todo网站成立。
1998年10月,Google诞生。它是目前世界上最流行的搜索引擎之一,具备很多独特而且优秀的功能,并且在界面等实现了革命性创新。
1999年5月,Fast (Alltheweb)公司发布了自己的搜索引擎AllTheWeb,它的网页搜索可利用ODP自动分类,支持Flash和pdf搜索,支持多语言搜索,还提供新闻搜索、图像搜索、视频、MP3、和FTP搜索,拥有极其强大的高级搜索功能。它曾经是最流行的搜索引擎之一,后在2003年2月被Overture收购。
在中文搜索引擎领域,1996年8月成立的搜狐公司是最早参与作网络信息分类导航的网站,曾一度自诩“出门找地图,上网找搜狐”的夸大广告词。由于其人工分类提交的局限性,随着网络信息的暴增,逐渐被基于robot自动抓取智能分类的新一代信息技术取代。
台湾中正大学吴昇教授所领导的GAIS实验室1998年1月创立了Openfind中文搜索引擎,是最早开发的中文智能搜索引擎,采用GAIS实验室推出多元排序(PolyRankTM)核心技术,截止2002年6月,宣布累计抓取网页35亿,开始进入英文搜索领域。
北大天网是教育网最流行的搜索引擎,它由北大计算器系网络与分布式系统研究室开发,于1997年10月29日正式在CERNET上提供服务,2000年初成立天网搜索引擎新课题组,由国家973重点基础研究发展规划项目基金资助开发,收录网页约6000万,利用教育网优势,有强大的ftp搜索功能。
百度中文搜索由超链分析专利发明人、前Infoseek资深工程师李彦宏和好友徐勇2000年1月创建,目前支持网页信息检索,图片,Flash,音乐等多媒体信息的检索。并且百度在中文领域第一个开始使用ppc经营模式。
2002年开始很多公司受搜索市场前景和Google神话的吸引,积极进入搜索引擎市场,谋求一席之地。但是不幸的是他们当中很多公司尤其是不少中国公司采用流氓手段进行自己搜索引擎的推广工作,常用的手段是浏览器劫持、恶意捆绑adware/spyware等等,比较恶劣的典型公司是中搜、3721等等。中搜是由慧聪国际主持开发的,自称是搜索领域的后起之秀。目前处于起步阶段,但是采用流氓软件手段推广后,强占了不少用户的搜索引擎选择。2003年年底慧聪搜索改名为中国搜索,推出第三代智能搜索引擎。中国搜索主推桌面搜索——网络猪,是备受争议的流氓软件之一。
2003年11月,Yahoo全资收购3721公司。2005年8月,阿里巴巴和Yahoo达成战略合作,全资收购雅虎中国,并更名为阿里巴巴雅虎,并将其业务重点全面转向搜索领域。
2004年8月3日,搜狐公司推出中文搜索引擎搜狗。
2006年9月,微软公司正式推出了拥有自主研发技术的Live Search,宣布进军搜索引擎市场,挑战Google在网络搜索领域的霸主地位。
2006年12月,网易公司推出中文搜索引擎有道。
2009年6月1日,微软正式上线原名为Kumo的搜索引擎Bing,中文名“必应”,但是由于不久后的“六四事件”20周年,Bing只在中国上线了1天即被防火长城屏蔽,6月6日,Bing解封。
2009年11月,微软学术搜索Microsoft Academic Search beta版激活,该搜索引擎目前主要提供计算器学科及相关领域的学术论文、作者、会议和学术期刊。
2016年12月,LinAsk!恒问推出LinAsk!恒问搜索引擎。
2017年4月,LinAsk!恒问推出应搜搜索引擎。
分类搜索引擎按其工作方式主要可分为三种,分别是全文搜索引擎(Full Text Search Engine)、垂直搜索引擎(Vertical Search Engine)和元搜索引擎(Meta Search Engine)。
全文搜索引擎
全文搜索引擎是名副其实的搜索引擎,欧美具代表性的有Google、Fast/AllTheWeb、AltaVista、Inktomi、Teoma、WiseNut等,中国著名的有百度(Baidu)。它们都是通过从互联网上提取各个网站的信息(以网页文字为主)而创建的数据库。检索与用户查询条件匹配的相关记录,然后按一定的排列顺序将结果返回给用户,因此他们是真正的搜索引擎。
垂直搜索引擎
垂直搜索引擎是针对某一个行业的专业搜索引擎,是搜索引擎的细分和延伸,是对网页库中的某类专门的信息进行一次集成,定向分字段抽取出需要的数据进行处理后再以某种形式返回给用户。垂直搜索是相对通用搜索引擎的信息量大、查询不准确、深度不够等提出来的新的搜索引擎服务模式,通过针对某一特定领域、某一特定人群或某一特定需求提供的有一定价值的信息和相关服务。例如,著名的百度图片搜索,互联统计网等都是针对某一领域而采用的垂直搜索引擎。
元搜索引擎
元搜索引擎在接受用户查询请求时,同时在其他多个引擎上进行搜索,并将结果返回给用户。著名的元搜索引擎有InfoSpace、Dogpile、Vivisimo等(元搜索引擎列表),中文元搜索引擎中具代表性的有搜星搜索引擎。在搜索结果排列方面,有的直接按来源引擎排列搜索结果,如Dogpile,有的则按自定的规则将结果重新排列组合,如Vivisimo。
商务搜索引擎的商务是一种新的商业模式,在中国大陆还有很多人用网址大全去寻找商业平台网站的时候,搜索引擎营销的方式慢慢的兴起,越来越多的买家又或卖家通过搜索引擎来寻找自己的需要。其中以Google最为出名,可以说是一代搜索引擎的楷模。Google以其优秀的搜索算法,不被竞价排名所笼罩的搜索引擎。
依照地区而有不同,在台湾较多使用雅虎搜索引擎,在中国则较多人使用百度搜索引擎。
此外,如雅虎、百度等门户网站,前者结合电视广告进行“关键字广告”的检索,而后者有“竞价排名”的模式。
未来展望随着互联网的发展,网上可以搜索的网页变得愈来愈多,而网页内容的质量亦变得良莠不齐,没有保证。所以,未来的搜索引擎将会朝着知识型搜索引擎的方向发展,期以为搜索者提供更准确及适用的数据。目前,网上的百科全书如雨后春笋般发展起来;另一方面,近年来亦有不少公司尝试在搜索方面改进,务求更匹配用户的要求。当中诸如Copernic Agent之类的搜索代理就是其中之一。
消费者保护2013年6月25日,美国联邦交易委员会发布新版的消费者保护命令,要求搜索引擎必须要能够明显区分出搜索结果及广告。
参见互联网主题
信息技术主题
搜索引擎列表
搜索结果页
文本信息检索
知识管理(knowledge management)
商业网站
个性化检索
搜索引擎营销(SEM)
搜索引擎最优化(SEO)
垃圾链接
本词条内容贡献者为:
黄伦先 - 副教授 - 西南大学