开关信息网——开关采购与销售:开关,轻触开关,拨动开关,钮子开关,叶片开关,琴键开关,录放开关,直键开关,电源开关,微动开关,高压开关,低压开关,断路器,防爆电器,继电器,薄膜开关,保险元件,插座

 

      免费注册 会员登录 返回首页

供应信息 产品图片 行业资讯 帮  助

 

客户服务QQ

收藏本站

 普通开关||遥控开关||低压开关||高压开关||成套开||建筑开关||空开关||防爆开关||接近开关||光电开关||薄膜开关||继电器||其它开关

 开关配件及原材料||新品动态||行业信息||知识窗||环保节能||论坛/展会||企业人物||检测与认证||标准||行业专著||政策法规||质量技术监督

    >>> 欢迎发表行业文章     (申明:未经授权禁止转载、摘编、复制或建立镜像,如有违反,追究法律责任)

   
Google的搜索结果排列算法

该信息已被浏览2264次

 
  图书馆管理员们提出最多的问题之一是:“对于什么样的结果应该位于搜索列表的最上方,Google是如何选择的?”现在品质工程师马特-卡兹介绍了快速入门的知识,解释了Google是如何在网上爬行和索引,以及如何评定搜索结果等级的。马特也向学校图书馆管理员提出建议,告诉他们如何辅导学生。

爬行和索引

在你浏览包含了Google搜索结果的网页之前,要发生很多事情。首先是在万维网数以十亿计的网页上爬行和索引,这个工作是由Googlebot完成的,它负责与全球的网络服务器连接以收集文件。爬行不是真的在网上漫游,而是访问网络服务器返回到一个特定的网页上,接着扫描该网页建立超链接并为每一个网页编上号码。爬行可收集大量的文件,但这些文件还不能直接用于搜索。

如果没有索引,在你想查询如“civil war”(南北战争)等内容时,Google的服务器将不得不在你每次搜索时阅读每一份文件的内容。因此第二个步骤是要建立一个索引,这样就需要“转换”爬行所获得的数据。为了不必在每一份文件上扫描每一个单词,就需要在数据上做些文章,以便显示包含了特定单词的所有文件。例如,假设单词“civil”在编号为3、8、22、56、68和92的文件上出现过,而单词“war”出现编号为2、8、15、22、68和77的文件上。

一旦建立了索引,就开始对文件进行等级评定并确定它们的相关性。假如某个人上Google搜索并输入“civil war”,为呈现和评价搜索结果需要做两件事:一是查找包含了用户提问的网页;二是按照相关性排定匹配网页的位置。Google已经开发出一个有趣的技术可加速第一步骤的过程:不是将所有索引存储在一台电脑上,而是使用数百台电脑做这种工作。由于任务被分配到很多电脑上,使得查询答案更为迅速。

为更加形象地描述这个过程,可以设想下一本30页厚书的索引。如果一个人在索引中查找数页的信息,那么每一次搜索都至少需要花几秒钟的时间;但如果你将索引的每一页分给不同的人去查找呢?三十个人分别查找索引的不同部分,要比一个人独自查找快的多。同样,Google也是将数据分配到各台电脑上以便可以更快地查找文件。

如何查找包含了用户提问的网页?让我们返回到上面举的“civil war”例子。单词“civil”在编号为3、8、22、56、68和92的文件上,单词“war”在编号为2、8、15、22、68和77的文件上,我们可以在网页上显示文件并寻找包含两个单词的文件(从下表中可以看出是8、22和68号文件)。

单词civil 3 8 22 56 68 92

单词war 2 8 15 22 68 77

两个单词都出现 8 22 68

包含了一个单词的文件列表被称为“文件标识列表”,查找包含两个单词的文件被称为“文件标识列表的交集”。

评定搜索结果

有了包含用户提问的网页后,就该按照相关性评定网页了。Google使用了很多技术,其中PageRank算法是最有名的。PageRank评定的是两种事情:从网站到某一网页有多少个链接,提供链接的网站的排名。使用PageRank,来自CNN和纽约时报网站的链接的价值,是很多不太有名网站的两倍。

除了PageRank外Google还使用了很多其他技术,例如一份文件所包含的“civil”和“war”两个单词靠的很近,就比只使用了“war”单词的包含“Revolutionary War”(独立战争)的文件相关性要大的多。另外在题目中出现了“civil war”的网页,它的相关性就比题目为“19th Century American Clothing”(19世纪的美国服装)要重要的多。同样如果“civil war”在网页上出现了数次,比出现一次的网页要相关的多。

Google的目的是要找到知名度和相关性都大的网页。如果两个网页出现匹配提问的信息数量几乎一样,我们常常会选择更有名网站的链接。但如果其他方面表明一个网页更为相关,也会选择更少链接或更低排名的网页。例如,一个网页全篇都是讲“南北战争”的内容,会比只是略微提到“南北战争”的网页更为有用,即使这个网页是出现不太有名的网站上。一旦我们有了文件的列表和分值,就会选择最高分值、最匹配的文件。

Google从包含了提问单词的每一份文件中提取几句话作为摘要显示,接着将排好的URLs和摘要显示在搜索结果上。正如你所知道的运行一个搜索器需要大量的计算资源。每一次搜索需要500台以上的电脑一起工作,搜索的时间还不到半秒钟。

发表时间:2005年12月23日   网易科技报道

 相关主题
·Google欲与中国移动合作 抢滩中国市场[2006/5/19]
·Google Earth的N种玩法[2006/5/14]
·Google击败雅虎微软获搜索新算法[2006/4/11]
·Google点击欺诈和解仍存隐患 可能再遭诉讼[2006/4/11]
·搜索引擎现黑马 Ask体验超过Google [2006/4/4]
·Google图书搜索推网上读书权销售代理服务[2006/3/14]

| 关于本站 | 人才招聘 | 联系我们 | 产品目录设计印刷 | 网络广告 | 企业建站 | 空间租用 | 域名注册 | 帮助 | 收藏本站 |

更 多 友 情

绝缘网 开关信息网 网易 百度 上海插头插座网 家用电器协会
耐火材料行业网 印制电路行业协会 深圳机械行业协会 深圳市信息行业协会 工业电器品牌网 电子仪器行业协会

    采 购 商 快 通 道

·美的 ·三菱 ·东芝 ·艾美特 ·新飞 ·先锋 ·荣事达 ·远大 ·春兰 ·NEC ·大连三洋 ·格兰仕
·理光 ·夏普 ·创维 ·小天鹅 ·新科 ·SONY ·苏泊尔 ·容声 ·厦华 ·松下 ·麦克维尔 ·史密斯
·倍科 ·日立 ·海信 ·安吉尔 ·三星 ·康佳 ·澳柯玛 ·科龙 ·三洋 ·厦新 ·伊莱克斯 ·亿利来
·联想 ·长城 ·佳能 ·奥克斯 ·惠普 ·柯达 ·惠而浦 ·志高 ·CAV ·美加 ·惠威音响 ·惠浦
·熊猫 ·格力 ·帅康 ·步步高 ·JVC ·老板 ·奥得奥 ·方太 ·华帝 ·万和 ·山东小鸭 ·德赛
·龙的 ·雅佳 ·大金 ·爱斯特 ·创佳 ·奇声 ·比力奇 ·南艺 ·爱浪 ·安朗 ·飞利浦 ·奇迪
·开灵 ·惠林 ·同益 ·万利达 ·天加 ·开利 ·迪帕迩 ·泰豪 ·新雅 ·海尔 ·万家乐 ·长虹
·美声 ·LG ·TCL

 ·美菱

 
  中文域名:开关信息网.cn    通用网址/网络实名:开关信息网    客户服务电话:0755-83360340 
客户服务QQ     客户服务传真:0755-83360340    备案序号:粤ICP备05029942号
  
申明:开关信息网版权所有 未经授权禁止转载、摘编、复制或建立镜像,如有违反,追究法律责任
Copyright ©  2002-2009    All Rights Reserved       E-mail:info@kgchina.com
免责声明:
本站部分信息由企业自行提供,本站对其内容的真实性、准确性和合法性不承担任何保证责任。