SEO优化

搜索引擎优化基础(二)

搜索引擎爬虫程序

一、什么是搜索引擎爬虫程序

网络爬虫(又被称为网页蜘蛛,网络机器人,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁,自动索引,模拟程序或者蠕虫。

这些处理被上海网站建设称为网络抓取或者蜘蛛爬行。很多wordpress网站建设站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。

一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。

二、爬虫程序的种类以及分辨

搜索引擎派出他们的爬虫程序去访问、索引网站内容,但是由于搜索引擎派爬虫程序来访会在一定程度上影响网站性能。在你的服务器日志文件中,可见每次访问的路径和相应的 IP 地址,如果是爬虫程序来访,则user-agent 会显示 Googlebot 或MSNBot 等搜索引擎爬虫程序名称,每个搜索引擎都有自己的user-agent,以下分别列出国内主要的爬虫程序。

百度 baidu.com—-Baiduspider

http://www.baidu.com/search/spider.htm

谷歌 google.com—-Googlebot

http://www.google.com/bot.html

雅虎 yahoo.com—-Yahoo

http://misc.yahoo.com.cn/help.html

有道 yodao.com—-YodaoBot

http://www.yodao.com/help/webmaster/spider/

搜搜 soso.com—-Sosospider/Sosoimagespider

http://help.soso.com/webspider.htm

http://help.soso.com/soso-image-spider.htm

搜狗 sogou.com—-sogou

http://www.sogou.com/docs/help/webmasters.htm

微软 msn.com—-msnbot

http://search.msn.com/msnbot.htm

 

 

认识主流搜索引擎

1.关于百度

百度公司(baidu.com,inc)于1999年底成立于美国硅谷,它的创建者是在美国硅谷有多年成功经验的李彦宏先生及徐勇先生。2000年1月,百度公司在中国成立了它的全资子公司-百度网络技术(北京)有限公司,随后于同年10月成立了深圳分公司,2001年6月又在上海成立了上海办事处。

百度的名字寄托着百度公司对自身技术的信心,另一层含义就是突破“事儿做到九十九度就是做到头”的西方说法,百度就是想要力争做到一百度,做到顶上开花的境界。

百度公司不同于一般意义上的网络公司。它既不是着眼于互联网内容的提供,也不是门户网站,而是一家立足于自主掌握并提供互联网核心技术的技术型公司。在中国互联网经济迅猛发展的今天,百度公司结合世界先进的网络技术、中国语言特色以及中国互联网经济发展的现状,开发出了中国互联网信息检索和传递基础设施平台,并且运用最先进的商业模式,直接为整个中国的互联网提供高价值的技术性服务互联网产品,是中国最优秀的互联网技术提供商。

百度公司自进入中国互联网市场以来,就一直以开发真正符合中国人习惯的、可扩展的互联网核心技术为使命。百度所坚持的目标就是为提高中国互联网的技术成份,帮助中国互联网更快地发展而努力。为此,百度不仅带来解决互联网基础问题(信息搜索和信息传递)的产品,而且带来了硅谷式的企业文化以及互联网应用崭新的理念。现在,百度拥有3条产品线,除已被业界广为认可的门户网站中文搜索引擎外,还有服务于企业的高针对性的搜索产品-百度网事通,以及网站加速技术。百度的出现为中国互联网树起了民族技术的一面旗帜,将原来中国互联网依赖于外国网络技术的局面打破。

百度以自身的核心技术“超链分析”为基础,提供的搜索服务体验赢得了广大用户的喜爱;超链分析就是通过分析链接网站的多少来评价被链接的网站质量,这保证了用户在百度搜索时,越受用户欢迎的内容排名越靠前。百度总裁李彦宏就是超链分析专利的唯一持有人,目前该技术已为世界各大搜索引擎普遍采用。

百度拥有全球最大的中文网页库,目前收录中文网页已超过20亿,这些网页的数量每天正以千万级的速度在增长;同时,百度在中国各地分布的服务器,能直接从最近的服务器上,把所搜索信息返回给当地用户,使用户享受极快的搜索传输速度。

百度每天处理来自超过138个国家超过数亿次的搜索请求,每天有超过7万用户将百度设为首页,用户通过百度搜索引擎可以搜到世界上最新最全的中文信息。2004年起,“有问题,百度一下”在中国开始风行,百度成为搜索的代名词。

百度还为各类企业提供软件、竞价排名以及关联广告等服务,为企业提供了一个获得潜在消费者的营销平台,并为大型企业和政府机构提供海量信息检索与管理方案。百度的主要商业模式为竞价排名(P4P,Pay for Performance),即为一种按效果付费的网络推广方式,该服务为广大中小企业进行网络营销提供了较佳的发展机会,但同时也引起了一些争议;有人认为该服务会影响用户体验。

 

企业建站

WordPress网站

营销型企业网站套餐
滚动至顶部