“十年”经历互联网架构的演进历史

标签: 十年 经历 互联网 | 发表时间:2018-01-11 21:07 | 作者:
出处:http://www.iteye.com
前言

一个成熟的大型网站(如淘宝、京东等)的系统架构并不是开始设计就具备完整的高性能、高可用、安全等特性,它总是随着用户量的增加,业务功能的扩展逐渐演变完善的,在这个过程中,开发模式、技术架构、设计思想也发生了很大的变化,就连技术人员也从几个人发展到一个部门甚至一条产品线。所以成熟的系统架构是随业务扩展而完善出来的,并不是一蹴而就;不同业务特征的系统,会有各自的侧重点,例如淘宝,要解决海量的商品信息的搜索、下单、支付,例如腾讯,要解决数亿的用户实时消息传输,百度它要处理海量的搜索请求,他们都有各自的业务特性,系统架构也有所不同。尽管如此我们也可以从这些不同的网站背景下,找出其中共用的技术,这些技术和手段可以广泛运行在大型网站系统的架构中,下面就通过介绍大型网站系统的演化过程,来认识这些技术和手段。

一、最开始的网站架构

最初的架构,应用程序、数据库、文件都部署在一台服务器上,如图:



二、应用、数据、文件分离

随着业务的扩展,一台服务器已经不能满足性能需求,故将应用程序、数据库、文件各自部署在独立的服务器上,并且根据服务器的用途配置不同的硬件,达到最佳的性能效果。



三、利用缓存改善网站性能

在硬件优化性能的同时,同时也通过软件进行性能优化,在大部分的网站系统中,都会利用缓存技术改善系统的性能,使用缓存主要源于热点数据的存在,大部分网站访问都遵循28原则(即80%的访问请求,最终落在20%的数据上),所以我们可以对热点数据进行缓存,减少这些数据的访问路径,提高用户体验。



缓存实现常见的方式是本地缓存、分布式缓存。当然还有CDN、反向代理等,这个后面再讲。本地缓存,顾名思义是将数据缓存在应用服务器本地,可以存在内存中,也可以存在文件,OSCache就是常用的本地缓存组件。本地缓存的特点是速度快,但因为本地空间有限所以缓存数据量也有限。分布式缓存的特点是,可以缓存海量的数据,并且扩展非常容易,在门户类网站中常常被使用,速度按理没有本地缓存快,常用的分布式缓存是Memcached、Redis。

四、使用集群改善应用服务器性能

应用服务器作为网站的入口,会承担大量的请求,我们往往通过应用服务器集群来分担请求数。应用服务器前面部署负载均衡服务器调度用户请求,根据分发策略将请求分发到多个应用服务器节点。



常用的负载均衡技术硬件的有F5,价格比较贵,软件的有LVS、Nginx、HAProxy。LVS是四层负载均衡,根据目标地址和端口选择内部服务器,Nginx是七层负载均衡和HAProxy支持四层、七层负载均衡,可以根据报文内容选择内部服务器,因此LVS分发路径优于Nginx和HAProxy,性能要高些,而Nginx和HAProxy则更具配置性,如可以用来做动静分离(根据请求报文特征,选择静态资源服务器还是应用服务器)。

五、数据库读写分离和分库分表

随着用户量的增加,数据库成为最大的瓶颈,改善数据库性能常用的手段是进行读写分离以及分表,读写分离顾名思义就是将数据库分为读库和写库,通过主备功能实现数据同步。分库分表则分为水平切分和垂直切分,水平切换则是对一个数据库特大的表进行拆分,例如用户表。垂直切分则是根据业务不同来切换,如用户业务、商品业务相关的表放在不同的数据库中。



针对上面的技术我特意整理了一下,有很多技术不是靠几句话能讲清楚,所以干脆找朋友录制了一些视频,很多问题其实答案很简单,但是背后的思考和逻辑不简单,要做到知其然还要知其所以然。如果想学习Java工程化、高性能及分布式、深入浅出。微服务、Spring,MyBatis,Netty源码分析的朋友可以加我的Java进阶群:688583154,群里有阿里大牛直播讲解技术,以及Java大型互联网技术的视频免费分享给大家。

六、使用CDN和反向代理提高网站性能

假如我们的服务器都部署在成都的机房,对于四川的用户来说访问是较快的,而对于北京的用户访问是较慢的,这是由于四川和北京分别属于电信和联通的不同发达地区,北京用户访问需要通过互联路由器经过较长的路径才能访问到成都的服务器,返回路径也一样,所以数据传输时间比较长。对于这种情况,常常使用CDN解决,CDN将数据内容缓存到运营商的机房,用户访问时先从最近的运营商获取数据,这样大大减少了网络访问的路径。比较专业的CDN运营商有蓝汛、网宿。

而反向代理,则是部署在网站的机房,当用户请求达到时首先访问反向代理服务器,反向代理服务器将缓存的数据返回给用户,如果没有没有缓存数据才会继续走应用服务器获取,也减少了获取数据的成本。反向代理有Squid,Nginx。



七、使用分布式文件系统

用户一天天增加,业务量越来越大,产生的文件越来越多,单台的文件服务器已经不能满足需求。需要分布式的文件系统支撑。常用的分布式文件系统有NFS。



八、使用NoSql和搜索引擎

对于海量数据的查询,我们使用nosql数据库加上搜索引擎可以达到更好的性能。并不是所有的数据都要放在关系型数据中。常用的NOSQL有mongodb和redis,搜索引擎有lucene。



九、将应用服务器进行业务拆分

随着业务进一步扩展,应用程序变得非常臃肿,这时我们需要将应用程序进行业务拆分,如百度分为新闻、网页、图片等业务。每个业务应用负责相对独立的业务运作。业务之间通过消息进行通信或者同享数据库来实现。



十、搭建分布式服务

这时我们发现各个业务应用都会使用到一些基本的业务服务,例如用户服务、订单服务、支付服务、安全服务,这些服务是支撑各业务应用的基本要素。我们将这些服务抽取出来利用分部式服务框架搭建分布式服务。淘宝的Dubbo是一个不错的选择。



小结

大型网站的架构是根据业务需求不断完善的,根据不同的业务特征会做特定的设计和考虑,本文只是讲述一个常规大型网站会涉及的一些技术和手段。

已有 0 人发表留言,猛击->> 这里<<-参与讨论


ITeye推荐



相关 [十年 经历 互联网] 推荐:

“十年”经历互联网架构的演进历史

- - ITeye博客
一个成熟的大型网站(如淘宝、京东等)的系统架构并不是开始设计就具备完整的高性能、高可用、安全等特性,它总是随着用户量的增加,业务功能的扩展逐渐演变完善的,在这个过程中,开发模式、技术架构、设计思想也发生了很大的变化,就连技术人员也从几个人发展到一个部门甚至一条产品线. 所以成熟的系统架构是随业务扩展而完善出来的,并不是一蹴而就;不同业务特征的系统,会有各自的侧重点,例如淘宝,要解决海量的商品信息的搜索、下单、支付,例如腾讯,要解决数亿的用户实时消息传输,百度它要处理海量的搜索请求,他们都有各自的业务特性,系统架构也有所不同.

中国互联网精彩十年

- Kindy - FeedzShare
来自: InfoGraphic collected by 魏武挥 - FeedzShare  . 发布时间:2011年09月07日,  已有 2 人推荐. 中国移动互联网图谱 2011.1 [信息图]. 世界主要国家与我国宽带产业对比. 2010年中国网络经济热点盘点.

周鸿祎:预测未来十年中国互联网

- Lizhenming - 互联网的那点事
谈到三大,我的观点是,中国互联网的“三大”对于中国互联网曾经做出过不可磨灭的贡献. 腾讯、百度、阿里巴巴,这“三大”的贡献,我认为有两点,第一是在中国打败了国外的互联网公司,证明了中国互联网还是属于中国公司的,只有中国互联网公司才能玩得比较好. 第二,它们把中国互联网的 “天花板”撑高了. 以前,互联网做成10亿美元的市值,就觉得挺了不起的了,现在市值几百亿美元也不觉得稀奇.

移动互联网十年内难以盈利 莫盲目跟风

- - CSDN博客互联网推荐文章
移动互联网的概念被越炒越热,高唱移动互联网时代的到来,国内互联网企业更是一拥而上,但是喧嚣背后却鲜见明显的盈利模式,更无成熟案例可供探讨,于是,经过11年、12年的疯狂之后,13年在移动互联网方面各大公司虽然依旧信心满满,相信美好前景,但都明显谨慎了许多. 移动互联网在中国尚处于初期阶段,远没有到各大IT企业及众多媒体和互联网人士所炒作的那样到了移动互联网的春天.

十年,离开的谷歌给中国互联网界留下了这些人

- - 36氪
编者按:本文来自微信公众号“峰瑞资本”(微信号:freesvc),授权 36Kr 发布,转载请联系原作者. 知乎上有一个热门问题:谷歌做过什么恶. 有一度点赞数最高的回答是 “退出中国”. 从来没有一家公司,缺席多年,依然被如此怀念. 缺席越久,越是让中国网民栏干拍遍. 2006 年 1 月 Google.cn 上线.

《连线》杂志主编凯文·凯利: 分享未来十年互联网大趋势

- - 互联网的那点事
前言:凯文·凯利在分享未来十年互联网大趋势时用到了4个词语: 屏幕(Screens),分享(Share),注意力(Attention),流(Flow). 在2013腾讯智慧峰会北京站的主题演讲中,《失控》作者、《连线》杂志创始主编凯文·凯利在分享未来十年互联网大趋势时用到了四个关键词:屏幕(Screens)、分享(Share)、注意力(Attention)、流(Flow).

移动互联网=移动+互联网?

- 可可 - It Talks-魏武挥的blog
从名词上看,移动互联网似乎就是互联网加上一个移动. 但移动互联网远不是“移动的互联网”那么简单. 它的本质——网络部分,就和互联网大不相同;而它的表现——移动部分,也正因为移动,造就了很多和互联网相当不一样的商业机会. 而更重要也是很多人并没有注意到的是,它可能会改变整整一代人的信息处理习惯. 从网络部分而言,我们都知道,理论上互联网是没有拥有者的.

这是这个系列的第四篇文章,(有兴趣的可以先看看互联网目睹之怪现状一、二、三),都是最近一段时间在互联网上看到的或者自己亲身经历的觉得一些匪夷所思的事,以图片为主,说话为辅,列举出来,不喜误入。 | 望月的博客

- Chairman Meow - wangyueblog.com
这是这个系列的第四篇文章,(有兴趣的可以先看看互联网目睹之怪现状一、二、三),都是最近一段时间在互联网上看到的或者自己亲身经历的觉得一些匪夷所思的事,以图片为主,说话为辅,列举出来,不喜误入. 白名单谣传已久了,但一直只闻其声,未见其人,一个偶然的机会,在某个页面看到这样的信息:. 看来并非空穴来风,事实上,现在的网络越来越慢、不能访问的网站越来越多,莫名其妙的事情也越来越多了.

重新索引互联网

- keso - 爱范儿 · Beats of Bits
重新索引互联网 Facebook 雇佣公关抹黑 Google 的过程已经水落石出. 问题是: Google 那么多产品, Facebook 为何对 Social Circle 这么敏感. Google 号称自己的使命是“索引互联网”. 这件事的难点并非派出多少爬虫,而是对收集来的海量内容做排序:怎样让真正重要的网页,的排到 Google 搜索结果的前面来.

中美互联网差异

- leeking001 - 互联网的那点事
在互联网以指数的速度发展的今天,人们的生活已经离不开网络,那么,这两个打过在互联网方面有什 么差异呢. 我们从下面一系列与互联网相关的参数来比较两个国家,比如:互联网用户数量,互联网普及率,互联网连接的速度,域名数量,受欢迎的网站,网页浏 览器,操作系统等等. 十年前,美国是世界上的互联网头号大国,而现在很明显已经不是,取而代之的是中国.