互联网架构 -- 高可用
什么是高可用
高可用HA(High Availability)是分布式系统架构设计中必须考虑的因素之一,它通常是指,通过设计减少系统不能提供服务的时间。
高可用标准
- 假设系统一直能够提供服务,我们说系统的可用性是100%。
- 如果系统每运行100个时间单位,会有1个时间单位无法提供服务,我们说系统的可用性是99%。
- 很多公司的高可用目标是4个9,也就是99.99%,这就意味着,系统的年停机时间为8.76个小时。
高可用例子
百度的搜索首页,是业内公认高可用保障非常出色的系统,甚至人们会通过www.baidu.com 能不能访问来判断“网络的连通性”,百度高可用的服务让人留下啦“网络通畅,百度就能访问”,“百度打不开,应该是网络连不上”的印象,这其实是对百度HA最高的褒奖。
如何保障系统的高可用
- 集群化(冗余去单点)
- 自动故障转移
集群化
我们都知道,单点是系统高可用的大敌,单点往往是系统高可用最大的风险和敌人,应该尽量在系统设计的过程中避免单点。方法论上,高可用保证的原则是“集群化”,或者叫“冗余”:只有一个单点,挂了服务会受影响;如果有冗余备份,挂了还有其他backup能够顶上。
自动故障转移
有了冗余之后,还不够,每次出现故障需要人工介入恢复势必会增加系统的不可服务实践。所以,又往往是通过“自动故障转移”来实现系统的高可用。
常见的互联网分层架构
常见互联网分布式架构如上,分为:
1. 客户端层:典型调用方是浏览器browser或者手机应用APP
2. 反向代理层:系统入口,反向代理
3. 站点应用层:实现核心应用逻辑,返回html或者json
4. 服务层:如果实现了服务化,就有这一层;如果没有,有站点应用层就够了
5. 数据-缓存层:缓存加速访问存储
6.数据-数据库层:数据库固化数据存储
整个系统的高可用,又是通过每一层的集群化 + 自动故障转移来综合实现的。
【客户端层->反向代理层】的高可用
集群化
以nginx为例:有两台或多台nginx,一台对线上提供服务,另一台冗余以保证高可用,常见的实践是 keepalived 存活探测,相同virtual IP提供服务。
自动故障转移
当nginx挂了的时候,keepalived能够探测到,会自动的进行故障转移,将流量自动迁移到shadow-nginx,由于使用的是相同的virtual IP,这个切换过程对调用方是透明的。
【反向代理层->站点层】的高可用
集群化
假设反向代理层是nginx,nginx.conf里能够配置多个web后端,并且nginx能够探测到多个后端的存活性。其实我们也可以用云平台(如:AWS)代替nginx做负载均衡,同时也可以监控流量。
自动故障转移
当web-server挂了的时候,nginx能够探测到,会自动的进行故障转移,将流量自动迁移到其他的web-server,整个过程由nginx自动完成,对调用方是透明的。
【站点层->服务层】的高可用
集群化
服务层集群化是通过服务层的冗余来实现的。“服务连接池”会建立与下游服务多个连接,每次请求会“随机”选取连接来访问下游服务。
自动故障转移
当service挂了的时候,service-connection-pool能够探测到,会自动的进行故障转移,将流量自动迁移到其他的service,整个过程由连接池自动完成,对调用方是透明的(所以说RPC-client中的服务连接池是很重要的基础组件)。
【服务层>缓存层】的高可用
集群化:方法一
利用客户端的封装,service对cache进行双读或者双写,这样就不需要考虑自动故障转移,因为已经有多台缓存数据库做集群,当然读写的时候会比较耗时。
集群化:方法二
缓存层也可以通过支持主从同步的缓存集群来解决缓存层的高可用问题。redis天然支持主从同步,redis官方也有sentinel哨兵机制,来做redis的存活性检测。
自动故障转移
当redis主挂了的时候,sentinel能够探测到,会通知调用方访问新的redis,整个过程由sentinel和redis集群配合完成,对调用方是透明的。
允许“cache miss”
说完缓存的高可用,这里要多说一句,业务对缓存并不一定有“高可用”要求,更多的对缓存的使用场景,是用来“加速数据访问”:把一部分数据放到缓存里,如果缓存挂了或者缓存没有命中,是可以去后端的数据库中再取数据的。
应对“cache miss”的缓存架构建议
1. 将kv缓存封装成服务集群,上游设置一个代理(代理可以用集群冗余的方式保证高可用),代理的后端根据缓存访问的key水平切分成若干个实例,每个实例的访问并不做高可用。
2. 缓存实例挂了屏蔽:当有水平切分的实例挂掉时,代理层直接返回cache miss,此时缓存挂掉对调用方也是透明的。key水平切分实例减少,不建议做re-hash,这样容易引发缓存数据的不一致。
【服务层>数据库层】的高可用
大部分互联网技术,数据库层都用了“主从同步,读写分离”架构,所以数据库层的高可用,又分为:
- 读库高可用
- 写库高可用
读库高可用
其实是通过读库的冗余来实现的。既然冗余了读库,一般来说就至少有2个从库,“数据库连接池”会建立与读库多个连接,每次请求会路由到这些读库。
自动故障转移
当读库挂了的时候,db-connection-pool能够探测到,会自动的进行故障转移,将流量自动迁移到其他的读库,整个过程由连接池自动完成,对调用方是透明的(所以说DAO中的数据库连接池是很重要的基础组件)。
写库高可用
其实是通过写库的冗余来实现的。可以设置两个mysql双主同步,一台对线上提供服务,另一台冗余以保证高可用,常见的实践是keepalived存活探测,相同virtual IP提供服务。
自动故障转移
当写库挂了的时候,keepalived能够探测到,会自动的进行故障转移,将流量自动迁移到shadow-db-master,由于使用的是相同的virtual IP,这个切换过程对调用方是透明的。
总结
高可用HA(High Availability)是分布式系统架构设计中必须考虑的因素之一,它通常是指,通过设计减少系统不能提供服务的时间。
方法论上:高可用是通过冗余+自动故障转移来实现的。
步骤如下:
1.【客户端层】到【反向代理层】的高可用,是通过反向代理层的冗余实现的,常见实践是keepalived + virtual IP自动故障转移
2.【反向代理层】到【站点层】的高可用,是通过站点层的冗余实现的,常见实践是nginx与web-server之间的存活性探测与自动故障转移
3.【站点层】到【服务层】的高可用,是通过服务层的冗余实现的,常见实践是通过service-connection-pool来保证自动故障转移
4.【服务层】到【缓存层】的高可用,是通过缓存数据的冗余实现的,常见实践是缓存客户端双读双写,或者利用缓存集群的主从数据同步与sentinel保活与自动故障转移;更多的业务场景,对缓存没有高可用要求,可以使用缓存服务化来对调用方屏蔽底层复杂性
5.【服务层】到【数据库“读”】的高可用,是通过读库的冗余实现的,常见实践是通过db-connection-pool来保证自动故障转移
6.【服务层】到【数据库“写”】的高可用,是通过写库的冗余实现的,常见实践是keepalived + virtual IP自动故障转移
相关推荐
在互联网行业中,高可用架构是保障业务连续性、提升用户体验的关键。 1. **容错设计**:高可用架构的核心在于容错设计,即系统在部分组件故障时仍能正常运行。这通常包括冗余组件、故障转移机制和健康检查等策略。 ...
### 分布式架构高可用架构-Keepalived+Nginx实现高可用Web负载均衡 #### 一、场景需求 在互联网应用中,随着用户数量的增长和技术的发展,单一服务器已难以满足日益增长的服务需求。分布式系统架构应运而生于解决...
1-3-移动支付背后的高可用架构-陈斌 1-4-蚂蚁金服异地多活与容灾-刘浩(庄辛) 1-5-分布式应用无银弹—分布式应用架构核心要素的设计方法探讨-董健 1-6-当当架构平台化之道-张亮 1-7-豆瓣的服务化体系改造-田忠博 ...
#### 一、互联网架构演进 **五种架构模型介绍** 1. **单体架构**:最初期的软件架构模式,将所有功能集成在一个紧密耦合的应用程序中。易于理解和部署,但随着系统规模扩大,维护变得困难。 2. **分层架构**:将...
三峡通航互联网架构的高可用性研究.pdf
在中国电信综合平台开发运营中心技术部总监兼架构师高保庆的《高可用电信统一账号认证平台技术架构实践》主题分享中,详细介绍了中国电信统一帐号认证平台的技术架构设计与实践经验。以下是从标题、描述以及提供的...
《互联网架构高可用方案之QMHA详解》 在互联网行业中,构建高可用的数据库架构是保障服务稳定性和数据完整性的关键。QMHA(Quorum Manager High Availability)作为一种新兴的高可用方案,旨在解决传统方案如MMM...
### MySQL高可用架构详解 #### 一、概述 在互联网公司的发展过程中,随着用户量的增长和技术需求的变化,数据库架构的设计尤为重要。本文将详细介绍一种利用Heartbeat、DRBD以及MySQL构建的高可用架构方案,旨在...
"MySQL性能优化和高可用架构实践" 本书《MySQL性能优化和高可用架构实践》是一本详细介绍MySQL性能优化和高可用架构实践的书籍,旨在帮助读者提升MySQL数据库的性能和可靠性。本书的内容涵盖了查询优化的基本原则和...
《互联网高可用架构》 在当今的互联网时代,高可用性是任何在线服务不可或缺的特性。高可用架构设计旨在确保系统即使在面临各种挑战时也能持续稳定运行,从而为用户提供不间断的服务。这篇文档主要探讨了互联网高...
本资源包包括一个名为"互联网运营智慧-高可用可扩展网站技术实战教程pdf"的PDF文档以及可能的相关架构师视频资源,它们将深入探讨这些核心主题。 1. **高可用性**:高可用性(High Availability, HA)是指系统能够...
在互联网行业中,构建高可用和高并发的业务架构是一项至关重要的任务。这涉及到对系统设计原则的深刻理解和实践经验。海恩法则和墨菲定律在系统设计中起着指导作用,提醒我们在面对潜在问题时,必须保持警惕并深入...
3. 高可用性:如何构建能够容忍硬件故障、网络中断等异常情况的系统是架构设计的重要考量。这可能涉及到冗余设计、故障隔离和快速恢复机制。 4. 性能优化:通过对系统瓶颈的识别和优化,提高响应速度和处理能力。...
**互联网架构的目标**是构建能够应对大规模用户、高并发访问、并保持高可用性的系统。 **解决单点问题的方法**: 1. **站点层**:采用冗余站点,比如多数据中心部署。 2. **服务层**:实现服务的冗余,比如负载均衡...
书中可能会涉及如何设计高可用的系统架构,并讨论常见的容错策略。 6. **安全性**:大型网站面临的安全威胁种类繁多,包括DDoS攻击、SQL注入、XSS跨站脚本等。书中的安全章节会讲解如何通过防火墙、安全协议、加密...
### 漫谈MySQL高可用架构 #### 一、引言 随着互联网技术的发展与企业规模的扩大,数据服务的连续性和稳定性变得至关重要。在众多数据库管理系统中,MySQL因其开源性、灵活性以及强大的社区支持而备受青睐。然而,...
《互联网架构的“高可用”分析》 在互联网行业中,构建高可用的系统架构是确保服务稳定性和用户体验的关键。高可用(HA,High Availability)旨在减少系统无服务时间,提高系统的持续运行能力。一个理想的高可用...
在构建大型互联网高可用网站业务架构的过程中,设计者必须遵循一系列原则和策略,以确保系统的稳定性和可靠性。本文主要探讨了互联网项目开发中的一些核心概念,包括海恩法则和墨菲定律,以及如何通过高可用设计来...
面向互联网场景的云原生高可用架构是现代云计算领域中的一个重要课题,特别是在华为云数据库的背景下,设计这样的架构旨在提供不间断的服务,同时降低应用程序的复杂性。本文将深入探讨云原生数据库在互联网环境下的...
GIAC全球互联网架构大会是由msup和高可用架构技术社区联合举办的面向架构师、技术负责人及高端技术从业人员的技术架构大会。GIAC已确定有腾讯、百度、链家、美团、优酷、去哪儿网、旷视科技、ofo等公司技术专家出席...