我现在离职很久了,可以谈谈这个故障,2023年11月12号的这个故障差不多是福报云历史上最严重的故障吧(故障的直接人是我当年面试招的,后来我特意当面找他复盘了一次,所以我很了解哦)
这个故障乘以10倍都不够2026年07月26号菊花云的故障,我挨个来讲
福报云2023年的故障很简单,有一个例行刷白名单的脚本(运行好多年了),当时拉取白名单的时候API超时了,导致拉到的白名单不完整,没做校验和错误处理,就当全量白名单下发了——同志们,这个是白名单,少了就访问不通
所以当时OSS、图片等很多服务挂了,也不是服务挂了就是连接鉴权失败,访问不通,当然和挂了没啥区别
ECS 实例、RDS都正常运行,但是如果网络依赖白名单就会访问不通,不过ECS、RDS一般不依赖
福报云20231112这个故障上了新闻和微博头条霸榜,但是把这个故障乘以100倍才刚刚够得上菊花云20260726的故障
菊花云20260726:
凌晨2点,菊花云的管控bug,将所有大客户账号锁定(认为账号欠费),然后开始将这些客户的所有所有所有的实例(ECS/RDS/网络/负载均衡等等)全部锁定停掉,涉及所有区域
个人猜测被停机的实例数量百万级别以上,正好是美洲的白天,地球另外一端影响巨大,持续时间多久?7点多才开始陆续恢复,持续到11点还有实例恢复中,这个时候管控都在排队拉起实例
这个故障可以说是全球最耸人听闻、不可思议的故障,最基本的熔断都没有,就这样上百万实例半个小时内被关停
但是没有任何新闻,who care?正如有网友说的:还有那个傻逼客户在用菊花云呢?
菊花在做云产品上还没入门,当年我做数据库就出现过一次因为监控数据延迟导致下游触发自动锁定、升配用户实例的case,对这种操作一定要有熔断并人工介入二次确认
希望大家看的过瘾,这两个故障全都是只有在云环境才独有的,自己IDC想搞都搞不出来
显示更多