幽游地 头像

消息来源频道

幽游地

@uudme

频道1,090 位成员公开可见持续更新

交流群:https://t.me/uud_me 博客地址:https://www.uud.me 博客时光机:https://www.uud.me/cross.html 在线看小说:book.uud.me 影视资源频道:https://t.me/gduudme 全网VIP视频解析:www.uud.me/vip

成员规模1,090 位成员
在线情况待同步
消息总数3,643 条消息
浏览量总数0 次浏览

在这个频道里搜索消息……

t.me/uudme

Cloudflare全球大规模502错误事件说明:由于软件部署不当导致服务中断
北京时间7月2号 21点52分左右开始持续约30分钟,全球访问CloudFlare站点的用户收到了502错误,这些错误是由于Cloudflare网络上的CPU使用率急剧上升造成的。此CPU峰值是由于上线了错误配置引起的。在回滚配置完成重启后,服务恢复正常运行,所有使用CloudFlare的域名恢复正常流量水平。
这不是一次攻击事件(不是一些人推测的那样),我们对这起事件的发生感到非常抱歉。内部团队正在开会,CTO(John Graham-Cumming)写了宕机分析这是如何发生的,以及后续如何防止这种情况再次发生。
此次全局中断的具体原因:发生在常规部署更新新的CloudFlare WAF管理的规则期间,在CloudFlare Web应用程序防火墙(WAF)中部署了配置错误的规则,其中一个规则包含有一个正则表达式,导致节点100%CPU占用。
因为WAF规则是由自动化测试套件在模拟模式下进行,它顺利通过了测试,并被一次性同步推送全球CDN节点上应用部署,因此导致全球集群机器上的CPU峰值达到100%。这100%的CPU峰值最终导致了大量用户访问时看到的502错误。在最糟糕的时候,覆盖了总体流量的82%。
教训:这样的事件对客户造成了巨大的伤害,已有的自动化测试过程的不完善,我们持续审查和改进已有测试-部署过程,以避免将来发生这样的事件
原文:Cloudflare outage caused by bad software deploy