这不是一条可以划过去的新闻
2026 年 9 月 15 日,AWS 在健康面板上给出更新:无法恢复仅托管在巴林区域(me-south-1)的资源和数据,损坏跨越多个可用区,超出了它的区域级与多可用区服务的设计承受范围。阿联酋区域的一个可用区(mec1-az2)结论相同,另外两个还在恢复中。
时间线要往前推到 3 月:无人机袭击直接命中了 AWS 在阿联酋的两处机房,巴林的一处设施被附近的爆炸波及,带来结构损坏和断电,消防系统又造成了额外的水损。多数客户靠备份或仍然可访问的数据,在别的区域重新跑了起来——但只存在于巴林区域里的那部分数据,这次是真的没了。巴林的最终说明,AWS 说要到 2027 年初。
多可用区不等于异地备份
数据主权要求把数据留在本国,可 AWS 在巴林、阿联酋各只有一个区域。你能把负载铺满区域内的多个可用区,但它们共享同一个地缘失败域:一次把几栋楼一起打穿的事件,多 AZ 设计扛不住。
这条结论对我们这些用便宜 VPS 的人反而更有意义:我们本来就没有“多可用区”这层幻觉,也就更该把“另一份”放到物理上、合同上都分开的地方。
现在就能做的七件事
- 先盘不可再生的东西:数据库、用户上传、
.env与密钥、自签证书、代码仓库和构建产物。镜像能重装,这些不能。 - 至少一份跨商家:另一家便宜的存储 VPS、对象存储,甚至朋友的一台闲置机器。同一商家的另一台不算异地。
- 用加密增量工具:restic、borg 都行;数据库用逻辑导出(
pg_dump、mysqldump),别只拷数据目录。 - 保留策略要留版本:误删和勒索会同步过去,目标端要开 append-only 或对象锁,至少留 7–30 天的历史版本。
- 凭证分开:备份目标用独立密钥,且只给写入权限。主账号被端掉时,备份不该跟着一起没。
- 每季度做一次真恢复:拉最近一份还原到临时机器,确认能起来。没验证过的备份等于没备份。
- 先定 RPO 再谈 RTO:可以接受恢复慢几小时,不能接受数据没。
一句实话
快照不是备份。它通常和源机器待在同一个区域、同一个存储集群里——巴林这次已经说明,区域一起出事时,快照会跟着一起消失。把“另一份”放出去,是这件事里唯一真正有效的动作。
登录 后参与评论