与以往部分因软件Bug或配置错误引发的云故障不同,此次宕机的根源来自外部物理打击。微软发布的影响声明措辞明确:一场强雷暴导致“美国西部第二区多座数据中心设施出现大范围市电中断”。由于一开始无法确认故障是否只局限于特定可用区,微软最初将其定性为“全区域影响”。
值得注意的是,此次事件中并没有证据表明备用电源系统失效。微软的状态更新特别指出,“数据中心电力已完全恢复”。这意味着,问题在于最初的市电切断,而非现场发电机或不间断电源(UPS)没能顶上来。这与2026年2月的另一次Azure宕机形成鲜明对比:那次事故中,变电站电压互感器损坏引发电压急升,烧毁了下游的UPS设备,最终导致完全断电。此次雷暴事故中,并未传出类似的内部硬件损伤报告。
停电引发的混乱并不局限于个别服务,大量用户发现自己的云端操作集体失效。微软官方状态历史记录列出了以下受影响的主要服务 :
从大面积停电中恢复,不是瞬间能完成的事。基于Azure官方状态页面的更新,关键时间线如下:
恢复的难点在于,当电力恢复后,庞大的存储和网络系统需要有控制地、安全地重新上线,避免同时启动带来的二次冲击。两个特定存储单元的缓慢恢复成为阻碍事件完全关闭的“长尾瓶颈”。
将此次宕机放在更长的历史周期里看,它并非一次孤立事件。微软Azure平台多年来已多次被天气相关的物理攻击所困扰,构成了一种令人不安的模式。
这几次事故与本月29日的事件共享着同一条因果链:外部物理事件直接冲击数据中心的电力链路,进而引发依赖此链路的所有数字服务的级联崩溃。
尤其值得关注的是,Azure OpenAI服务出现在了此次受影响的服务列表中。这意味着,随着越来越多企业将AI模型嵌入关键工作流和用户端产品,区域云宕机已经不再仅仅是一个基础架构问题,它正在直接中断AI驱动的应用程序、搜索和自动化流程。对于依赖特定云区域开展AI推理或调用的中国企业而言,这提供了一个关于“业务连续性”的生动警示。
截至目前的信息窗口内,微软尚未发布此次事件的详细根本原因分析(RCA)报告。因此,关于电力恢复的精确时序,以及为何特定存储单元需要额外的恢复时间等细节,仍有待官方的最终复盘来确认。