宕机仅影响使用CloudFront VPC Origins功能的客户。该功能于2024年11月推出,允许CloudFront直接路由流量到客户虚拟私有云(VPC)内的私有资源 。根据AWS的故障报告,负责管理VPC Origins私有连接的服务集群达到了内部连接管理限制——即控制面(control plane)管理路由配置的硬性容量天花板。一旦超标,路由配置便无法正确分发到网络处理器,导致所有VPC Origin请求返回5xx错误(主要是HTTP 504和502)。
AWS将根本原因描述为“管理VPC Origin连接的服务集群内部限制” ,与一个负责将请求从CloudFront边缘站点路由至客户VPC内资源的包处理子系统有关 。宕机并非全局CloudFront崩溃——使用S3源站、通过公共互联网访问的ALB源站或其他类型源站的客户未受影响 。AWS工程师证实,一旦服务集群达到内部容量上限,“负责将路由配置分发到网络处理器的系统未能正确加载更新后的配置数据” 。
受影响网站包括:
宕机主要限于CloudFront VPC Origin配置,然而由于许多主流网站采用“安全默认”架构,即CloudFront搭配内部应用负载均衡器(ALB)通过VPC Origins连接,导致影响面巨大。部分系统呈现“部分宕机”现象:从S3源站提供的静态资源可正常访问,而经VPC Origins路由的动态API调用则返回504错误 。
本次事件是AWS近年一系列高调故障中的最新一例,这些事故不断加剧业界对互联网基础设施过度集中于少数超大规模云提供商的普遍担忧。
为何频繁发生:互联网的计算、存储、网络、DNS、身份验证、CDN和安全基础设施已全面集中于AWS、微软Azure和谷歌云三大平台。AWS一家独揽约30%的全球云服务市场,Azure和谷歌分别占20%和13% 。爱荷华州立大学的研究人员指出,四项核心互联网服务——DNS、身份验证、电子邮件和安全基础设施——已高度集中于少数全球平台,这意味着单一提供商故障会瞬间跨行业级联 。2026年7月的一份云集中化风险分析报告点明:“一项服务可以跨三个可用区部署,但仍然可能因为依赖一个区域控制面或一个网络中介而全部瘫痪” 。
2026年7月的CloudFront故障正是这一现象的教科书式案例:它并非广泛的基础设施崩溃,而是一个单一功能的控制面容量限制,却导致金融、AI、游戏和政府等多个不相关领域的数十项服务同时宕机——这一切仅因它们共享同一条底层AWS路径以交付私有源站流量。正如有分析所言,“三个月内两次AWS宕机,恰恰验证了多数CTO不敢明说的事实:单一云依赖是一种生存风险” 。