logo_tag
返回

National Air Traffic Services、美国联邦航空局(FAA)及Alaska Airlines计算机故障揭示航空业对老旧技术的系统性依赖

行业影响空中交通与航空公司计算机系统反复出现的故障表明,当备份与主系统共享同一份错误数据或同一套硬件时,为传统系统内置的冗余也可能同时失效,形同单点故障。

事件详述

负责管理英国空域绝大部分航空器的国家空中交通服务局(NATS)发生计算机故障,导致其航班处理系统离线约三个小时,航空公司排班表中逾 1,750 架次航班被取消。航空器最终散落在错误的机场,机组人员的允许工作时长也在正常运行恢复前已经用尽。

National Air Traffic Services、美国联邦航空局(FAA)及Alaska Airlines计算机故障揭示航空业对老旧技术的系统性依赖

此次故障与 2023 年 8 月NATS 发生的一次故障如出一辙:一份从洛杉矶飞往巴黎的飞行计划中,两个航路点共用了同一识别代码——一个在墨西哥,一个在日本。由于无法解析这一歧义,主计算机随即关闭;备份计算机接收到相同数据后也随之关闭。调查人员将该事件归类为「严重异常错误」。此次事件影响了逾 70 万名乘客,估计造成损失最高达1 亿英镑,而由于负责手动重启的专家当时正在远程办公,必须赶赴控制中心,恢复工作因此进一步延误。

美国在 2023 年 1 月也经历过类似中断:美国联邦航空局(FAA) 因发布「航行通告」(涵盖跑道关闭、危险状况及其他飞行前信息的警示)的系统故障,暂停全美国内航班起飞近两个小时。承包商在尝试修复主数据库与备份之间的同步问题时,误删了文件。到起飞恢复时,约有 1,300 架次航班取消,约 11,000 架次延误。

某网络安全公司随后推送的一次错误更新导致全球 Windows 计算机崩溃,令航空公司值机与调度系统离线,并扰乱了机场的行李与旅客处理服务。达美航空(Delta Air Lines)在美国主要竞争对手恢复运营数天后仍在艰难应对,因为此次故障还波及了用于匹配机组与航空器的软件。2025 年 7 月,阿拉斯加航空(Alaska Airlines)因一处数据中心硬件故障,整个运营暂停约三个小时,导致逾 150 架次航班取消;该航空公司表示,故障部件本设有多重冗余层级,但各层级同时失效。

南非空中交通与导航服务局(ATNS)用了两年时间从导航系统不可靠及管制员短缺的困境中恢复,此前该局未能在 Richards Bay、Upington 及 Bloemfontein 的 Bram Fischer International Airport 维持仪表进近程序。2025 年 3 月,交通部长 Barbara Creecy 委任的一个委员会指出安全治理存在缺口,通信系统也存在薄弱环节。ATNS 随后批准了 10 亿兰特的现代化改造资金,但截至 10 月,管制员编制仅达到需求的 70%。

行业影响与后续观察

这些事件反映出同一个共性:即便建有备份,空中交通与航空公司计算机系统仍会一同宕机,原因不在单一部件,而在于故障源自共享的数据或共享的硬件。主系统与备份系统共用同一个重复的航路点代码,或是冗余数据中心部件的各层级同时失效,都使冗余设计本应发挥的作用落空。

这一领域运行在部分已有数十年历史的基础设施之上,能够在自动恢复失败时进行人工干预的专家也十分有限——NATS 就需要一名专家赶赴控制中心才能重启系统。这种稀缺性会将一次技术故障拖成一场持续且高度可见的混乱,以取消航班数量、延误旅客人数及直接损失来衡量,2023 年 NATS 事件 1 亿英镑的估计损失正说明了这一点。

接下来值得关注的问题是,监管机构是否会开始要求证明备份系统已针对同一故障进行过测试,而不只是作为第二套设备存在。ATNS 10 亿兰特的现代化改造计划及其管制员编制情况(截至 10 月仍为需求的 70%)是一个可供追踪的具体指标;NATS 或 FAA 是否会在各自事故后公布类似的现代化承诺,则是另一个观察点。

相关报道 · 1 篇

Travel tech: The computer failure that grounded Britain – Gadgetgadget.co.za
继续浏览