10小时预警的服务器搬家 vs 零通知重启全球服务器:低价 VPS 界的操作越来越离谱了
上次写文章吐槽 CloudCone(CC)把服务器从 Multacom (MC)机房搬走,只提前 10 个小时发邮件通知时,我还以为这已经是便宜 VPS 厂商的运营下限了。毕竟按照美西时间提前 10 个小时发通知,我们这些东八区的用户如果不熬夜守着邮箱,等第二天醒来看到邮件时,自己的服务器早就已经被服务商装上卡车“跑路”了。(具体情况可以看这篇文章:《CloudCone的鬼才运营:提前 10 小时通知“机房物理搬迁”,还说不服不给退款?》)
然而事实证明,我还是太年轻了。低价 VPS 界根本没有稳定可言;而老牌大厂一旦搞起事来,可比小厂商还要“离谱”得多。
通知邮件?不存在的,OVH 选择零通知直接重启
我有一台和人合租的 OVH 小鸡,用来放监控面板的。估计有些人已经知道了,就在最近,OVH 搞了一出骚操作:为了修复那个高危的 KVM 虚拟化漏洞(CVE-2026-53359),直接对旗下全球数万台宿主机、数百万台虚拟机进行了内核升级与重启(OVH的复盘报告)。
按照正常大厂的流程,重启宿主机怎么也得提前发个邮件告知维护时间吧?结果 OVH 的操作直接让我傻眼了:
- 邮件通知? 零通知!邮件连发都没发。按照官方事后给出的说法,是因为“我们认为如果群发邮件,数量太大了,我们担心会把我们的工单系统给挤瘫了,所以我们干脆不发邮件了,只在管理后台做出提醒”。谁没事整天登录那个web端的管理后台啊,能看到通知就有鬼了。
- 维护协商? 协商个锤子!OVH 认为这是严重漏洞,服务器更新补丁的时间延迟一秒,母鸡被黑客穿透虚拟化逃逸的风险就增加一分,所以干脆不通知,后台直接重启母鸡部署更新。(当然对部分大企业客户 OVH 还是乖乖提前通知并协商了维护时间窗口。)
看到 OVH 官方的事后复盘,我再一次气乐了。感情 CloudCone 那个“提前 10 小时发邮件”的仓促通知,在 OVH 面前甚至显得无比温良恭俭让——CC 好歹还发了封邮件告知一下,OVH 直接把我当成了后台的一行无关紧要的进程,想杀就杀。
脸黑啊,别人 1 个小时不到恢复,我那台小鸡挂了快 2 天
如果只是无预告重启,大不了算它一次闪断,我也就忍了。但最绝的是,我运气实在太“好”,我和别人合租的小鸡,偏偏位于极少数出现故障的宿主机上。
根据 OVH 事后披露的数据,他们当时第一波重启澳洲悉尼机房的 6,000 台宿主机时,就有大概 20~30 台母鸡重启后直接卡死。原因千奇百怪:BIOS 异常、内存报错、网卡死锁,需要机房现场工程师拿着工具箱去做一些类似更换网卡、拔插内存、抠 CMOS 电池放电之类的物理操作才能重新开机。但他们认为故障比例可接受,于是直接开始分批强制重启旗下全球机房的所有机器。
非常不幸,我的那台小鸡所在的宿主机,恰好就遇到了问题,根据事后报告应该是宿主机存在服务冲突,导致宿主机重启后,其上的小鸡拉起后很快就停止运行,他们第二天才定位并修复了问题。
于是,神奇的一幕发生了:
- 别人的小鸡: 重启,升级,20 分钟,顶天一两个小时就恢复了。
- 我的小鸡: 在离线状态卡死,等待机房工程师排队救援。
从失联到彻底恢复,整整耗了将近两天!这期间没有任何额外通知,控制台当时也看不到具体的排队进度,工单里只说在解决,但具体的恢复时间一问三不知。
警惕“大厂光环”:不要对任何网络服务的可持续性抱有幻想
经历了这次 OVH 的“无预警重启 + 宿主机踩雷”连环坑,我算是彻底服气了:
-
别对任何主打高性价比的 VPS 抱有“大厂滤镜”
不管是小厂还是巨头,只要是低价 VPS/公有云,它们在面对重大安全漏洞时,优先级永远是厂商自身的风控与利益 > 用户的业务。而且大厂为了自身利益,做决定反而比小厂商更加冷酷和理性——你的业务死活无关紧要,我们不被黑客攻破才是第一要务。 -
提前 10 小时通知,居然也成了“业界良心”
对比 OVH 的“无预警拔线重启”,CloudCone 之前那封提前 10 小时的搬家邮件突然显得没那么难以接受了——至少当我看到邮件时,离服务器断电还有半个小时,起码给了我一段导出关键数据的时间窗口。 -
异地备份与多云灾备才是唯一的神
根据OVH复盘报告,他们在强制重启中也有搞坏一些小鸡的数据,并且无法恢复。之前OVH机房起火的经典案例估计有些人还有印象。所以无论是个人博客还是线上项目,将数据定时自动化备份到第三方对象存储(如 S3 / B2),并对核心服务配置故障转移,才是确保下次不被服务商的奇葩操作搞崩溃的唯一良药。 -
不过话又说回来,大厂的技术水平确实还是比小厂强
抛开这个奇葩流程不谈,OVH 遇到故障时的应急修复速度,依然是 CloudCone 这类小厂难以企及的。CC 搬家后网络时断时续的问题,从 7 月 8 日晚上足足修到了 7 月 21 日晚上;而 OVH 满打满算也就修了 1 天多,并且对可能出现的硬件故障确实做了相对完善的预案,不是一拍脑门的蛮干。比如根据他们的复盘,预先在负载轻的悉尼机房试验;提前准备了网卡、内存等易损件的备件;分批重启,一次只重启几百台宿主机,如果重启后故障服务器超过 5 台/ 15 台(根据机房实际情况确定阈值),则停止后续重启工作,等待故障主机修复完成。


花非花
2026-07-22 15:48
简直离谱啊,不是需要操作,谁去登录后台盯着啊
去年夏天
2026-07-22 15:51
可不,要不是遇到服务器彻底失联、SSH进不去之类的问题,谁没事去登录后台啊。
织梦岁月
2026-07-22 13:26
我还是国内的用着,没啥问题。
去年夏天
2026-07-22 14:24
廉价VPS服务商还真是靠不住,哪怕他是老牌廉价VPS服务商……
龙笑天
2026-07-22 12:42
你这有点点背了 我的整1小时OK了
PS:头像源疑似已挂,尽早更换~
去年夏天
2026-07-22 14:20
最近运气不好吧
头像源,额咋说呢,不能说挂了,就是没那么稳,偶尔会抽一段时间。
回头看看怎么办吧
我是军爸
2026-07-22 12:27
估计是零时工在干重启这件事,可以准备下岗了,哈哈
去年夏天
2026-07-22 14:13
事后总结是他们CISO(首席信息安全主管)发的,这是OVH整个管理团队做出的“慎重决定”。
fengc's Blog
2026-07-22 12:24
这是大牌服务商赠送的服务,加量不加价,用户买的不仅是服务器,还有随时重启的开盲盒刺激感。
去年夏天
2026-07-22 14:15
本来感觉OVH相对最稳定,所以用来放监控其他小鸡的服务,结果监控服务自己挂了😂
Hary
2026-07-22 12:05
哈哈,你咋净摊上这事,鸡蛋不在一个框,结果两个框都烂了。
去年夏天
2026-07-22 14:14
最近可能运气不太好吧……