方小瑜
08-06·测试·5年+
后端最崩溃的线上问题是什么?
日志打不全,线上崩了不知道崩在哪
凌晨两点报警响了,爬起来开电脑,翻日志发现关键报错被截断了,只知道挂了,不知道谁挂的、为什么挂、什么时候开始挂的,那感觉就像被蒙着眼推进一个全是坑的房间最崩溃的是数据库慢查询,平时跑得好好的SQL突然就慢了,一查发现是数据量涨上去了,索引没跟上,或者更狠的是有人改了查询条件没通知你,你以为是DB问题,查了半天发现是代码被同事顺手改了没告诉你还有那种偶现的超时,压测跑得飞起,一上生产就随机超时,拉日志全是正常的,复现不了,只能加埋点重新上线等它再犯,每次上线都像在赌命更离谱的是依赖方接口挂了,你这边全是超时报错,查了半天发现是上游的锅,你在这边疯狂排查的时候,对方还在睡觉最让人崩溃的还不是这些问题本身,是你在这边手忙脚乱排查的时候,老板在群里问了一句“怎么回事,还要多久”,产品在群里补了一句“用户已经在反馈了”,前端在群里跟了一句“接口报错了,后端看一下”,你一个人对着三台服务器一台数据库一个缓存集群,脑子里的线程已经全红了日志打不全,监控没告警,回滚要十分钟,根因查不出来,复盘结论是“下次注意”线上崩了不可怕,可怕的是崩了你不知道它为什么崩,更可怕的是你第二天还要写一份原因分析,而你到复盘结束也没搞清楚到底是谁的锅
发布于 四川
分享
评论
未登录
友善发言
image-upload
评论
加载中