之前公司创业做项目,监控这块一开始上的Zabbix,配模板配到怀疑人生,后来又折腾Prometheus全家桶,运维成本比业务成本还高。最近换成了基于eBPF的可观测性方案(Pixie、Cilium Hubble这一类都可以看看),用了俩月,回不去了。
最爽的点是不用改代码。以前排查接口慢,得先让开发埋点、重新发版、等复现,一套流程下来黄花菜都凉了。eBPF直接在内核层抓数据,服务都不用重启,部署完Agent几分钟就能看全链路延迟,连某个SQL慢在哪都能给你标出来。
资源占用也是真的低。老方案那套Java agent,内存轻松吃掉小几百兆,eBPF这边基本无感,对我们这种服务器能省则省的小团队太友好了。
UI也没想象的简陋,查询语法上手半天就会,自定义面板拖拖拽拽就出来了。上周排查一个偶发超时,以前得靠玄学加日志,这次直接看火焰图定位到一个DNS解析的坑,十分钟收工。
Zabbix当然没死,机房网络设备监控还得靠它。但如果是云原生、微服务这类场景,eBPF这条路线值得试试,真香。