站点运营期的被动局面通常是这样开始的:用户先发现打不开,你去服务器一看 CPU 早就满了、磁盘早就不够了。监控要解决的就是把“用户报警”换成“系统报警”——资源异常在你这里先看到,而不是在用户的差评里。这篇的主角是 netdata:一行命令安装,装完自动发现机器上所有服务(CPU、内存、磁盘、Nginx、MySQL、PHP-FPM),每秒级粒度出图表,零配置开箱即用。对个人站长的单机场景,它是性价比最高的方案,比 Prometheus 加 Grafana 那套组合轻得多。
安装非常直接(Ubuntu/Debian 为例):
# 官方一键脚本(当前最新版 v2.11.0,2026-08-12发布)
wget -O /tmp/kickstart.sh https://get.netdata.cloud/kickstart.sh
sh /tmp/kickstart.sh --stable-channel
# 或者用发行版仓库(版本可能略旧但省心)
sudo apt install netdata
sudo systemctl enable --now netdata
# 默认监听 19999 端口
装完立刻有个安全问题要处理:netdata 的 Web 仪表盘默认绑在 0.0.0.0:19999,公网直接可访问。虽然它不直接控制你的服务器,但仪表盘暴露了大量系统信息(内核版本、运行服务、进程列表),等于给攻击者递了一份侦察报告。三种处理方式按推荐排序:
# 方案一(推荐):绑回环,公网访问走SSH隧道
# 编辑 /etc/netdata/netdata.conf
# [web]
# bind to = 127.0.0.1:19999
sudo systemctl restart netdata
# 本地要看面板时开一条隧道
ssh -L 19999:127.0.0.1:19999 user@服务器IP
# 浏览器打开 http://localhost:19999
# 方案二:UFW 只给自己的固定IP放行19999
sudo ufw allow from 你的IP to any port 19999
# 方案三(省事兜底):UFW直接挡掉公网
sudo ufw deny 19999
netdata 装好默认就带几百张图表和几十条告警规则,CPU、内存、磁盘空间、磁盘 IO 延迟、Nginx 5xx 率、MySQL 锁等待这些常见指标全部内置,不用手写规则。真正要动手配置的是告警通知——不然仪表盘再漂亮,你不去看等于零。编辑 /etc/netdata/health_alarm_notify.conf 配通知渠道:
# /etc/netdata/health_alarm_notify.conf 关键项
# 邮件(最简单的兜底渠道)
EMAIL_SENDER="alert@example.com"
DEFAULT_RECIPIENT_EMAIL="you@example.com"
# Telegram / 企业微信等渠道也内置支持
# 按文档填对应 token 即可,改完重启
sudo systemctl restart netdata
# 手动触发测试告警,验证通知链路通不通
sudo su -s /bin/bash netdata
/usr/libexec/netdata/plugins.d/alarm-notify.sh test
验证分三步走。第一,确认服务在跑、端口在听:systemctl status netdata 加 ss -tlnp | grep 19999。第二,浏览器进面板(走隧道或放行的 IP),左边栏应该能看到自动识别出的 mysql、nginx、weblog 等条目——如果没有,多数是对应服务的状态文件位置不对或权限问题,按面板提示装对应插件依赖。第三,发一条测试告警,手机上收到通知才算链路闭环。
和系列里其他监控篇划一下边界。《服务器稳定性不能靠感觉:用Uptime Kuma自建监控,宕机比用户先知道》讲的是 Uptime Kuma 自建监控,管的是“站点对外可用性”(HTTP 通不通、证书有没有过期),从外部探测;这篇的 netdata 管的是“服务器内部健康”(CPU、内存、磁盘、服务指标),从内部看,两者互补不重复。《SEO 业务告警:排名跌了、抓量崩了,让企业微信群先知道》的 SEO 业务告警管的是排名和抓取量的业务指标偏差,更是另一个层面。三层告警搭齐,可用性、资源、业务各管一段。
资源开销说句实话:netdata 采集粒度是每秒级,空闲内存占用几十 MB,对 1G 小内存机器要留个心眼——装完后 free -h 看一眼,内存紧张就把存储保留时长调短(netdata.conf 的 db 段里调每层保留时间),或者干脆用发行版仓库的版本,开销更小。监控本身不能吃掉被监控的机器,这是底线。
相关阅读:监控是运营段的第一件事。《从零建站第一步:技术栈选型总纲,别一上来就纠结框架》的路线图里运营组从监控起步,总纲收藏一张,上线之后每一步都有对应篇目。
A5创业网 版权所有