标签: Zabbix调优

  • 深入 Zabbix 预处理雪崩排查:复杂 JSONPath 滥用引发的 Proxy 内存打爆与 TimescaleDB 写入夯死实战

    结论先行:某次 Zabbix 6.0 LTS 分布式集群雪崩,根因是自定义模板中滥用极其复杂的 JSONPath 与正则预处理,导致 Proxy 端 Preprocessing Worker 长期 100% 满载。堆积的历史数据在洪峰释放时,由于大量乱序时间戳,瞬间击穿后端 PostgreSQL 14 (TimescaleDB) 的 Chunk 写入性能,引发 Server 端 History Syncer 全面夯死。核心解法是将重度解析逻辑下沉至 Agent 端侧(边缘计算),并调优 TimescaleDB 历史数据的乱序写入内存参数。

    故障现场:Proxy 频繁断连与 Server 端 P99 延迟飙升

    排查过程中,核心监控集群突然触发大面积“Zabbix proxy is unreachable”告警。初步观察 Zabbix Server 的核心指标,发现 P99 内部处理延迟从平时的 50ms 飙升至 3s 以上,同时 History Syncer 进程利用率直线打满到 100%。

    登入其中一个出问题的 Proxy 节点抓取状态:

    # 检查 Proxy 内部进程状态
    zabbix_get -s 127.0.0.1 -k "zabbix[process,preprocessing worker,avg,busy]"
    100.000000
    
    # 查看 Proxy 日志,大量连接超时与积压
    tail -n 50 /var/log/zabbix/zabbix_proxy.log
    1345:202X1108:101231.123 Zabbix agent item "app.api.stats" on host "API-Server-01" failed: first network error, wait for 15 seconds
    1320:202X1108:101345.543 proxy data dispatching delayed by 4520 seconds
    

    更致命的是,当 Proxy 的 preprocessing worker 艰难处理完积压数据,开始向 Zabbix Server 批量推送时,Server 端的数据库层直接“躺平”。PostgreSQL 服务器的 Load Average 飙升至 120,磁盘 iowait 持续在 60% 以上。

    为什么自定义模板的预处理会拖垮整个 Proxy 分布式架构?

    在 Zabbix 的分布式架构中,Proxy 不仅仅是数据转发器。从 Zabbix 4.2 开始,为了减轻 Server 压力,所有的指标预处理(Preprocessing)都被前置到了 Proxy端执行。

    在本次故障中,业务团队新接入了一个自定义模板,通过 HTTP Agent 主动拉取某个中间件的 /metrics 接口。该接口返回一个高达 3MB 的巨型 JSON 文本。该模板定义了 1 个 Master Item,并挂载了 800 多个 Dependent Items,每个 Dependent Item 都配置了复杂的 JSONPath 提取规则,外加正则表达式(Regular Expression)进行二次清洗。

    底层原理在于:Zabbix 的预处理架构基于 Master-Worker 的进程间通信(IPC)模型。 preprocessing manager 接收到原始数据后,通过 Unix Socket 将庞大的 3MB 文本复制、分发给底层的 preprocessing worker。800 个 Dependent Item 意味着这 3MB 的文本要在内存中被拷贝并执行 800 次复杂的 JSONTree 解析与正则匹配。

    当数百台主机同时拉取该指标时,Proxy 的 CPU 缓存和 IPC 队列瞬间被挤爆:

    // zabbix/src/zabbix_proxy/preprocessing/preprocessing.c (伪代码逻辑)
    // 每次执行预处理步骤时,巨大的 values 字符串需要在 manager 和 worker 之间传递
    zbx_ipc_message_t *message;
    zbx_ipc_client_send(client, ZBX_IPC_PREPROCESSOR_REQUEST, data, data_size);
    

    单靠修改 zabbix_proxy.conf 里的 StartPreprocessors=50 根本无济于事,只会让系统的 Context Switch 飙升,加速内存 OOM。

    数据库后端崩塌:TimescaleDB IOPS 饱和与 History Syncer 夯死

    Proxy 积压了数小时的数据后,当处理完成并批量推给 Server 时,真正的灾难在数据库层爆发。Zabbix Server 的 History Syncer 进程开始向 PostgreSQL 疯狂写入 historyhistory_uint 表。

    由于这批数据带有数小时前的历史时间戳,它们触发了 TimescaleDB 最惧怕的场景:跨 Chunk 的大批量乱序写入(Out-of-order writes)。 正常情况下,TimescaleDB 写入最新的 Chunk,完全在内存中顺序追加,速度极快。但大量几小时前的积压数据涌入,导致 PostgreSQL 不得不将之前已经压缩并落盘的多个旧 Chunk 重新加载到内存中执行解压、插入、再压缩操作。

    通过 pg_stat_activity 捕获到了大量的锁争用:

    SELECT pid, wait_event_type, wait_event, query 
    FROM pg_stat_activity 
    WHERE state = 'active' AND query ILIKE '%INSERT INTO history_uint%';
    
    -- 结果显示大量进程阻塞在 IO 和 LWLock 上
    pid   | wait_event_type | wait_event     | query
    ------+-----------------+----------------+----------------------------------------
    24102 | IO              | DataFileRead   | INSERT INTO history_uint (itemid, clock, ns, value) ...
    24103 | LWLock          | buffer_mapping | INSERT INTO history_uint (itemid, clock, ns, value) ...
    

    buffer_mapping 锁的集中爆发,证明 shared buffers 正在被高频的 Chunk 换页操作击穿,底层的 NVMe 硬盘 IOPS 被完全打满。

    架构优化与防御性配置落地

    为了彻底解决这一类“监控即雪崩”的问题,我们需要从采集端、传输端和存储端进行三维阻断。

    1. 采集端:预处理逻辑下沉(Shift-Left Parsing)

    不要在 Zabbix 中处理 GB 级别的正则和 JSON 解析。改用 Zabbix Agent 的 UserParameter 或外部脚本,利用 jq 这样的底层 C 工具在客户端机器本地完成数据扁平化,仅将解析好的 Key-Value 上报给 Zabbix。 如果必须保留 HTTP Agent 拉取,强制要求研发侧提供精简版 Metrics 接口,拒绝接收超过 50KB 的 JSON 报文。

    2. 传输端:Proxy 预处理并发与积压限流

    zabbix_proxy.conf 中,防御性地配置预处理进程,并控制向 Server 同步积压数据的速率:

    # 限制预处理 Worker 数量,避免耗尽 Proxy 所在机器的 CPU
    StartPreprocessors=15
    # 避免 Proxy 恢复时向 Server 形成积压数据洪峰
    ProxyDataFrequency=1
    

    3. 存储端:TimescaleDB 的乱序写入与 Chunk 调优

    调整 PostgreSQL 配置以应对偶发的乱序历史数据。增加 max_locks_per_transaction,并调优 TimescaleDB 的 Chunk 跨度与压缩策略。 在本次故障后,将 history_uint 的 chunk 时间跨度修改为 1 天(原默认或较小值可能导致过多的小 chunk 被频繁换入换出),并推迟压缩时间,给乱序数据留出缓冲窗口:

    -- 修改 Chunk interval 为 1 天(86400000 毫秒)
    SELECT set_chunk_time_interval('history_uint', 86400000);
    
    -- 调整压缩策略,允许两天内的乱序数据直接写入未压缩的 Chunk
    SELECT remove_compression_policy('history_uint');
    SELECT add_compression_policy('history_uint', INTERVAL '2 days');
    

    同时调整 postgresql.conf,将 shared_buffers 扩大至系统内存的 25%-40%,并设置 maintenance_work_mem = 2GB,加速 Chunk 的维护操作。

    常见问题

    Q1:如何快速定位是哪个自定义模板的哪个 Item 堵死了 Proxy 的 Preprocessing Queue? 在 Zabbix Server 上执行 SQL 查询,找出包含复杂正则或长 JSONPath 的大范围应用项: SELECT h.host, i.name, p.params FROM item_preproc p JOIN items i ON p.itemid = i.itemid JOIN hosts h ON i.hostid = h.hostid WHERE p.type IN (11, 12); (11=XML XPath, 12=JSONPath)。或者通过打开 Proxy 的 DebugLevel=4,结合 grep "preprocessing worker" 过滤慢解析的 itemid。

    Q2:Proxy 在高并发 IO 下,本地的 SQLite3 数据库频繁出现 “database disk image is malformed” 损坏,如何解决? 企业级环境(特别是 NVPS > 500 的场景)严禁在 Proxy端使用 SQLite。其文件级锁极易在磁盘 IO 高负载时造成数据损坏。建议一律替换为 MySQL (InnoDB) 或 PostgreSQL,并配置合理的 innodb_buffer_pool_size

    Q3:Zabbix Server 的 History Syncer 经常出现 100% busy,但后端数据库 IO 和 CPU 利用率都很低,这是为什么? 检查 Zabbix Server 的 ValueCacheSize。如果 Value Cache 内存耗尽或命中率极低(大量触发低频冷数据查询),History Syncer 会被迫在同步写入的同时去数据库执行同步的 SELECT 读操作来刷新 Cache,由于单线程阻塞等待返回,导致进程自身 busy,但这不会在数据库层体现为高资源消耗。解决思路是大幅提高 zabbix_server.conf 中的 ValueCacheSize

  • 深入 Zabbix 监控雪崩排查:Proxy 积压引发的 History Syncer 阻塞与数据库底层调优实战

    Zabbix 队列风暴的元凶往往不是 Server 计算能力不足,而是底层数据库 IO 瓶颈与 Proxy 离线数据猛灌。本文通过排查某次 NVPS 突发至 35k 导致的 History Syncer 打满与监控瘫痪事件,深入解析 MySQL 8.0 针对 Zabbix 写入优化的底层逻辑,并给出 Proxy 防御性配置与模板预处理过滤的实战方案。

    故障现场:History Syncer 进程 100% 死亡螺旋

    某次排查过程中,一套承载 20,000+ 主机、2,000,000+ 监控项的 Zabbix 6.0.22 LTS 集群突发严重告警。现象非常典型:

    1. Zabbix Queue 爆炸:延迟超过 10 分钟的 item 数量瞬间飙升到 150,000 以上。

    2. 内部进程打满:Zabbix Server 告警 Zabbix server history syncer processes more than 100% busy

    3. 前端瘫痪:Web 界面卡死,报 Zabbix server is not running: the information displayed may not be current

    查看 zabbix_server.log,满屏的慢查询和超时:

    23851:20231012:142211.512 [Z3005] query failed: [1205] Lock wait timeout exceeded; try restarting transaction [insert into history_uint (itemid,clock,ns,value) values (152342,1697101321,213412,0),(...)]
    23851:20231012:142215.123 server #12 active [history syncer #4]
    23851:20231012:142215.123 Zabbix server history syncer processes 100% busy
    

    很明显,数据落盘卡住了。History Syncer 负责将内存 cache 中的监控数据批量写入底层 MySQL。一旦它被阻塞,Server 内存中的 History Cache 会迅速耗尽,触发自我保护机制,拒绝接收任何新数据,最终导致 Poller 和 Trapper 进程全部雪崩。

    登陆底层 MySQL 8.0.34 节点,敲下 iostat -x 1,看到数据盘的 %util 稳稳地锁死在 100%,await 高达 200ms+。

    为什么 Proxy 断网恢复会导致 Zabbix Server 瞬间雪崩?

    排查发现,在雪崩发生前 15 分钟,某跨机房专线发生了短暂抖动。该机房部署了 3 台 Zabbix Proxy(Active 模式),承载了约 8,000 台主机的监控抓取。

    这里牵扯到 Zabbix Proxy 的底层工作机制。Proxy 默认会将采集到的数据暂存在本地的 SQLite3(或 MySQL)中。当与 Server 断开连接时,Proxy 会根据 ProxyOfflineBuffer 的配置(默认 1 小时)在本地堆积数据。

    雪崩的逻辑链条:

    1. 专线抖动,3 台 Proxy 与 Server 失联,期间不断采集并缓存数据到本地。

    2. 专线恢复,Proxy 瞬间将积压的数十万条历史数据打包。

    3. Proxy 根据 DataSenderFrequency=1(每秒发送)无脑向 Server 的 Trapper 进程猛灌。

    4. Server 的 Trapper 进程将海量数据塞入 History Cache。

    5. History Syncer 进程全速运转,向 MySQL 发起天量 INSERT INTO history... 请求。

    6. MySQL InnoDB Buffer Pool 的脏页刷新速率跟不上写入速率,Redo Log 爆满,触发同步刷盘,导致 IO 彻底僵死。

    防御性配置:限制 Proxy 突发流量

    为了防止类似情况再次发生,必须对 Proxy 的回传机制进行限流。

    1. 调优 Proxy 端缓存发送频率与体积 不要让 Proxy 一次性将积压数据全吐出来。在 zabbix_proxy.conf 中调整:

    # ProxyOfflineBuffer=1 # 离线缓存保留时间,不要设置太大,无意义的历史数据宁可丢弃
    DataSenderFrequency=1
    # 增加批量发送的限制(隐式受制于 Server 端 Trapper 进程处理能力)
    

    注:Zabbix 6.0 引入了 Proxy 内存缓存机制,但在面对海量离线回传时,核心仍是保护 Server 的 DB IO。

    2. 调优 Server 端接收与刷盘并发zabbix_server.conf 中调整:

    # 控制 Trapper 进程数,不要无限调大,防止压垮 History Cache
    StartTrappers=50
    # 增加 History Cache 大小,做大内存缓冲池,争取时间
    HistoryCacheSize=2G
    HistoryIndexCacheSize=512M
    # 增加 Syncer 进程数,但不要超过 DB 磁盘阵列的物理 IO 并发能力上限
    StartHistoryPollers=20
    

    数据库底层调优:拯救被压垮的 MySQL 8.0

    Zabbix 是一个典型的“读少写极其密集”的系统,标准的 MySQL 默认配置在这里就是灾难。针对本次 IO 瓶颈,我们在 my.cnf 中进行了以下针对性调优。

    1. 禁用 Doublewrite Buffer 与放宽事务持久性

    由于 Zabbix 数据并非金融级账本,丢失一两秒的监控数据完全可以接受。

    [mysqld]
    # 核心:将事务刷盘策略改为 2。每次提交仅写入 OS Cache,每秒刷盘一次。
    # 直接将 IOPS 需求降低一个数量级。
    innodb_flush_log_at_trx_commit = 2
    
    # 针对支持原子写的存储设备(如现代 NVMe SSD 或部分企业级 SAN),关闭双写缓冲
    innodb_doublewrite = 0
    
    # 优化 Redo log 大小,防止频繁触发 Checkpoint 导致 IO 抖动
    innodb_redo_log_capacity = 4G # MySQL 8.0.30+ 的新参数,替代旧的 innodb_log_file_size
    

    2. 匹配硬件的 InnoDB IO 刷盘能力

    MySQL 默认假设你的磁盘很慢(innodb_io_capacity=200),这会导致在 SSD 环境下脏页刷得太慢,最终堆积引发急剧抖动。

    # 根据实际 FIO 测试结果配置
    innodb_io_capacity = 3000
    innodb_io_capacity_max = 6000
    innodb_flush_sync = OFF # 避免 Checkpoint 时卡死用户查询
    

    3. 表分区与废弃 Housekeeper

    导致底层 IO 缓慢的另一个隐患是 Zabbix 自带的 Housekeeper 清理进程。它通过 DELETE FROM history WHERE clock < ... 清理过期数据,这在海量数据下会产生巨大的锁竞争和 Undo Log 开销。

    必须彻底关闭 Housekeeper 对历史表和趋势表的清理: Web 界面:Administration -> General -> Housekeeping,关闭 History and TrendEnable internal housekeeping

    替代方案:使用 MySQL 表分区(Table Partitioning)。 每天为 historyhistory_uinthistory_str 等表建一个新分区,清理数据时直接 ALTER TABLE ... DROP PARTITION,这是元数据操作,耗时 0.1 秒,没有任何 IO 负担。

    自定义模板防作死指南:在 Proxy 侧掐断垃圾数据

    数据库调优只是续命,真正的治本之策是降低 NVPS(New Values Per Second)。排查中发现,某开发团队的自定义模板中,有一个抓取应用日志错误状态的 item,类型居然是 Text,且每 5 秒抓取一次。无论状态是否改变,全量文本都在往 DB 里塞,直接打爆了 history_str 表。

    过滤绝招:Discard unchanged with heartbeat

    利用 Zabbix 的 Preprocessing(预处理)功能,直接在 Proxy 内存中过滤掉无用数据,根本不让它通过网络发给 Server。

    配置步骤:

    1. 打开 Item 的 Preprocessing 选项卡。

    2. 添加 Step:Discard unchanged with heartbeat

    3. 参数设置为 1h(或 3600s)。

    原理解析: 如果该 Item 的值相比上次抓取没有发生变化,Proxy 会直接将这个数据丢弃,不往 Server 发送。只有当值发生变化,或者超过设定的 heartbeat 时间(比如 1 小时没有变化),才会发送一次数据保持激活。 仅仅配置了这一项,我们的整体 NVPS 从 35,000 直接断崖式下降到 12,000,MySQL IO 负载瞬间降至 15% 以下。

    常见问题

    Q1:Web 界面经常报 Zabbix Server is not running,但查看进程都在,怎么回事? 通常是因为 PHP 前端通过 TCP 10051 端口请求 Server 的 StartTrappers 进程超时。大概率是因为 History Syncer 阻塞,导致 Trapper 进程全都在等待获取 Cache 锁。检查数据库负载,或适当增加 StartTrappers 数量。

    Q2:StartPollers 到底设置多少合适?为什么我设了 1000 还是不够? 千万不要无脑调大 Poller 数量。Poller 过多会导致严重的上下文切换和内存消耗。查看 Zabbix server data collector processes 图表,如果 Poller 使用率长期 > 75%,首先应该考虑将监控项改为 Active 模式(让 Agent 主动推),或者把采集任务剥离给下层 Proxy。

    Q3:存在大量 SNMP 监控导致 Poller 经常超时卡死,如何缓解? SNMP 采用 UDP,极易丢包阻塞。最佳实践:1) 将 SNMP 采集全部下放给专属的 Zabbix Proxy,将故障隔离;2) 在 Host 级别勾选 Use bulk requests;3) 在 zabbix_server.confzabbix_proxy.conf 中增加 Timeout=15(默认只有 3 秒,对于老旧交换机绝对不够)。