
嵌入式 Linux 巡检开发短记启动链路怎么核对嵌入式 Linux 的巡检不应照搬服务器清单。重点是启动链路、存储寿命、时间同步和业务进程是否仍处在预期状态。每次启动都能自证采集内核版本、设备树标识、根文件系统挂载方式、启动槽位和应用版本并把它们写入同一条启动摘要。遇到问题时不需要在多个日志中猜测系统实际运行的镜像。存储侧关注只读挂载、文件系统错误、磨损指标和剩余空间网络侧关注链路状态、地址获取和时间同步业务侧则检查守护进程、关键设备节点和最近一次成功任务。每项检查都应给出失败后的处理人或恢复动作。巡检脚本要克制脚本只读取必要状态避免在设备上执行大范围扫描、无条件重启或清理日志。输出采用稳定字段方便监控系统解析。把“检查到异常”和“自动修复”分成两个开关现场排障时才能先保留证据再决定是否恢复。从启动摘要开始排查建议把 bootloader 传入的槽位、内核命令行、根分区 UUID 与应用构建号拼成一条只读摘要并在启动完成后写到持久日志。升级演练时故意让新槽位的健康检查失败确认系统回退后摘要能明确显示旧槽位而不是只显示“启动成功”。这能避免把镜像选择问题误判成业务进程问题。巡检结果应按设备 ID 和采集时间上报网络不可用时放进有上限的本地队列。队列满时保留最近一次状态并记录丢弃计数不能无限占用存储恢复联网后再核对补传顺序是否会影响监控端判断。升级前后各跑一次同样的检查单差异才有明确参照。对无法采集的字段输出“未知”及原因而不是以空值默认为正常这样监控端能区分设备健康和探针本身失效。必要时由现场人员补采证据。