设备停机时,工程师最不希望看到的报警是“Operation Failed”。可观测性的目标不是生成更多日志,而是让人能够从外部数据推断内部状态,重建某片晶圆、某次动作和某个故障的完整过程。
1. 日志记录事件,指标描述趋势
结构化日志适合回答发生了什么,指标适合观察频率、延迟和资源变化,追踪则把跨模块调用串成一次事务。三者应共享时间、设备、模块、任务、Carrier、槽位和晶圆等关联字段。
时钟不同步会破坏因果关系。设备、PLC、相机和外部服务需要统一时间源,同时记录单调时钟耗时,避免系统时间校正造成负耗时。
2. 报警必须可操作
报警应说明对象、现象、严重度、触发条件和建议动作,并区分当前活动、已确认和已恢复。一次根因可能派生多个症状,系统应抑制告警风暴,但不能丢失原始事件。
报警码要稳定,不随文案翻译变化。修改阈值和定义属于受控变更,否则长期统计失去可比性。
3. 日志不能改变控制结果
日志写盘、上传和压缩应有隔离与背压,磁盘满时优先保护控制与关键审计数据。异步日志队列同样要有上限和丢弃策略;安全、状态转换与产品追溯信息不能静默丢失。
日志中还要避免写入口令、密钥和不必要的客户数据,并建立访问权限、保留期限与完整性保护。
4. 建立设备健康视图
有价值的指标包括状态时间、循环时间、重试率、队列深度、真空抽气曲线、位置稳定时间和算法延迟。阈值之外还应关注相对基线的缓慢漂移,这往往能在硬故障前暴露问题。
指标必须有口径:开始和结束事件、排除时间、聚合窗口和单位都要固定,才能跨版本、跨设备比较。
5. 从报警到证据包
严重故障发生时,可自动冻结前后窗口的关键日志、趋势、配置和软件版本,形成诊断包。这样既减少远程来回取数,也避免后续运行覆盖现场。
总结
设备可观测性是一条从物理事件到工程判断的证据链。关联上下文、统一时间、稳定报警语义和受控数据保留,比无差别增加日志级别更有价值。