“Transparency is the highest form of reliability.”
— SRE Philosophy
All Systems Operational
Overall Uptime
99.98%
API Latency
42ms
Monitoring Days
90
Last Incident
2026-05-31
90-Day Availability Matrix
Operational
Degraded
Downtime
Incident History
INC-001
ResolvedRedis 集群主从切换延迟导致 API 瞬断
Redis Sentinel 检测到主节点心跳超时,触发主从切换,期间 API 响应延迟升高。
📅 2026-05-31⏱ ~2 min
INC-002
ResolvedKubernetes Node NotReady 导致服务漂移
Worker Node 因 kubelet 与 API Server 通信中断进入 NotReady 状态,Pod 被重新调度。
📅 2026-06-16⏱ ~5 min