日常运维 SOP(Daily Operations Standard Operating Procedure)¶
文档编号:DOC-OPS-AM-01 版本:V1.0 创建日期:2026-08-11 维护人:听云(WCL) / TL 保密级别:🟢 可公开发布 关联文档:管理员操作手册 README、监控告警、故障排查、DIP1-OPS 操作手册
一、文档定位¶
本文件定义听云(WCL)日常运维的标准操作流程,包括日巡检、周巡检、月度评审、健康检查、常规操作等。听云按本 SOP 执行日常运维,确保生产环境稳定运行。
1.1 SOP 适用范围¶
| 范围 | 说明 |
|---|---|
| 适用子项目 | 全部子项目(DIP1 / 未来 DIP2 / ...) |
| 执行人 | 听云(WCL) |
| 评审人 | TL |
| 执行频率 | 日/周/月 三级 |
1.2 SOP 原则¶
- 可重复:每次执行步骤一致,结果可验证
- 可追溯:每次执行记录到 OWLG
- 可量化:检查项有明确判定标准(数值/状态)
- 可扩展:新子项目上线后纳入本 SOP,无需重建
二、日巡检 SOP¶
2.1 执行时间与频率¶
| 项 | 说明 |
|---|---|
| 执行时间 | 每日 09:00 / 21:00(每日 2 次) |
| 执行时长 | 约 15 分钟 |
| 执行人 | 听云(WCL) |
| 记录方式 | OWLG 日志(异常时)+ 监控仪表板(正常时) |
2.2 日巡检项目¶
| # | 检查项 | 检查方法 | 正常标准 | 异常处置 |
|---|---|---|---|---|
| 1 | 服务健康状态 | GET /health 接口 |
HTTP 200 | 参考 incident-response.md |
| 2 | 容器运行状态 | docker ps |
全部 Up | 重启容器 + OWLG 记录 |
| 3 | CPU 使用率 | 监控仪表板 | < 70% | 持续 5 分钟超阈值 → 告警 |
| 4 | 内存使用率 | 监控仪表板 | < 80% | 持续 5 分钟超阈值 → 告警 |
| 5 | 磁盘使用率 | df -h |
< 75% | > 80% → 清理日志 / 扩容 |
| 6 | 数据库连接数 | 监控仪表板 | < max_connections × 70% | 排查长连接 / 慢查询 |
| 7 | 错误日志(5xx) | Sentry / 日志聚合 | 5 分钟内 < 10 条 | 触发 incident-response |
| 8 | 外部服务连通性 | 探针脚本 | R2 / WhatsApp / Expo 可达 | 标记降级 + OWLG |
| 9 | 备份任务状态 | 备份系统日志 | 上次备份成功 | 立即手动备份 + 排查 |
| 10 | 证书有效期 | 证书监控 | > 30 天 | < 30 天 → 申请轮换 |
2.3 日巡检执行流程¶
09:00 / 21:00 听云启动日巡检
↓
打开监控仪表板,逐项核对 10 个检查项
↓
全部正常 → 在仪表板标记"巡检完成",无需 OWLG
↓
发现异常 → 立即处置 + 记录 OWLG
↓
异常等级 ≥ P1 → 立即上报 TL
↓
09:30 / 21:30 巡检结束
三、周巡检 SOP¶
3.1 执行时间与频率¶
| 项 | 说明 |
|---|---|
| 执行时间 | 每周一 10:00 |
| 执行时长 | 约 60 分钟 |
| 执行人 | 听云(WCL) |
| 评审人 | TL |
3.2 周巡检项目¶
| # | 检查项 | 检查方法 | 输出 |
|---|---|---|---|
| 1 | 上周告警汇总 | 监控系统告警历史 | 告警数 / 分类 / 趋势 |
| 2 | 上周故障复盘 | OWLG + incident-response 记录 | 故障数 / 根因 / 改进项 |
| 3 | 上周部署记录 | OWLG + Git log | 部署次数 / 成功率 / 回滚次数 |
| 4 | 性能趋势分析 | 监控仪表板周视图 | CPU/内存/响应时间趋势 |
| 5 | 容量评估 | 资源使用率周报 | 是否需要扩容 |
| 6 | 凭据轮换预警 | rotation-schedule.md | 14 天内到期凭据清单 |
| 7 | 备份完整性 | 备份系统周报 | 备份成功率 / 恢复测试 |
| 8 | 工单处理情况 | service-manual 工单系统 | 上周工单数 / SLA 达成率 |
| 9 | 安全审计日志 | audit-log.md | 上周凭据操作 + 越权尝试 |
| 10 | 文档更新需求 | 各文档评审周期 | 待更新文档清单 |
3.3 周报输出¶
听云每周一 14:00 前输出周报,内容包括:
- 上周运维事件汇总(部署 / 故障 / 工单)
- 关键性能指标趋势
- 待处理问题列表(含负责人 / 截止)
- 本周计划(部署 / 轮换 / 演练)
- 风险预警(如有)
周报同步至 TL,TL 审核后将关键里程碑同步至主仓 WLG(对齐 PJM §3.5.3 周反馈简报触发条件)。
四、月度评审 SOP¶
4.1 执行时间与频率¶
| 项 | 说明 |
|---|---|
| 执行时间 | 每月 1 日 10:00 |
| 执行时长 | 约 3 小时 |
| 执行人 | 听云(WCL) |
| 评审人 | TL |
4.2 月度评审项目¶
| # | 评审项 | 评审内容 | 输出 |
|---|---|---|---|
| 1 | SLA 达成率 | 上月可用性 / 响应时间 / 解决时间 | 月度 SLA 报表 |
| 2 | 容量规划 | 资源使用率趋势 + 业务增长预测 | 扩容建议 |
| 3 | 凭据审计 | audit-log.md 月度审计 | 月度审计报告 |
| 4 | 轮换执行率 | rotation-schedule.md 执行情况 | 轮换完成率 |
| 5 | 备份恢复演练 | 每月 1 次恢复演练 | 演练报告 |
| 6 | 文档评审 | admin-manual / service-manual 评审 | 文档更新清单 |
| 7 | 成本分析 | 资源消耗 + 外部服务费用 | 月度成本报表 |
| 8 | 风险评估 | 安全 / 容量 / 依赖 / 人员 | 风险清单 |
4.3 月报输出¶
听云每月 1 日 18:00 前输出月报,TL 审核后同步至主仓 WLG。
五、常规操作 SOP¶
5.1 服务启停¶
# 启动服务(按子项目)
docker compose -f docker-compose.prod.yml up -d
# 停止服务
docker compose -f docker-compose.prod.yml down
# 重启单个服务
docker compose -f docker-compose.prod.yml restart <service_name>
# 查看服务状态
docker compose -f docker-compose.prod.yml ps
注意事项: - 启停前必须验证当前服务状态(避免重复操作) - 停止服务前必须确认无活跃请求 - 重启后必须执行健康检查
5.2 日志查看¶
# 实时日志(全部服务)
docker compose -f docker-compose.prod.yml logs -f
# 单服务日志(最近 100 行)
docker compose -f docker-compose.prod.yml logs --tail=100 <service_name>
# 时间范围查询
docker compose -f docker-compose.prod.yml logs --since=2h <service_name>
# 关键字搜索
docker compose -f docker-compose.prod.yml logs <service_name> | grep "ERROR"
5.3 数据库常规操作¶
| 操作 | 命令 | 频率 | 备注 |
|---|---|---|---|
| 连接数查看 | SELECT count(*) FROM pg_stat_activity; |
日巡检 | — |
| 长连接排查 | SELECT * FROM pg_stat_activity WHERE state='active' AND now()-query_start > '5m'; |
按需 | > 5 分钟 |
| 慢查询查看 | SELECT * FROM pg_stat_statements ORDER BY mean_exec_time DESC LIMIT 10; |
周巡检 | — |
| 表大小排序 | SELECT relname, pg_size_pretty(pg_total_relation_size(relid)) FROM pg_catalog.pg_statio_user_tables ORDER BY pg_total_relation_size(relid) DESC LIMIT 10; |
月度 | — |
| 索引使用率 | SELECT * FROM pg_stat_user_indexes; |
月度 | — |
禁止操作(对齐 WCL 工作手册 §6.1):
- ❌ DROP TABLE / TRUNCATE(需 TL 授权)
- ❌ DELETE WITHOUT WHERE(永远禁止)
- ❌ 未经备份的 schema 变更
5.4 配置变更(常规)¶
按 V1.2 工作手册 §1.3,听云可自主执行常规配置变更:
| 步骤 | 操作 | 记录 |
|---|---|---|
| 1 | 备份当前配置 | OWLG |
| 2 | 修改 .env / 配置文件 |
— |
| 3 | 重启受影响服务 | — |
| 4 | 验证健康检查 | — |
| 5 | 验证业务流程 | — |
| 6 | 记录变更到 OWLG | 通知 TL |
常规配置变更范围:
- ✅ 非敏感环境变量(如 LOG_LEVEL、CACHE_TTL)
- ✅ 配置表参数(如费率系数、特征库参数)
- ✅ CORS 白名单(已审批域)
- ✅ API 参数调优
- ✅ Webhook 地址
关键配置变更范围(需 TL 确认):
- ⚠️ JWT_SECRET / DATABASE_URL
- ⚠️ 第三方服务主账号
- ⚠️ CORS 新增域名
- ⚠️ RLS 策略
- ⚠️ 数据库结构变更
六、应急联络¶
6.1 联络人清单¶
实际联络方式(电话/飞书)由 TL 本地保管,不写入可公开文档。
| 角色 | 职责 | 联络方式 |
|---|---|---|
| TL | 技术决策 / 凭据授权 / P0 升级 | TL 本地保管 |
| WCL(听云) | 日常运维 / 故障响应 | 通过 OWLG / Issue |
| WDE(听码) | 代码 Bug 修复 | 通过 Issue(TL 转发) |
| BO | 业务决策 | TL 转达 |
| OL | 客服工单升级 | TL 转达 |
6.2 升级路径¶
听云发现异常
↓
P3(Minor)→ 听云自主处置 + OWLG 记录
↓
P2(Major)→ 24h 内上报 TL + OWLG 记录
↓
P1(Critical)→ 立即上报 TL + 4h 响应
↓
P0(Blocker)→ 立即飞书告警 TL + BO 决策
详细分级标准见 incident-response.md。
七、修订记录¶
| 版本 | 日期 | 修订人 | 修订内容 |
|---|---|---|---|
| V1.0 | 2026-08-11 | DT | 初始化日常运维 SOP;定义日/周/月三级巡检流程;规范服务启停/日志查看/数据库操作/配置变更等常规操作;定义应急联络与升级路径 |
本文件为听云(WCL)日常运维的标准操作流程。每次执行须按 SOP 操作并记录 OWLG。