跳转至

日常运维 SOP(Daily Operations Standard Operating Procedure)

文档编号:DOC-OPS-AM-01 版本:V1.0 创建日期:2026-08-11 维护人:听云(WCL) / TL 保密级别:🟢 可公开发布 关联文档管理员操作手册 README监控告警故障排查DIP1-OPS 操作手册


一、文档定位

本文件定义听云(WCL)日常运维的标准操作流程,包括日巡检、周巡检、月度评审、健康检查、常规操作等。听云按本 SOP 执行日常运维,确保生产环境稳定运行。

1.1 SOP 适用范围

范围 说明
适用子项目 全部子项目(DIP1 / 未来 DIP2 / ...)
执行人 听云(WCL)
评审人 TL
执行频率 日/周/月 三级

1.2 SOP 原则

  1. 可重复:每次执行步骤一致,结果可验证
  2. 可追溯:每次执行记录到 OWLG
  3. 可量化:检查项有明确判定标准(数值/状态)
  4. 可扩展:新子项目上线后纳入本 SOP,无需重建

二、日巡检 SOP

2.1 执行时间与频率

说明
执行时间 每日 09:00 / 21:00(每日 2 次)
执行时长 约 15 分钟
执行人 听云(WCL)
记录方式 OWLG 日志(异常时)+ 监控仪表板(正常时)

2.2 日巡检项目

# 检查项 检查方法 正常标准 异常处置
1 服务健康状态 GET /health 接口 HTTP 200 参考 incident-response.md
2 容器运行状态 docker ps 全部 Up 重启容器 + OWLG 记录
3 CPU 使用率 监控仪表板 < 70% 持续 5 分钟超阈值 → 告警
4 内存使用率 监控仪表板 < 80% 持续 5 分钟超阈值 → 告警
5 磁盘使用率 df -h < 75% > 80% → 清理日志 / 扩容
6 数据库连接数 监控仪表板 < max_connections × 70% 排查长连接 / 慢查询
7 错误日志(5xx) Sentry / 日志聚合 5 分钟内 < 10 条 触发 incident-response
8 外部服务连通性 探针脚本 R2 / WhatsApp / Expo 可达 标记降级 + OWLG
9 备份任务状态 备份系统日志 上次备份成功 立即手动备份 + 排查
10 证书有效期 证书监控 > 30 天 < 30 天 → 申请轮换

2.3 日巡检执行流程

09:00 / 21:00 听云启动日巡检
        ↓
打开监控仪表板,逐项核对 10 个检查项
        ↓
全部正常 → 在仪表板标记"巡检完成",无需 OWLG
        ↓
发现异常 → 立即处置 + 记录 OWLG
        ↓
异常等级 ≥ P1 → 立即上报 TL
        ↓
09:30 / 21:30 巡检结束

三、周巡检 SOP

3.1 执行时间与频率

说明
执行时间 每周一 10:00
执行时长 约 60 分钟
执行人 听云(WCL)
评审人 TL

3.2 周巡检项目

# 检查项 检查方法 输出
1 上周告警汇总 监控系统告警历史 告警数 / 分类 / 趋势
2 上周故障复盘 OWLG + incident-response 记录 故障数 / 根因 / 改进项
3 上周部署记录 OWLG + Git log 部署次数 / 成功率 / 回滚次数
4 性能趋势分析 监控仪表板周视图 CPU/内存/响应时间趋势
5 容量评估 资源使用率周报 是否需要扩容
6 凭据轮换预警 rotation-schedule.md 14 天内到期凭据清单
7 备份完整性 备份系统周报 备份成功率 / 恢复测试
8 工单处理情况 service-manual 工单系统 上周工单数 / SLA 达成率
9 安全审计日志 audit-log.md 上周凭据操作 + 越权尝试
10 文档更新需求 各文档评审周期 待更新文档清单

3.3 周报输出

听云每周一 14:00 前输出周报,内容包括:

  • 上周运维事件汇总(部署 / 故障 / 工单)
  • 关键性能指标趋势
  • 待处理问题列表(含负责人 / 截止)
  • 本周计划(部署 / 轮换 / 演练)
  • 风险预警(如有)

周报同步至 TL,TL 审核后将关键里程碑同步至主仓 WLG(对齐 PJM §3.5.3 周反馈简报触发条件)。


四、月度评审 SOP

4.1 执行时间与频率

说明
执行时间 每月 1 日 10:00
执行时长 约 3 小时
执行人 听云(WCL)
评审人 TL

4.2 月度评审项目

# 评审项 评审内容 输出
1 SLA 达成率 上月可用性 / 响应时间 / 解决时间 月度 SLA 报表
2 容量规划 资源使用率趋势 + 业务增长预测 扩容建议
3 凭据审计 audit-log.md 月度审计 月度审计报告
4 轮换执行率 rotation-schedule.md 执行情况 轮换完成率
5 备份恢复演练 每月 1 次恢复演练 演练报告
6 文档评审 admin-manual / service-manual 评审 文档更新清单
7 成本分析 资源消耗 + 外部服务费用 月度成本报表
8 风险评估 安全 / 容量 / 依赖 / 人员 风险清单

4.3 月报输出

听云每月 1 日 18:00 前输出月报,TL 审核后同步至主仓 WLG。


五、常规操作 SOP

5.1 服务启停

# 启动服务(按子项目)
docker compose -f docker-compose.prod.yml up -d

# 停止服务
docker compose -f docker-compose.prod.yml down

# 重启单个服务
docker compose -f docker-compose.prod.yml restart <service_name>

# 查看服务状态
docker compose -f docker-compose.prod.yml ps

注意事项: - 启停前必须验证当前服务状态(避免重复操作) - 停止服务前必须确认无活跃请求 - 重启后必须执行健康检查

5.2 日志查看

# 实时日志(全部服务)
docker compose -f docker-compose.prod.yml logs -f

# 单服务日志(最近 100 行)
docker compose -f docker-compose.prod.yml logs --tail=100 <service_name>

# 时间范围查询
docker compose -f docker-compose.prod.yml logs --since=2h <service_name>

# 关键字搜索
docker compose -f docker-compose.prod.yml logs <service_name> | grep "ERROR"

5.3 数据库常规操作

操作 命令 频率 备注
连接数查看 SELECT count(*) FROM pg_stat_activity; 日巡检
长连接排查 SELECT * FROM pg_stat_activity WHERE state='active' AND now()-query_start > '5m'; 按需 > 5 分钟
慢查询查看 SELECT * FROM pg_stat_statements ORDER BY mean_exec_time DESC LIMIT 10; 周巡检
表大小排序 SELECT relname, pg_size_pretty(pg_total_relation_size(relid)) FROM pg_catalog.pg_statio_user_tables ORDER BY pg_total_relation_size(relid) DESC LIMIT 10; 月度
索引使用率 SELECT * FROM pg_stat_user_indexes; 月度

禁止操作(对齐 WCL 工作手册 §6.1): - ❌ DROP TABLE / TRUNCATE(需 TL 授权) - ❌ DELETE WITHOUT WHERE(永远禁止) - ❌ 未经备份的 schema 变更

5.4 配置变更(常规)

按 V1.2 工作手册 §1.3,听云可自主执行常规配置变更:

步骤 操作 记录
1 备份当前配置 OWLG
2 修改 .env / 配置文件
3 重启受影响服务
4 验证健康检查
5 验证业务流程
6 记录变更到 OWLG 通知 TL

常规配置变更范围: - ✅ 非敏感环境变量(如 LOG_LEVELCACHE_TTL) - ✅ 配置表参数(如费率系数、特征库参数) - ✅ CORS 白名单(已审批域) - ✅ API 参数调优 - ✅ Webhook 地址

关键配置变更范围(需 TL 确认): - ⚠️ JWT_SECRET / DATABASE_URL - ⚠️ 第三方服务主账号 - ⚠️ CORS 新增域名 - ⚠️ RLS 策略 - ⚠️ 数据库结构变更


六、应急联络

6.1 联络人清单

实际联络方式(电话/飞书)由 TL 本地保管,不写入可公开文档。

角色 职责 联络方式
TL 技术决策 / 凭据授权 / P0 升级 TL 本地保管
WCL(听云) 日常运维 / 故障响应 通过 OWLG / Issue
WDE(听码) 代码 Bug 修复 通过 Issue(TL 转发)
BO 业务决策 TL 转达
OL 客服工单升级 TL 转达

6.2 升级路径

听云发现异常
        ↓
P3(Minor)→ 听云自主处置 + OWLG 记录
        ↓
P2(Major)→ 24h 内上报 TL + OWLG 记录
        ↓
P1(Critical)→ 立即上报 TL + 4h 响应
        ↓
P0(Blocker)→ 立即飞书告警 TL + BO 决策

详细分级标准见 incident-response.md


七、修订记录

版本 日期 修订人 修订内容
V1.0 2026-08-11 DT 初始化日常运维 SOP;定义日/周/月三级巡检流程;规范服务启停/日志查看/数据库操作/配置变更等常规操作;定义应急联络与升级路径

本文件为听云(WCL)日常运维的标准操作流程。每次执行须按 SOP 操作并记录 OWLG。