文章 06
从 AI 辅助构建到可运营的生产系统
AI 加速构建,但真实数据、用户、变更与故障仍需要基础设施、安全、部署、监控、恢复与明确负责人。
应用
生产就绪
示例场景
从系统使用者开始
演示通过了,但上线当天没人负责支持
团队用 AI 快速构建,演示时所有页面都能运行。上线后,多部门同时使用导致变慢,部分数据不完整,也没有仪表板或运行手册。缺少的不是 AI 能力,而是让软件安全运行于现实世界的运营层。
面向业务与一般用户的摘要
从 AI 辅助构建到可运营的生产系统
能运行只证明正常路径;生产系统还要处理故障路径与变更。
就绪涵盖人员、流程、数据、系统与支持。
准备程度应匹配系统重要性,并非所有项目都需要企业级复杂度。
动态扩展说明
深入阅读前,先了解各阶段如何连接
选择阶段,查看发生了什么、需要检查哪些证据,以及一个决策如何影响下一阶段。
步骤 01 / 04
01 / 选择等级
实验、业务与关键系统需要不同控制
先问停机一小时影响谁、哪些数据不能丢、是否有人工替代。小型内部工具可用简单部署与备份,而支付或客户系统需要更强的监控、回滚、恢复目标与支持负责人。
需要检查的证据
- 实验:模拟数据与有限用户
- 业务 MVP:真实数据与明确负责人
- 关键业务:SLA、恢复与事故流程
深入说明
逐项说明如何应用于真实场景
每一部分都连接业务影响与 Tech Lead 需要检查的内容,包括示例、证据与限制。
01 / 选择等级
01实验、业务与关键系统需要不同控制
先问停机一小时影响谁、哪些数据不能丢、是否有人工替代。小型内部工具可用简单部署与备份,而支付或客户系统需要更强的监控、回滚、恢复目标与支持负责人。
- 实验:模拟数据与有限用户
- 业务 MVP:真实数据与明确负责人
- 关键业务:SLA、恢复与事故流程
02 / 八个层面
02生产就绪不只是基础设施
系统就绪需要需求与负责人清晰、权限保护数据、环境隔离、部署可重复、性能有基线、监控可发现症状、备份可恢复、支持团队知道如何响应。缺一层,问题往往在真实使用时出现。
- 产品与负责人
- 安全与数据
- 基础设施与环境
- 部署与回滚
- 性能与容量
- 监控与告警
- 备份与恢复
- 支持与事故管理
03 / 上线
03上线日需要计划,而不只是部署命令
定义部署窗口、上线决策人、部署后检查、用户沟通、回滚触发条件与事故渠道。初期应同时观察指标与反馈,因为有些问题不会出现在测试数据中。
上线控制
开始前定义停止条件
例如错误率持续超阈值、关键交易不完整或监控缺失时,应停止发布并回滚,而不是无控制地在线修复。
04 / 上线之后
04用户需要知道发生了什么、谁负责以及何时更新
良好支持需要受理、严重级别、复现证据、临时方案沟通,以及以根因和预防措施结案。它不只是确认工单,应与系统一起设计,而非事故后补充。
运行手册应说明每类事故的仪表板、日志查询、负责人、升级、安全操作与禁止操作。
行动前检查清单
划分系统重要性
检查角色与数据
隔离环境
准备部署与回滚
定义基线与告警
测试备份恢复
指定支持负责人
演练关键事故
参考资料
数字与示例用于建立讨论框架,决策前应以真实系统及其限制进行验证。
- 审阅者
- SIS Engineering & Operations
- 最后审阅
- 2026-07-17