文章 09

AI 能构建可运行系统,但正式上线前还要准备什么?

理解原型、演示与生产系统在安全、负载、基础设施、部署、备份和运营支持上的差异。

18 分钟 系统负责人、管理层、产品负责人和 Tech Lead 2026-07-17
概览信息图
AI Demo
生产
安全
负载
Observe
Rollback

从可用界面开始

从系统使用者开始

能运行,并不等于业务可以依赖

AI 可以快速创建界面、API 与数据库连接,因此开发机上的演示容易让人以为已经接近上线。但真实用户、恶意流量、网络故障和人为失误会改变问题。生产就绪意味着系统与团队能够保护数据、承受需求、恢复服务并进行沟通。

阅读前术语

按实际作用解释技术语言

无需一次记住所有术语,可在阅读详情时返回对照。

Prototype / Demo
用于验证想法或主要流程的实验系统,通常使用示例数据且故障处理有限。
Production
服务真实用户和数据的线上环境,故障会影响运营、收入或信任。
Scalability
随着需求增长增加资源或调整系统,同时保持服务质量的能力。
Load Balancer
把请求分配到多个应用实例的流量入口。
Rate Limit
按身份或时间窗口限制请求数量,以控制滥用与过载。
Observability
通过指标、日志和追踪解释系统行为、用户影响和瓶颈。
Rollback
发布失败时受控返回安全版本,并考虑数据库兼容性。
Secret
API 密钥、密码和私钥等机器凭证,不应写入源代码。

面向业务与一般用户的摘要

AI 能构建可运行系统,但正式上线前还要准备什么?

01

原型验证想法;生产系统还必须验证安全、韧性与可运营性。

02

基础设施容量应基于并发、请求速率、工作负载和峰值,而不是只看总用户数。

03

安全、备份、监控、回滚与事故响应必须在上线前设计。

04

AI 加快交付,但负责人仍需验证架构、依赖、密钥与权限。

动态扩展说明

深入阅读前,先了解各阶段如何连接

选择阶段,查看发生了什么、需要检查哪些证据,以及一个决策如何影响下一阶段。

步骤 01 / 06

01 / 正确定义问题

演示测试预期路径,生产系统还要承受意外路径

演示通常只有少量账户、干净数据与预期操作。生产环境会遇到错误文件、重复操作、网络中断、混合权限和自动流量,因此必须测试正常、失败与恶意路径。

需要检查的证据

  • 错误输入不能导致服务崩溃
  • 重试不能创建重复数据
  • 每个请求都检查授权
  • 外部故障需要超时与降级方案

深入说明

逐项说明如何应用于真实场景

每一部分都连接业务影响与 Tech Lead 需要检查的内容,包括示例、证据与限制。

01 / 正确定义问题

01

演示测试预期路径,生产系统还要承受意外路径

演示通常只有少量账户、干净数据与预期操作。生产环境会遇到错误文件、重复操作、网络中断、混合权限和自动流量,因此必须测试正常、失败与恶意路径。

  • 错误输入不能导致服务崩溃
  • 重试不能创建重复数据
  • 每个请求都检查授权
  • 外部故障需要超时与降级方案

02 / 理解负载

02

十万用户并不代表所有系统需要相同服务器规模

基础设施承受的是并发活动和每位用户产生的工作,而不是注册总数。应基于并发、请求速率、载荷、数据库查询、后台任务与峰值建立负载模型。

面向 Tech Lead 的详情

先做基线测试,再做负载、压力与耐久测试;按端点查看 p95/p99,不只看平均值。

03 / 上线前保护

03

安全不是系统完成后再安装的插件

先识别数据、合法访问者、潜在影响与互联网入口,再设计身份认证、授权、加密、密钥管理、网络边界、审计日志和补丁流程。AI 辅助代码还需检查过期依赖、硬编码密钥、调试配置和缺少授权的端点。

  • 管理员使用 MFA
  • 使用密钥管理服务
  • 采用最小权限
  • 扫描依赖和镜像
  • 审计日志不记录密码或令牌

04 / 构建平台

04

良好基础设施让扩容、部署与恢复可重复执行

平台可分为 DNS/TLS、CDN/WAF、负载均衡、可伸缩应用、私有并备份的数据库、对象存储与队列。通过基础设施即代码创建环境,并让部署包含健康检查、迁移和已演练的回滚。

05 / 运营与恢复

05

发生故障时,必须明确负责人、影响范围和下次更新时间

监控应反映用户体验,而不是资源一波动就告警。定义服务目标、告警负责人、运行手册、严重级别和沟通方式;测试恢复,并通过事故复盘改进原因与发现速度。

06 / 上线前决策

06

当剩余风险都有负责人和应对方案时再上线,而不是只看清单变绿

线上系统不会完美。就绪评估应记录已验证证据、接受的剩余风险、审批人和停止发布条件。SIS 可按业务影响协助架构、安全、负载、交付、监控与支持设计。

行动前检查清单

01

分离原型、UAT 与生产

02

数据分类与威胁建模

03

建立负载模型与阈值

04

检查每个端点权限

05

密钥不进入源码

06

定义备份、RPO 与 RTO

07

测试部署与回滚

08

配置监控与运行手册

09

演练事故沟通

10

上线前记录接受的风险

参考资料

数字与示例用于建立讨论框架,决策前应以真实系统及其限制进行验证。

审阅者
SIS Infrastructure & Security
最后审阅
2026-07-17

还不确定应该从哪里开始检查?

使用初步评估工具,或向 SIS 提供系统背景,以便确定最高优先事项。

返回知识库