FDE 生产级交付与运行
从可用原型走向稳定生产的上线门槛、评测、可观测性、可靠性、回滚和责任分工清单。
原型能跑,不等于可以生产运行
原型用于验证“这个方案是否值得继续”,生产系统还要证明“它能在真实流量、真实权限和异常条件下持续运行”。FDE 可能亲自负责到生产,也可能与平台、安全、数据和业务团队共同交付;无论组织形式如何,责任都必须明确。
| 维度 | 原型阶段 | 生产阶段 |
|---|---|---|
| 数据 | 小样本或脱敏副本 | 明确来源、权限、保留、删除和跨境路径 |
| 质量 | 演示样例可用 | 代表性评测集、阈值、回归和线上反馈 |
| 身份 | 少量测试账号 | SSO、最小权限、服务账号和审计日志 |
| 可靠性 | 手工重试 | 超时、重试、幂等、限流、熔断和降级 |
| 变更 | 直接替换 Prompt/模型 | 版本化、灰度、兼容验证和回滚 |
| 运行 | 开发者盯着 | 告警、值班、处置手册、SLO 和成本预算 |
| 责任 | “项目组负责” | 明确业务、技术、安全、数据和供应商负责人 |
六个上线门槛
1. 结果与责任门槛
- 目标用户、关键任务和不可接受的失败已经写清
- 业务指标有当前基线、计算口径、观测周期和数据负责人
- 明确谁批准上线、谁处理事故、谁能关闭功能
- 停止条件和退出方案可执行,而不是只有成功计划
2. 架构与数据门槛
- 画出数据流、信任边界、外部依赖和写回路径
- 测试、预发布和生产环境隔离
- 数据最小化,明确保留、删除、备份和恢复规则
- 对模型、检索库、工具调用和第三方插件分别做风险评估
涉及个人信息、生成内容或跨境数据时,继续使用 安全与合规检查框架。
3. 身份与安全门槛
- 默认拒绝,按任务授予最小权限
- 用户权限传递到检索和工具层,不能只在页面隐藏按钮
- 高风险写操作采用确定性校验、审批或双人复核
- 密钥进入专用密钥管理,不出现在前端、Prompt 和普通日志
- 完成提示注入、越权检索、工具滥用和敏感信息泄露测试
4. 评测门槛
评测至少分三层:
- 离线任务评测:用代表性样本检查正确性、完整性、引用、格式和拒答
- 安全与边界评测:覆盖恶意输入、敏感内容、越权、歧视风险和故障场景
- 线上运行评测:观察真实采用、人工改写、升级率、投诉、错误和成本
每个结果都要绑定模型、Prompt、检索配置、工具版本和评测集版本。只汇报一个平均“准确率”会掩盖严重少数错误;高风险任务要单列致命错误率和不可接受样本。
5. 可靠性与可观测门槛
先定义用户实际感知的服务指标,再讨论技术指标:
- 成功完成率、端到端延迟、超时率和降级率
- 有依据回答率、人工改写率、转人工率和投诉率
- 单次任务成本、每日预算和异常调用量
- 外部模型、检索、数据库和业务系统的分段耗时与错误
按业务需要定义 SLI/SLO,并确定事故恢复目标。RTO 表示可接受的恢复时长,RPO 表示可接受的数据丢失窗口;不是所有内部助手都需要金融核心系统级别的目标。
日志和追踪通常需要关联请求、用户或角色、模型与 Prompt 版本、检索来源、工具调用、延迟、费用、错误和人工修改。日志也可能包含敏感数据,因此要做字段最小化、脱敏、访问控制和保留期限设计。
6. 发布与变更门槛
- 用功能开关控制暴露范围,先内部或小流量灰度
- 预先定义回滚版本、停止开关和降级路径
- 模型、Prompt、检索索引或工具变更先跑回归集
- 对关键接口设置超时、有限重试、幂等键、限流和熔断
- 外部模型不可用时,明确是排队、转人工、只读还是关闭功能
“换模型无需改代码”不代表没有行为变化。供应商静默升级、上下文窗口、限流、价格和安全策略变化都可能造成回归。
最小运行责任表
| 事项 | 必须明确的负责人 |
|---|---|
| 业务规则与可接受风险 | 业务负责人 |
| 应用、集成与故障修复 | 工程/FDE 负责人 |
| 模型、Prompt、检索与评测 | AI/产品/领域专家的明确组合 |
| 数据质量、权限与生命周期 | 数据负责人 |
| 安全、隐私和法律判断 | 安全、隐私与法务负责人 |
| 供应商事故和合同升级 | 采购/供应商负责人 |
| 用户培训、反馈与采用 | 业务运营或变革负责人 |
一人可以兼任多个角色,但不能把责任写成模糊的“AI 团队”。如果要移交,至少交付代码与配置、架构图、依赖清单、评测集、运行手册、告警、权限、已知限制和待办风险。
上线检查清单
- 业务目标、基线、指标口径和负责人已确认
- 数据流、权限、外部依赖和风险评审已完成
- 代表性评测集包含正常、边界、恶意和故障样本
- 关键失败有确定性保护、人工路径或安全降级
- 模型、Prompt、检索和工具配置可追踪、可回滚
- 监控覆盖质量、可靠性、费用、安全和用户反馈
- 灰度、回滚、停止开关和事故处置手册已演练
- 值班、升级、供应商支持和业务沟通责任已明确
- 用户告知、培训、反馈和退出渠道已经上线
- 上线后的复盘日期和继续/停止标准已经排期
参考框架
本页的六个门槛是本指南整理的交付框架,不是认证标准。可结合 NIST 的自愿性 AI Risk Management Framework 和 Generative AI Profile(NIST AI 600-1) 做 Govern、Map、Measure、Manage 复核。NIST 正在修订 AI RMF 1.0,使用时应核对最新版。最近核验:2026-08-05。