AI Evaluation Pipeline:四种评估闭环
比较离线回归、Shadow、在线实验与 Production Feedback 四种 evaluation topology。
一个 eval score 不能代表 production quality。上线前需要可复现的离线回归,上线时需要不影响用户的 shadow 观察,变更决策需要受控实验,上线后还要把真实 failure 变成新的测试样本。
四种闭环
| 架构 | 数据路径 | State owner | 回答的问题 | 风险 |
|---|---|---|---|---|
| Offline Regression | versioned dataset → candidate → graders → report | dataset + run manifest | 新版本是否破坏已知能力 | 数据集过拟合、泄漏 |
| Shadow Evaluation | live copy → candidate → compare,结果不返回用户 | shadow log | 真实流量上会怎样 | 隐私和双倍推理成本 |
| Online Experiment | assignment → A/B → outcome join | experiment assignment | 用户结果是否改善 | 干扰、样本偏差、错误指标 |
| Feedback Flywheel | production trace → triage → labelled case → dataset | governed case store | 新 failure 怎样进入下一轮 | 错误反馈污染数据集 |