MLOps 平台组成
数据层
S3 数据湖
Feature Store
Ground Truth 标注
数据版本管理
开发层
Studio Notebook
实验跟踪
超参调优
分布式训练
流水线
SageMaker Pipelines
模型注册表
自动评测门禁
审批流程
服务层
实时推理端点
Serverless 推理
异步推理
批量转换
监控层
Model Monitor
数据漂移告警
预测质量追踪
自动重训触发
我们重点解决的四个问题
- 训练与推理特征不一致:用 Feature Store 统一特征定义,离线在线共用一套逻辑
- 模型无法追溯:模型注册表记录训练数据版本、代码提交、超参与评测结果,随时可复现
- 上线后静默退化:Model Monitor 持续对比输入分布与预测分布,漂移超阈值自动告警
- 推理成本过高:按流量特征选端点类型,波动大的用 Serverless,稳定的用多模型端点共享实例
推理端点类型选择
| 类型 | 计费方式 | 冷启动 | 适用场景 |
|---|---|---|---|
| 实时端点 | 按实例小时 | 无 | 延迟敏感、流量稳定的线上推理 |
| Serverless 推理 | 按调用与时长 | 有(秒级) | 流量波动大、有空闲期的场景 |
| 异步推理 | 按实例小时(可缩到 0) | 有 | 大文件处理、耗时较长的推理 |
| 批量转换 | 按作业时长 | 不适用 | 离线批量打分,如每日全量用户评分 |
| 多模型端点 | 按实例小时 | 首次加载有 | 大量小模型共享实例,显著降本 |